跳到主要内容
← 交付方法总览
打分卡阶段 13 · 14 · 15 · 16可泛化原则

生产就绪打分卡 Production-Readiness Scorecard

交付质量

上线放行的依据。它检查的不是功能是否完成,而是这套系统在真实用户、真实数据、真实故障面前能不能撑住:权限收敛了吗、安全测过吗、出问题看得见吗、能不能降级和回滚。

什么时候需要它

  • 准备把 Agent 放到真实用户面前
  • 已经上线但缺乏系统性的运行保障检查

核心内容

它决定什么

  • 权限边界已收敛并验证

    实际权限与设计一致,有可跑出来的验证结果,而不是文档里的承诺。

  • 安全用例已通过

    越权、提示注入、诱导编造、副作用操作四类都有用例并通过,且这些用例进了发布前必跑集合。

  • 监测能看见质量

    除了错误率和延迟,还有拒答率、工具失败率、格式违规率这类质量信号,以及抽样语义评分。

  • 降级路径已定义

    模型不可用、检索失败、工具超时各自的降级行为是什么,且这些路径被测试过而不只是写在设计里。

  • 回滚可执行

    包括代码、提示词、模型版本和知识库版本的回滚。提示词和知识库最容易被漏掉,因为它们不走常规发布流程。

  • 人工升级路径畅通

    用户在什么情况下能转到人工、由谁接、多久响应。高风险动作保持人工确认可以是正确的终态。

  • 运营责任已落实

    上线之后谁看监测、谁处理告警、谁负责把生产失败回流成用例。没有落实到人的运营等于没有运营。

怎么判断它真的到位

  • 四类安全用例全部通过,且在必跑集合里
  • 提示词与知识库的回滚被实际演练过
  • 监测告警各自对应一个已定义的响应动作和责任人

Exit Gate · 放行条件

真实用户试点达标、问题可控

常见误区

  • 只回滚代码,忘了提示词和知识库也是生产变更
  • 上线后无人看质量信号,问题靠用户投诉才发现
  • 人工升级路径写在文档里,实际没人接

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。