← 交付方法总览
打分卡阶段 13 · 14 · 15 · 16可泛化原则
生产就绪打分卡 Production-Readiness Scorecard
交付质量
上线放行的依据。它检查的不是功能是否完成,而是这套系统在真实用户、真实数据、真实故障面前能不能撑住:权限收敛了吗、安全测过吗、出问题看得见吗、能不能降级和回滚。
什么时候需要它
- 准备把 Agent 放到真实用户面前
- 已经上线但缺乏系统性的运行保障检查
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
权限边界已收敛并验证
实际权限与设计一致,有可跑出来的验证结果,而不是文档里的承诺。
安全用例已通过
越权、提示注入、诱导编造、副作用操作四类都有用例并通过,且这些用例进了发布前必跑集合。
监测能看见质量
除了错误率和延迟,还有拒答率、工具失败率、格式违规率这类质量信号,以及抽样语义评分。
降级路径已定义
模型不可用、检索失败、工具超时各自的降级行为是什么,且这些路径被测试过而不只是写在设计里。
回滚可执行
包括代码、提示词、模型版本和知识库版本的回滚。提示词和知识库最容易被漏掉,因为它们不走常规发布流程。
人工升级路径畅通
用户在什么情况下能转到人工、由谁接、多久响应。高风险动作保持人工确认可以是正确的终态。
运营责任已落实
上线之后谁看监测、谁处理告警、谁负责把生产失败回流成用例。没有落实到人的运营等于没有运营。
怎么判断它真的到位
- 四类安全用例全部通过,且在必跑集合里
- 提示词与知识库的回滚被实际演练过
- 监测告警各自对应一个已定义的响应动作和责任人
Exit Gate · 放行条件
真实用户试点达标、问题可控
常见误区
- 只回滚代码,忘了提示词和知识库也是生产变更
- 上线后无人看质量信号,问题靠用户投诉才发现
- 人工升级路径写在文档里,实际没人接
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
