← 交付方法总览
质量体系可泛化原则
发布质量门
交付质量
发布门禁把「能不能上线」变成一组机器可判定的条件。它的价值不在于严格,而在于不可绕过——一个可以靠口头说明跳过的门禁,等于不存在。
什么时候需要它
- 准备第一次把 Agent 放到真实用户面前
- 上线决策每次都靠临场讨论,结论不稳定
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
结构层必须真实通过
确定性契约不允许有容忍度。字段、单位、权限、接口这些判据要么通过要么不通过,不存在阈值。
行为层用统计阈值
语义评分有波动,门禁应当基于足够样本量的统计结果,且阈值要参考实测噪声水平而不是拍脑袋。
安全用例单独设门
越权、注入、有害内容这几类不能与普通用例混在一个总分里,因为它们不能被高分样本平均掉。
对比基线而不只看绝对值
本次结果要与上一版对比,退化超过一定幅度就要解释。只看绝对分会让缓慢退化长期不被发现。
标准变更要与结果分开记录
如果这次调整了阈值或评分说明,必须显式记录,否则分数变化会被误读成质量变化。
绕过要留痕
确实需要带风险发布时,应当显式记录是谁批准、绕过了哪条门禁、后续如何补。默默跳过是最坏的情况。
怎么判断它真的到位
- 门禁在流水线里是强制的,不能靠口头说明跳过
- 行为层阈值有实测噪声作为依据
- 最近一次绕过有记录和补救计划
常见误区
- 门禁标准随每次发布调整,逐渐失去意义
- 用一个总分掩盖安全类用例的失败
- 只看本次绝对分,缓慢退化持续累积无人察觉
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
