跳到主要内容
← 交付方法总览
质量体系可泛化原则

发布质量门

交付质量

发布门禁把「能不能上线」变成一组机器可判定的条件。它的价值不在于严格,而在于不可绕过——一个可以靠口头说明跳过的门禁,等于不存在。

什么时候需要它

  • 准备第一次把 Agent 放到真实用户面前
  • 上线决策每次都靠临场讨论,结论不稳定

核心内容

它决定什么

  • 结构层必须真实通过

    确定性契约不允许有容忍度。字段、单位、权限、接口这些判据要么通过要么不通过,不存在阈值。

  • 行为层用统计阈值

    语义评分有波动,门禁应当基于足够样本量的统计结果,且阈值要参考实测噪声水平而不是拍脑袋。

  • 安全用例单独设门

    越权、注入、有害内容这几类不能与普通用例混在一个总分里,因为它们不能被高分样本平均掉。

  • 对比基线而不只看绝对值

    本次结果要与上一版对比,退化超过一定幅度就要解释。只看绝对分会让缓慢退化长期不被发现。

  • 标准变更要与结果分开记录

    如果这次调整了阈值或评分说明,必须显式记录,否则分数变化会被误读成质量变化。

  • 绕过要留痕

    确实需要带风险发布时,应当显式记录是谁批准、绕过了哪条门禁、后续如何补。默默跳过是最坏的情况。

怎么判断它真的到位

  • 门禁在流水线里是强制的,不能靠口头说明跳过
  • 行为层阈值有实测噪声作为依据
  • 最近一次绕过有记录和补救计划

常见误区

  • 门禁标准随每次发布调整,逐渐失去意义
  • 用一个总分掩盖安全类用例的失败
  • 只看本次绝对分,缓慢退化持续累积无人察觉

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。