跳到主要内容
← 交付方法总览
质量体系可泛化原则

quality-system/ 质量与 Eval 体系索引

质量

质量体系的总入口:说明这套东西由哪些部分组成、彼此什么关系、遇到具体问题该从哪份文件进入。它本身不给判据,只负责把人送到正确的位置。

什么时候需要它

  • 第一次搭 Agent 的质量体系,不知道从哪一层开始
  • 已经有测试但不确定覆盖是否完整

核心内容

它决定什么

  • 先分层再选工具

    结构层用确定性契约、行为层用 Eval。这条判断在所有具体手段之前,选错了后面全是白做。

  • 用例与判官是两件事

    用例设计决定测什么,判官校准决定判得准不准。判官没校准时,用例集再全也只是把不可信的分数算得更精确。

  • 线下与线上要闭环

    发布门禁负责挡住退化,生产监测负责发现线下没覆盖到的失败,两者之间要有回流路径,生产失败要变成新的用例。

  • 稳定性是前提条件

    在噪声没有量化之前,任何分数变化都无法归因。先测清楚复跑波动,再谈阈值。

  • 安全与验收各有专门方法

    红队与安全评测覆盖的是被诱导后的最坏行为,验收覆盖的是业务是否认可。两者都不能被通用 Eval 顺带覆盖。

怎么判断它真的到位

  • 能说出当前质量体系缺的是哪一层,而不是笼统地说测试不够
  • 结构层与行为层的验证分开组织,不混在同一批断言里
  • 生产失败有明确的回流路径,能变成线下用例

常见误区

  • 直接从写测试开始,跳过分层判断
  • 把所有验证塞进一个大集合,失败时无法定位是哪一层的问题
  • 线上线下两套指标各说各话,从不对账

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。