← 交付方法总览
质量体系可泛化原则
quality-system/ 质量与 Eval 体系索引
质量
质量体系的总入口:说明这套东西由哪些部分组成、彼此什么关系、遇到具体问题该从哪份文件进入。它本身不给判据,只负责把人送到正确的位置。
什么时候需要它
- 第一次搭 Agent 的质量体系,不知道从哪一层开始
- 已经有测试但不确定覆盖是否完整
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
先分层再选工具
结构层用确定性契约、行为层用 Eval。这条判断在所有具体手段之前,选错了后面全是白做。
用例与判官是两件事
用例设计决定测什么,判官校准决定判得准不准。判官没校准时,用例集再全也只是把不可信的分数算得更精确。
线下与线上要闭环
发布门禁负责挡住退化,生产监测负责发现线下没覆盖到的失败,两者之间要有回流路径,生产失败要变成新的用例。
稳定性是前提条件
在噪声没有量化之前,任何分数变化都无法归因。先测清楚复跑波动,再谈阈值。
安全与验收各有专门方法
红队与安全评测覆盖的是被诱导后的最坏行为,验收覆盖的是业务是否认可。两者都不能被通用 Eval 顺带覆盖。
怎么判断它真的到位
- 能说出当前质量体系缺的是哪一层,而不是笼统地说测试不够
- 结构层与行为层的验证分开组织,不混在同一批断言里
- 生产失败有明确的回流路径,能变成线下用例
常见误区
- 直接从写测试开始,跳过分层判断
- 把所有验证塞进一个大集合,失败时无法定位是哪一层的问题
- 线上线下两套指标各说各话,从不对账
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
