← 交付方法总览
质量体系可泛化原则
Eval 总策略
质量
Eval 不是一套跑法,而是三档:离线 mock、真实调用但只跑规则、真实调用加语义判官。三档的成本、速度和证明力都不同,用在不同的场合。用错档次,要么慢到没人跑,要么快到什么都证明不了。
什么时候需要它
- Eval 太慢或太贵,开发过程中没人愿意跑
- 本地全绿但发布后仍然出问题
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
第一档:离线 mock
不调用真实模型,用固定响应验证编排、解析、格式与错误路径。亚秒级,可以在每次提交时跑。它证明的是管线正确,不是回答正确。
第二档:真实调用 + 规则判定
调真实模型,但只做确定性判定:格式、字段、引用是否存在、是否触发了不该触发的工具。成本可控,能发现 mock 层看不见的真实行为问题。
第三档:真实调用 + 语义判官
最贵也最慢,用于发布前和重大变更后。它是唯一能回答「回答质量是否退化」的档次,因此不能因为慢就长期跳过。
按变更类型选档
改编排逻辑跑第一档就够;改检索或工具要跑第二档;改模型、提示词或知识库必须跑第三档。这条对应「模型变更是生产变更」。
三档要用同一套用例
用例集共享、判定方式分档,才能保证三档结果可比。各档各有一套用例,会导致低档全绿高档才暴雷。
怎么判断它真的到位
- 第一档快到可以在每次提交时跑,且实际在跑
- 有明确规则说明什么改动触发哪一档
- 最近一次模型或提示词变更跑过第三档并留下结果
常见误区
- 只有最贵的一档,结果是几乎从不跑
- 只有 mock 档,管线一直绿而回答质量无人知晓
- 各档用例集不一致,低档结果对高档没有预测力
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
