跳到主要内容
← 交付方法总览
质量体系可泛化原则

Eval 总策略

质量

Eval 不是一套跑法,而是三档:离线 mock、真实调用但只跑规则、真实调用加语义判官。三档的成本、速度和证明力都不同,用在不同的场合。用错档次,要么慢到没人跑,要么快到什么都证明不了。

什么时候需要它

  • Eval 太慢或太贵,开发过程中没人愿意跑
  • 本地全绿但发布后仍然出问题

核心内容

它决定什么

  • 第一档:离线 mock

    不调用真实模型,用固定响应验证编排、解析、格式与错误路径。亚秒级,可以在每次提交时跑。它证明的是管线正确,不是回答正确。

  • 第二档:真实调用 + 规则判定

    调真实模型,但只做确定性判定:格式、字段、引用是否存在、是否触发了不该触发的工具。成本可控,能发现 mock 层看不见的真实行为问题。

  • 第三档:真实调用 + 语义判官

    最贵也最慢,用于发布前和重大变更后。它是唯一能回答「回答质量是否退化」的档次,因此不能因为慢就长期跳过。

  • 按变更类型选档

    改编排逻辑跑第一档就够;改检索或工具要跑第二档;改模型、提示词或知识库必须跑第三档。这条对应「模型变更是生产变更」。

  • 三档要用同一套用例

    用例集共享、判定方式分档,才能保证三档结果可比。各档各有一套用例,会导致低档全绿高档才暴雷。

怎么判断它真的到位

  • 第一档快到可以在每次提交时跑,且实际在跑
  • 有明确规则说明什么改动触发哪一档
  • 最近一次模型或提示词变更跑过第三档并留下结果

常见误区

  • 只有最贵的一档,结果是几乎从不跑
  • 只有 mock 档,管线一直绿而回答质量无人知晓
  • 各档用例集不一致,低档结果对高档没有预测力

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。