跳到主要内容
← 交付方法总览
打分卡阶段 8 · 9 · 10 · 11 · 12可泛化原则

Eval 就绪打分卡 Eval-Readiness Scorecard

质量

确认质量体系是否已经具备判断能力:有没有代表真实分布的用例集、判官校准过没有、噪声测过没有、门禁接上没有。这四项不全就进入迭代,改动的效果无从判断。

什么时候需要它

  • 准备进入以质量为目标的迭代阶段
  • 已经在迭代但说不清每次改动是否真的改善了质量

核心内容

它决定什么

  • 用例集代表真实分布

    主体来自真实语料,分层组织,包含应当拒答的场景。全是自己编的示范句,测出来的分数没有预测力。

  • 判官已校准

    与人工标注基准对照过,一致性被量化,假通过被单独关注。未校准的判官分数不构成证据。

  • 噪声基线已实测

    知道复跑波动范围有多大,阈值建立在这个范围之上。没有噪声基线就设阈值,只能靠猜。

  • 分档策略已确定

    什么改动跑哪一档、各档跑多久、由谁触发,都已明确。否则要么全跑到没人愿意跑,要么只跑最便宜的那档。

  • 结果可追溯可对比

    每次结果记录了用例集版本、判官版本、模型版本。三者任一变化而不记录,跨期比较就是错的。

  • 有人对用例集负责

    用例集需要持续吸收生产失败、退役过时用例。没有明确维护者的用例集会在几个月内与真实流量脱节,而它给出的分数仍然被当成依据。

怎么判断它真的到位

  • 用例集主体来自真实语料,且包含拒答用例
  • 判官与人工基准的一致性有量化结果
  • 有实测噪声范围,门禁阈值高于它

Exit Gate · 放行条件

原型跑通且 Eval 基线可复现

常见误区

  • 用例全部自编,线下全绿线上照错
  • 判官没校准就用它的分数做发布决定
  • 改了判官提示词却继续与历史分数横向比较

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。