← 交付方法总览
打分卡阶段 8 · 9 · 10 · 11 · 12可泛化原则
Eval 就绪打分卡 Eval-Readiness Scorecard
质量
确认质量体系是否已经具备判断能力:有没有代表真实分布的用例集、判官校准过没有、噪声测过没有、门禁接上没有。这四项不全就进入迭代,改动的效果无从判断。
什么时候需要它
- 准备进入以质量为目标的迭代阶段
- 已经在迭代但说不清每次改动是否真的改善了质量
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
用例集代表真实分布
主体来自真实语料,分层组织,包含应当拒答的场景。全是自己编的示范句,测出来的分数没有预测力。
判官已校准
与人工标注基准对照过,一致性被量化,假通过被单独关注。未校准的判官分数不构成证据。
噪声基线已实测
知道复跑波动范围有多大,阈值建立在这个范围之上。没有噪声基线就设阈值,只能靠猜。
分档策略已确定
什么改动跑哪一档、各档跑多久、由谁触发,都已明确。否则要么全跑到没人愿意跑,要么只跑最便宜的那档。
结果可追溯可对比
每次结果记录了用例集版本、判官版本、模型版本。三者任一变化而不记录,跨期比较就是错的。
有人对用例集负责
用例集需要持续吸收生产失败、退役过时用例。没有明确维护者的用例集会在几个月内与真实流量脱节,而它给出的分数仍然被当成依据。
怎么判断它真的到位
- 用例集主体来自真实语料,且包含拒答用例
- 判官与人工基准的一致性有量化结果
- 有实测噪声范围,门禁阈值高于它
Exit Gate · 放行条件
原型跑通且 Eval 基线可复现
常见误区
- 用例全部自编,线下全绿线上照错
- 判官没校准就用它的分数做发布决定
- 改了判官提示词却继续与历史分数横向比较
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
