← 交付方法总览
质量体系可泛化原则
判官校准(Judge Calibration)
质量学习
判官在被校准之前,它给出的分数不构成证据。校准的目标是让判官的判断与人的判断在同一批样本上足够一致,并且这种一致性可以被重新验证。
什么时候需要它
- 开始用模型判官打分,还没验证过它判得准不准
- 分数变化解释不清,怀疑是判官口径漂了
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
先有人工标注基准
取一批样本由人按同一套维度标注,作为判官的对照集。没有人工基准,就无法判断判官是准的还是自洽地错着。
量化一致性
关注判官与人在同一批样本上的一致程度,尤其是在临界样本上的表现。整体一致但临界全错,说明判官学到的是简单特征。
重点看假通过
判官把差答案判为好,比把好答案判为差危险得多,因为前者会静默地放行退化。校准时对假通过给予更高关注。
判官版本要固定并记录
判官模型、提示词、评分说明任何一处变化,都会让前后分数不可比。这些必须像代码一样纳入版本管理。
定期重校准
模型换代、用例集扩展、评分说明修订之后都要重新校准。长期不校准的判官会悄悄漂移,而指标看上去一切正常。
怎么判断它真的到位
- 存在一份人工标注基准集,且判官与它的一致性被量化过
- 判官的模型与提示词版本被记录,跨期分数可比
- 假通过被单独统计,而不是混在总体一致率里
常见误区
- 直接上判官打分,从未与人工判断对照过
- 改了评分说明却继续与历史分数横向比较
- 只看总体一致率,掩盖了临界样本上的系统性偏松
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
