跳到主要内容
← 交付方法总览
质量体系可泛化原则

判官校准(Judge Calibration)

质量学习

判官在被校准之前,它给出的分数不构成证据。校准的目标是让判官的判断与人的判断在同一批样本上足够一致,并且这种一致性可以被重新验证。

什么时候需要它

  • 开始用模型判官打分,还没验证过它判得准不准
  • 分数变化解释不清,怀疑是判官口径漂了

核心内容

它决定什么

  • 先有人工标注基准

    取一批样本由人按同一套维度标注,作为判官的对照集。没有人工基准,就无法判断判官是准的还是自洽地错着。

  • 量化一致性

    关注判官与人在同一批样本上的一致程度,尤其是在临界样本上的表现。整体一致但临界全错,说明判官学到的是简单特征。

  • 重点看假通过

    判官把差答案判为好,比把好答案判为差危险得多,因为前者会静默地放行退化。校准时对假通过给予更高关注。

  • 判官版本要固定并记录

    判官模型、提示词、评分说明任何一处变化,都会让前后分数不可比。这些必须像代码一样纳入版本管理。

  • 定期重校准

    模型换代、用例集扩展、评分说明修订之后都要重新校准。长期不校准的判官会悄悄漂移,而指标看上去一切正常。

怎么判断它真的到位

  • 存在一份人工标注基准集,且判官与它的一致性被量化过
  • 判官的模型与提示词版本被记录,跨期分数可比
  • 假通过被单独统计,而不是混在总体一致率里

常见误区

  • 直接上判官打分,从未与人工判断对照过
  • 改了评分说明却继续与历史分数横向比较
  • 只看总体一致率,掩盖了临界样本上的系统性偏松

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。