← 交付方法总览
质量体系可泛化原则
判官校准(Judge Calibration)
质量学习
LLM 判官(LLM-as-Judge)不是一个「装上就可信」的组件。它本身是一个概率系统,会漂移、会有偏见、会被自己的措辞锚定。判官在被信任之前必须先被考核;被信任之后必须被持续抽查。 本文给出一套「先考核再上岗、上岗后持续校准」的操作方法,让判官分数可以作为验收信号,而不是又一个需要人去复核的黑盒。
这套方法怎么落到你的项目
这是我们交付 AI 业务系统的公开方法论骨架。真正落地时,从 生产就绪审查与路线图 入手,或先用 上线前自检 定位薄弱环节。
