← 交付方法总览
方法论可泛化原则
质量模型
质量
这套方法最核心的一条判断:结构层用确定性契约,LLM 行为层用 Eval。给一个问题选错质量引擎,是质量崩塌最常见的根因——用 Eval 去测本该逐字比对的字段,或者用断言去测本质上有多种正确表达的回答,两种都测不出真相。
什么时候需要它
- 写测试时不确定该断言什么,或者断言总是又脆又漏
- 通过率一直很好但用户仍然在报错
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
先问一个二分问题
这个东西的正确性能不能被逐字比对或重新计算判定?能,就属于结构层,用确定性契约;不能,就属于行为层,用 Eval。
结构层:必须真实通过
字段名、枚举值、单位、数值计算、接口契约、权限边界。判据是确定的,测试必须真实退出成功,不允许用容忍度掩盖失败。
行为层:判官加统计阈值
回答是否切题、是否有据、语气是否合适、是否正确拒答。这类问题没有唯一正确字符串,只能用评分维度加样本统计来判定,且要接受一定波动。
第一条反直觉规律:规则越多遵从越差
Prompt 里的约束不是叠加生效的。规则数量上去之后,单条规则的遵从率会下降。能用代码固化的约束就不要留在 Prompt 里。
第二条反直觉规律:例子会被照抄
Prompt 里写的示例值、示例实体、示例格式,会以远超预期的频率原样出现在输出里。示例要么用明显不可能被误用的占位,要么干脆不给。
通过率不是目标
在评判标准被削弱的情况下提高通过率毫无意义。判官口径放宽、用例难度下调、失败样本被移出集合,都会让指标好看而质量变差。
怎么判断它真的到位
- 每一类断言都能说清它属于结构层还是行为层,以及为什么
- 结构层测试是真实通过的,没有被跳过或标记为已知失败
- 评判标准的任何放宽都有记录,指标变化能与标准变化区分开
常见误区
- 用判官去评判本该逐字比对的字段,漏掉真实的格式错误
- 用严格字符串断言去测开放式回答,测试脆到无法维护
- 靠往 Prompt 里继续加规则来解决遵从率问题,越加越差
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
