跳到主要内容
← 交付方法总览
方法论可泛化原则

质量模型

质量

这套方法最核心的一条判断:结构层用确定性契约,LLM 行为层用 Eval。给一个问题选错质量引擎,是质量崩塌最常见的根因——用 Eval 去测本该逐字比对的字段,或者用断言去测本质上有多种正确表达的回答,两种都测不出真相。

什么时候需要它

  • 写测试时不确定该断言什么,或者断言总是又脆又漏
  • 通过率一直很好但用户仍然在报错

核心内容

它决定什么

  • 先问一个二分问题

    这个东西的正确性能不能被逐字比对或重新计算判定?能,就属于结构层,用确定性契约;不能,就属于行为层,用 Eval。

  • 结构层:必须真实通过

    字段名、枚举值、单位、数值计算、接口契约、权限边界。判据是确定的,测试必须真实退出成功,不允许用容忍度掩盖失败。

  • 行为层:判官加统计阈值

    回答是否切题、是否有据、语气是否合适、是否正确拒答。这类问题没有唯一正确字符串,只能用评分维度加样本统计来判定,且要接受一定波动。

  • 第一条反直觉规律:规则越多遵从越差

    Prompt 里的约束不是叠加生效的。规则数量上去之后,单条规则的遵从率会下降。能用代码固化的约束就不要留在 Prompt 里。

  • 第二条反直觉规律:例子会被照抄

    Prompt 里写的示例值、示例实体、示例格式,会以远超预期的频率原样出现在输出里。示例要么用明显不可能被误用的占位,要么干脆不给。

  • 通过率不是目标

    在评判标准被削弱的情况下提高通过率毫无意义。判官口径放宽、用例难度下调、失败样本被移出集合,都会让指标好看而质量变差。

怎么判断它真的到位

  • 每一类断言都能说清它属于结构层还是行为层,以及为什么
  • 结构层测试是真实通过的,没有被跳过或标记为已知失败
  • 评判标准的任何放宽都有记录,指标变化能与标准变化区分开

常见误区

  • 用判官去评判本该逐字比对的字段,漏掉真实的格式错误
  • 用严格字符串断言去测开放式回答,测试脆到无法维护
  • 靠往 Prompt 里继续加规则来解决遵从率问题,越加越差

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。