← 交付方法总览
质量体系可泛化原则
稳定性与噪声(Stability & Noise)
质量
同样的输入跑两次,结果可能不同。在噪声被量化之前,任何分数变化都无法归因——你不知道它是真实退化还是随机波动。这份文档讲怎么把噪声测出来,以及怎么在有噪声的前提下做判断。
什么时候需要它
- 分数在不同批次之间跳动,说不清是不是真的变差了
- 要给发布门禁设阈值,但不知道设多少合理
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
先测复跑波动
同一套用例、同一个版本、连续跑若干轮,记录分数的分布范围。这个范围就是噪声底噪,小于它的变化不构成证据。
阈值要建立在噪声之上
门禁阈值如果落在噪声范围内,会同时产生大量误报和漏报。阈值必须明显高于实测波动幅度。
区分噪声与不稳定
轻微评分波动是噪声,同一输入时而正确时而完全错误是系统不稳定,后者是要修的缺陷而不是要容忍的波动。
减少不必要的随机性
能固定的就固定:采样参数、检索顺序、时间相关输入。留下的随机性应当是有意为之,而不是无人管的默认值。
样本量决定可判定性
样本太少时,几个用例的偶然翻转就能造成显著的分数变化。要判定小幅差异,就必须有相应的样本量。
怎么判断它真的到位
- 有一份实测的复跑波动范围,且门禁阈值高于它
- 存在时而正确时而完全错误的用例时,它被当成缺陷处理
- 随机性来源被盘点过,不必要的已经固定
常见误区
- 把每次小幅波动都当成质量变化去追查
- 阈值设在噪声范围内,流水线频繁红绿交替最终被忽略
- 样本量不足却对小数点后的差异下结论
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
