跳到主要内容
← 交付方法总览
质量体系可泛化原则

稳定性与噪声(Stability & Noise)

质量

同样的输入跑两次,结果可能不同。在噪声被量化之前,任何分数变化都无法归因——你不知道它是真实退化还是随机波动。这份文档讲怎么把噪声测出来,以及怎么在有噪声的前提下做判断。

什么时候需要它

  • 分数在不同批次之间跳动,说不清是不是真的变差了
  • 要给发布门禁设阈值,但不知道设多少合理

核心内容

它决定什么

  • 先测复跑波动

    同一套用例、同一个版本、连续跑若干轮,记录分数的分布范围。这个范围就是噪声底噪,小于它的变化不构成证据。

  • 阈值要建立在噪声之上

    门禁阈值如果落在噪声范围内,会同时产生大量误报和漏报。阈值必须明显高于实测波动幅度。

  • 区分噪声与不稳定

    轻微评分波动是噪声,同一输入时而正确时而完全错误是系统不稳定,后者是要修的缺陷而不是要容忍的波动。

  • 减少不必要的随机性

    能固定的就固定:采样参数、检索顺序、时间相关输入。留下的随机性应当是有意为之,而不是无人管的默认值。

  • 样本量决定可判定性

    样本太少时,几个用例的偶然翻转就能造成显著的分数变化。要判定小幅差异,就必须有相应的样本量。

怎么判断它真的到位

  • 有一份实测的复跑波动范围,且门禁阈值高于它
  • 存在时而正确时而完全错误的用例时,它被当成缺陷处理
  • 随机性来源被盘点过,不必要的已经固定

常见误区

  • 把每次小幅波动都当成质量变化去追查
  • 阈值设在噪声范围内,流水线频繁红绿交替最终被忽略
  • 样本量不足却对小数点后的差异下结论

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。