跳到主要内容
← 交付方法总览
方法论可泛化原则

指标体系

横切

指标的用途是支撑决策,不是用来汇报。这份文档区分哪些指标能反映真实质量、哪些指标容易被优化到失真,以及每类指标对应的是什么决定。

什么时候需要它

  • 指标全绿但用户仍然不满意
  • 需要决定上线放行、扩量或回滚,但手上的数字说明不了问题

核心内容

它决定什么

  • 每个指标必须绑定一个决定

    如果一个数字变好变坏都不改变任何行动,它就不该出现在看板上。先问「这个数字变了我会做什么」,再决定要不要采集。

  • 两个最典型的陷阱指标

    一是通过率——评判标准放宽就能拉高;二是平均响应质量——它会把少量严重失败平均掉,而严重失败往往才是真正的业务风险。

  • 看分布而不只看均值

    对用户来说,十次里有一次严重错答的体验,远差于十次都平庸。尾部表现要单独看,不能被均值吸收。

  • 线下指标与线上指标要能对上

    Eval 上的分数与生产表现如果长期背离,说明用例集不代表真实流量分布,该修的是用例集而不是解释差异。

  • 指标变动要能归因

    一次波动到底来自模型变更、用例变更、判官口径变更还是真实流量变化,必须能分清。分不清的指标无法用于决策。

怎么判断它真的到位

  • 每个在用指标都能说出它服务于哪个具体决定
  • 严重失败单独统计,没有被平均值吸收
  • 最近一次指标变动能归因到具体原因

常见误区

  • 把通过率当成质量本身,忽略评判标准同时被放宽
  • 只报均值不看尾部,严重错答被稀释成小数点后的波动
  • 看板越做越大,但没有一个数字真的改变过决定

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。