← 交付方法总览
方法论可泛化原则
指标体系
横切
指标的用途是支撑决策,不是用来汇报。这份文档区分哪些指标能反映真实质量、哪些指标容易被优化到失真,以及每类指标对应的是什么决定。
什么时候需要它
- 指标全绿但用户仍然不满意
- 需要决定上线放行、扩量或回滚,但手上的数字说明不了问题
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
每个指标必须绑定一个决定
如果一个数字变好变坏都不改变任何行动,它就不该出现在看板上。先问「这个数字变了我会做什么」,再决定要不要采集。
两个最典型的陷阱指标
一是通过率——评判标准放宽就能拉高;二是平均响应质量——它会把少量严重失败平均掉,而严重失败往往才是真正的业务风险。
看分布而不只看均值
对用户来说,十次里有一次严重错答的体验,远差于十次都平庸。尾部表现要单独看,不能被均值吸收。
线下指标与线上指标要能对上
Eval 上的分数与生产表现如果长期背离,说明用例集不代表真实流量分布,该修的是用例集而不是解释差异。
指标变动要能归因
一次波动到底来自模型变更、用例变更、判官口径变更还是真实流量变化,必须能分清。分不清的指标无法用于决策。
怎么判断它真的到位
- 每个在用指标都能说出它服务于哪个具体决定
- 严重失败单独统计,没有被平均值吸收
- 最近一次指标变动能归因到具体原因
常见误区
- 把通过率当成质量本身,忽略评判标准同时被放宽
- 只报均值不看尾部,严重错答被稀释成小数点后的波动
- 看板越做越大,但没有一个数字真的改变过决定
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
