← 交付方法总览
质量体系可泛化原则
生产质量监控
质量学习
线下用例集永远覆盖不全真实流量。生产监测的作用是发现线下没见过的失败,并把它们变成新的用例——这是学习闭环在生产侧的入口。
什么时候需要它
- 系统已经上线,但除了报错日志之外看不到质量情况
- 用户偶尔反馈问题,但无法判断是个例还是普遍现象
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
先采可确定性判定的信号
拒答率、工具失败率、超时率、格式违规率、引用缺失率。这些不需要判官就能统计,是最便宜也最先该有的监测。
抽样送判官
全量语义评分不现实,按比例抽样即可发现趋势。抽样要覆盖不同场景和不同时间段,避免只抽到简单流量。
关注分布尾部
少量严重错答造成的业务风险,往往高于大量平庸回答。监测要能把尾部单独拎出来,而不是被均值吸收。
线上线下对账
定期用生产样本回灌线下用例集,检查两者是否给出一致结论。长期背离说明用例集已经不代表真实分布。
监测要连着动作
每条告警要对应一个明确响应:回滚、降级、人工接管还是记录待办。没有响应动作的告警最终会被忽略。
留痕遵守数据最小化
监测需要的是判定结果和分类标签,不是原始对话内容。涉及个人信息的场景更要在采集阶段就做减法。
怎么判断它真的到位
- 至少有一组不依赖判官的确定性质量信号在跑
- 生产失败有固定路径变成线下用例
- 每条告警都对应一个已定义的响应动作
常见误区
- 只监控错误率和延迟,回答质量完全没有信号
- 全量存原始对话,既贵又带来合规负担
- 告警长期无人处理,最终被静音
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
