← 交付方法总览
质量体系可泛化原则
失败分类
质量
把失败按责任层分类,让每个失败都能落到架构中的一个具体位置。这是修复的第一步:不先归位就动手,改的往往是最容易改的那一层,而不是真正出问题的那一层。
什么时候需要它
- 一批失败样本摆在面前,不知道从哪儿开始修
- 同类问题反复出现,说明之前的修复没有落在根因上
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
数据层
源头数据缺失、过期、口径与业务理解不一致。这类失败改任何下游都无效,必须回到数据源或口径确认。
检索层
相关内容存在但没被召回,或召回了不相关内容。表现为回答空泛或答非所问,判据是人工检查检索结果本身而不是最终回答。
工具层
工具没被调用、参数构造错误、返回值解析失败、失败没有被正确处理。这类失败通常能用确定性断言精确捕获。
编排层
步骤顺序错误、条件分支走错、多轮状态丢失、循环没有终止条件。表现常常像是模型不听话,实际是流程设计问题。
提示层
指令歧义、约束互相冲突、示例被照抄。修复方式优先是把约束下沉成代码,其次才是改措辞。
模型层
确实超出当前模型能力的推理或长上下文任务。这是最后才该归到的一层,因为它最难改也最容易被当成挡箭牌。
归位顺序自上而下
从数据往模型逐层排除。跳过前面几层直接归因到模型,是最常见的误判,代价是换了模型问题依旧。
怎么判断它真的到位
- 每个已修复的失败都记录了它归属的责任层
- 归到模型层的失败占比不高,且每条都有排除前几层的依据
- 同一责任层的重复失败有对应的护栏,而不是逐个手修
常见误区
- 默认归因到模型能力,换模型后问题原样保留
- 在提示层反复调措辞,掩盖了检索层的召回问题
- 只修单个样本不看类别,同类失败持续冒出
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
