← Playbook 索引
Playbook阶段 9可泛化原则
Eval 驱动开发(Eval-Driven Development)
交付
把日常开发变成可归因的质量循环:一次处理一个失败,改对责任层,用最小 Case 快速验证,再用相关回归和全量背板证明没有引入新问题。
什么时候拿出来用
- 原型和基线已经建立,开始常规迭代、模型切换或缺陷修复
- 团队仍在凭感觉调 prompt,或者每次改动都只能靠人工试玩判断
开始前先拿到
- 版本固定的 Eval 数据集
- 失败 Case 的真实回复和工具 Trace
- 按风险选择测试档位的规则
操作主线
怎么推进
公开的是判断与动作骨架。客户数据、私有模板和内部示例不在其中。
- 01
从一个失败开始
按优先级选一个明确 Case,先读真实证据,不批量猜根因。
- 02
改正确的责任层
确定性要求优先改代码和契约;语义质量才进入提示与模型层。
- 03
跑单 Case 稳定复测
先验证这一条确实修好,涉及模型行为时通过重复运行排除偶然通过。
- 04
补回归和经验
再跑相关子集与全量背板,把缺陷固化为 Case、测试、守卫或事实源。
会留下什么
- 可追踪的单次改动证据
- 更新后的回归 Case 或护栏
- 版本化 Eval 报告
过关前再看一遍
- 目标失败稳定消失
- 相关场景没有新增硬失败
- 判据没有为了刷绿而被削弱
Exit Gate · 放行条件
目标场景 Eval 达标、门禁绿
容易做错的地方
- 用全量测试当作单 Case 反馈环
- 多个根因混在一次改动里
- 把必须字段或权限要求只写进 prompt
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
