跳到主要内容
← Playbook 索引
Playbook阶段 9可泛化原则

Eval 驱动开发(Eval-Driven Development)

交付

把日常开发变成可归因的质量循环:一次处理一个失败,改对责任层,用最小 Case 快速验证,再用相关回归和全量背板证明没有引入新问题。

什么时候拿出来用

  • 原型和基线已经建立,开始常规迭代、模型切换或缺陷修复
  • 团队仍在凭感觉调 prompt,或者每次改动都只能靠人工试玩判断

开始前先拿到

  • 版本固定的 Eval 数据集
  • 失败 Case 的真实回复和工具 Trace
  • 按风险选择测试档位的规则

操作主线

怎么推进

  1. 01

    从一个失败开始

    按优先级选一个明确 Case,先读真实证据,不批量猜根因。

  2. 02

    改正确的责任层

    确定性要求优先改代码和契约;语义质量才进入提示与模型层。

  3. 03

    跑单 Case 稳定复测

    先验证这一条确实修好,涉及模型行为时通过重复运行排除偶然通过。

  4. 04

    补回归和经验

    再跑相关子集与全量背板,把缺陷固化为 Case、测试、守卫或事实源。

会留下什么

  • 可追踪的单次改动证据
  • 更新后的回归 Case 或护栏
  • 版本化 Eval 报告

过关前再看一遍

  • 目标失败稳定消失
  • 相关场景没有新增硬失败
  • 判据没有为了刷绿而被削弱

Exit Gate · 放行条件

目标场景 Eval 达标、门禁绿

容易做错的地方

  • 用全量测试当作单 Case 反馈环
  • 多个根因混在一次改动里
  • 把必须字段或权限要求只写进 prompt

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。