跳到主要内容
← Playbook 索引
Playbook阶段 8可泛化原则

原型与 Eval 基线(Prototype & Eval Baseline)

交付质量

用最小端到端原型证明架构能产生可用结果,同时建立第一条可复现的质量基线。原型回答“能不能跑通”,Eval 基线回答“之后的改动究竟让它变好还是变坏”。

什么时候拿出来用

  • 架构已经过审,但还没有真实端到端结果和可复现的质量标尺
  • 新增一种能力或责任层,需要在全面铺开前先建立覆盖

开始前先拿到

  • 首批高价值 Case
  • 最小可用的数据和工具链路
  • 能够记录工具调用与最终产物的环境

操作主线

怎么推进

  1. 01

    跑通最小主链

    只覆盖最关键的一两个问题类型,但必须从真实入口走到真实产物。

  2. 02

    留下最小 Trace

    记录工具、参数、结果摘要和最终输出,让每次失败可以被复盘。

  3. 03

    建立种子与评分

    从真实话术和已知缺陷建立 Case,区分确定性规则、语义评分和一票否决项。

  4. 04

    跑出可复现基线

    固定数据集与判定版本,多次复跑分离随机噪声,再把结果冻结为比较起点。

会留下什么

  • 最小可用原型
  • 版本化 Eval 种子集
  • 可复现基线与回归快照

过关前再看一遍

  • 真实用户路径可以拿到可用产物
  • 每个已知回归问题至少有一个对应 Case
  • 重复运行能得到足够稳定的基线信号

Exit Gate · 放行条件

原型跑通且 Eval 基线可复现

容易做错的地方

  • 流程显示完成就算原型成功
  • 没有基线就开始调提示词
  • 只跑一次就把波动当成质量变化

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。