← Playbook 索引
Playbook阶段 8可泛化原则
原型与 Eval 基线(Prototype & Eval Baseline)
交付质量
用最小端到端原型证明架构能产生可用结果,同时建立第一条可复现的质量基线。原型回答“能不能跑通”,Eval 基线回答“之后的改动究竟让它变好还是变坏”。
什么时候拿出来用
- 架构已经过审,但还没有真实端到端结果和可复现的质量标尺
- 新增一种能力或责任层,需要在全面铺开前先建立覆盖
开始前先拿到
- 首批高价值 Case
- 最小可用的数据和工具链路
- 能够记录工具调用与最终产物的环境
操作主线
怎么推进
公开的是判断与动作骨架。客户数据、私有模板和内部示例不在其中。
- 01
跑通最小主链
只覆盖最关键的一两个问题类型,但必须从真实入口走到真实产物。
- 02
留下最小 Trace
记录工具、参数、结果摘要和最终输出,让每次失败可以被复盘。
- 03
建立种子与评分
从真实话术和已知缺陷建立 Case,区分确定性规则、语义评分和一票否决项。
- 04
跑出可复现基线
固定数据集与判定版本,多次复跑分离随机噪声,再把结果冻结为比较起点。
会留下什么
- 最小可用原型
- 版本化 Eval 种子集
- 可复现基线与回归快照
过关前再看一遍
- 真实用户路径可以拿到可用产物
- 每个已知回归问题至少有一个对应 Case
- 重复运行能得到足够稳定的基线信号
Exit Gate · 放行条件
原型跑通且 Eval 基线可复现
容易做错的地方
- 流程显示完成就算原型成功
- 没有基线就开始调提示词
- 只跑一次就把波动当成质量变化
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
