← Playbook 索引
Playbook阶段 12 · 13可泛化原则
UAT 与现场试点(UAT & Field Pilot)
交付质量
让业务方按自己的用例和验收标准逐条确认系统,并在小范围真实使用中收集实验室没有覆盖的边缘情况。试点的关键产出不只是“用户用了”,而是新问题被转成以后每次都会测的资产。
什么时候拿出来用
- 工程侧回归已经收敛,准备进入业务验收和小范围真实使用
- 需要验证真实账号、真实权限、真实口径和多轮使用,而不是演示账号
开始前先拿到
- 逐条带自身 AC 的 UAT 用例
- 受控的真实数据与权限环境
- 试点范围、成功条件、退出条件和反馈通道
操作主线
怎么推进
公开的是判断与动作骨架。客户数据、私有模板和内部示例不在其中。
- 01
逐条跑 UAT
每条只用它自己的验收标准判定,硬失败不能靠其他软分补回来。
- 02
只重跑失败项
失败进入单 Case 闭环,修好后先跑该条,再做必要的批量核对。
- 03
小范围现场试点
限定用户、范围和时间,持续采集新问法、口径冲突、越权和异常路径。
- 04
把反馈变成资产
有价值的边缘情况去敏后写成新 Case,回归通过且无高危未决项才放行。
会留下什么
- 逐条 UAT 结果
- 受控试点计划与观察记录
- 由边缘案例生成的新 Eval Case
过关前再看一遍
- 关键 UAT 用例逐条通过自己的 AC
- 试点边缘案例已有去向
- 无未决高危缺陷且反馈通道能持续运转
Exit Gate · 放行条件
UAT 用例逐条对 AC 通过
容易做错的地方
- 凭“回复看着不错”判通过
- 用全量批次作为每条失败的反馈环
- 试点只收满意度,不把新问题转成回归资产
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
