← Playbook 索引
Playbook阶段 16可泛化原则
可观测与运营(Observability & Operations)
质量
- 一次建模遥测 schema、增量埋点:先把「运行 / 单次 LLM 调用 / 单次工具调用 / 里程碑事件」四类实体的表结构一次设计好,再逐步补埋点,避免 schema 反复变动。 - 遥测永不阻塞业务:埋点走 fire-and-forget + 有界缓冲 + 失败丢弃计数,任何遥测故障都不能拖垮或崩溃业务链路。 - 每次调用可溯源:记录 {配置版本, 配置来源枚举(db/cache/code_default/not_managed)},让「哪个配置版本产生了这次成本/行为」「我的配置改动生效了吗」能从数据直接回答。 - 单点埋点:在工具/数据调用的唯一咽喉点记录,把零散调试变成常驻的工具健康看板(成功率 / P95 / 错误分布)。 - 定时巡检规则:对遥测表跑定时异常检测 SQL,每条规则都绑定一个真实历史故障。 - 运行时自我复审:每次回复后异步跑规则化质量自检(可选 AI 复审),写台账、发质量提示,把生产运行变成学习燃料。 - 生产质量监控:把兜底率、延迟分位、异常聚类作为常驻质量信号,喂给发布决策与学习闭环。
Exit Gate · 放行条件
遥测/告警/复盘闭环运转
这套方法怎么落到你的项目
这是我们交付 AI 业务系统的公开方法论骨架。真正落地时,从 生产就绪审查与路线图 入手,或先用 上线前自检 定位薄弱环节。
