← 交付方法总览
方法论可泛化原则
术语表(Glossary)
横切
统一这套方法里的关键术语。术语表的价值不在于定义本身,而在于消除同一个词在不同人嘴里指不同东西——这是跨职能协作中最廉价也最常被跳过的一步。
什么时候需要它
- 跨职能讨论中发现同一个词被用出了不同含义
- 新人加入,需要一份不依赖口口相传的共同语言
核心内容
它决定什么
公开的是判断与判据。客户口径、私有阈值和内部示例不在其中。
Exit Gate 放行条件
一个阶段能否进入下一阶段的可判定条件。判据是能被不参与开发的人独立判定,而不是「基本完成」这类表述。
Eval 评测
针对 LLM 行为层的正确性验证,由用例集、评分维度、判官和统计阈值组成。它不是功能测试,也不能替代确定性契约。
判官 Judge
用来给开放式输出打分的评分器,可能是模型也可能是人。判官本身需要被校准,否则它的分数不构成证据。
责任层归属
一个失败在架构上真正的归属位置——数据、检索、工具、编排、提示或模型。定位责任层是修复的第一步。
Probe 探针验证
用真实接口和真实凭据去证实一个关于数据可用性的假设,而不是依据访谈说法或文档记载。
Handoff 移交
让另一支团队能独立接手并维持交付质量所需的全部资产与说明,是一等交付物而不是收尾工作。
怎么判断它真的到位
- 关键术语在项目内只有一个含义,且写下来了
- 新人能用这份术语表读懂既有的评审记录
- 术语变更有版本记录,不是悄悄改掉
常见误区
- 把术语表当成一次性文档,实际用法早已漂移
- 同一个词在业务方与工程方之间含义不同却无人发现
- 术语定义得过于抽象,无法用来判定具体情况
这套方法怎么落到你的项目
这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。
