跳到主要内容
← 交付方法总览
方法论可泛化原则

术语表(Glossary)

横切

统一这套方法里的关键术语。术语表的价值不在于定义本身,而在于消除同一个词在不同人嘴里指不同东西——这是跨职能协作中最廉价也最常被跳过的一步。

什么时候需要它

  • 跨职能讨论中发现同一个词被用出了不同含义
  • 新人加入,需要一份不依赖口口相传的共同语言

核心内容

它决定什么

  • Exit Gate 放行条件

    一个阶段能否进入下一阶段的可判定条件。判据是能被不参与开发的人独立判定,而不是「基本完成」这类表述。

  • Eval 评测

    针对 LLM 行为层的正确性验证,由用例集、评分维度、判官和统计阈值组成。它不是功能测试,也不能替代确定性契约。

  • 判官 Judge

    用来给开放式输出打分的评分器,可能是模型也可能是人。判官本身需要被校准,否则它的分数不构成证据。

  • 责任层归属

    一个失败在架构上真正的归属位置——数据、检索、工具、编排、提示或模型。定位责任层是修复的第一步。

  • Probe 探针验证

    用真实接口和真实凭据去证实一个关于数据可用性的假设,而不是依据访谈说法或文档记载。

  • Handoff 移交

    让另一支团队能独立接手并维持交付质量所需的全部资产与说明,是一等交付物而不是收尾工作。

怎么判断它真的到位

  • 关键术语在项目内只有一个含义,且写下来了
  • 新人能用这份术语表读懂既有的评审记录
  • 术语变更有版本记录,不是悄悄改掉

常见误区

  • 把术语表当成一次性文档,实际用法早已漂移
  • 同一个词在业务方与工程方之间含义不同却无人发现
  • 术语定义得过于抽象,无法用来判定具体情况

这套方法怎么落到你的项目

这是我们交付生产级 AI Agent 的公开、脱敏方法骨架。真正落地时,从 AI Agent 生产就绪审查与路线图 入手,或先用 生产上线前深检 定位薄弱环节。