机会、交付就绪、Eval 就绪、生产就绪、成熟度——五张打分卡,把「能不能进入下一阶段」变成可复核的评分,而不是一次拍脑袋的会议。
在从「原型/早期实现」正式进入「规模化迭代与 UAT」之前,判断交付主线是否真的就绪:验收标准是否齐全、架构是否分层定责、原型是否真能跑真实数据、Eval 基线是否已建立。它拦截的核心失败是——在没有可测验收、没有分层架构、没有 Eval 基线的情况下就开始堆功能,导致后期无法判断「改好了还是改坏了」,也无法把失败归位到责任层。
判断一套 Eval 是否可信到能作为放行依据。一个能跑出数字的 Eval 不等于一个可信的 Eval——如果判官没校准、复跑不稳定、种子覆盖有盲区、没有回归门,那么「通过率上升」可能只是噪声、判官偏见或标准被削弱。本卡从五个维度体检 Eval 体系:三档分层、种子覆盖、判官校准、稳定复跑、回归门,结论是这套 Eval 的结论能否被信任、能否用来卡放行。
评估一个团队或项目在 Agent FDE Delivery System 上的成熟度,用于回答三类问题:这个团队现在处在什么水平、下一步该补哪个闭环的哪一级、是否成熟到可以规模化复制到新项目。它不是给项目「打个总分排名」,而是把成熟度拆成四闭环各自的等级——一个团队完全可能 Truth Loop 成熟(真数据 Probe 到位)但 Learning Loop 幼稚(经验从不回写为 Eval 资产),四条腿不齐正是要暴露的。
在把一个「值得做的智能体机会」推进到立项与收资之前,用一张卡把它从价值、可行性、数据可得性、口径可定义性、失败可验收性、风险六个维度打分,避免出现三类典型误判:
在把智能体推上生产(或从灰度切正式)前,判断它是否真的可以安全上线并可运维。它拦截的核心失败是把「部署成功 / 测试通过」当成「交付达成」——服务起来、编译通过、依赖可达都不算数,真正的判据是真实用户能否在生产上拿到可用产物,出问题时能否观测、能否一键回滚、权限边界是否守得住。
机会打分卡 → 交付就绪 → Eval 就绪 → 生产就绪 ;跨闭环体检:成熟度评分卡
这里是交付方法论内部使用的阶段就绪打分卡。如果你想对自己的 AI 系统做一次结构化自查,用站上的 上线前自检 或 对照清单;需要进入系统逐项核验证据、按支柱加权评分并给出 P0/P1/P2 判级的,是 生产就绪审查与路线图。