没有找到匹配章节。请尝试更短的关键词,例如“权限”“测试”“事故”或“知识”。
人与大模型共同开发软件的最优解,不是把人的工作交给模型,而是重新设计信息流、决策权、工具权限、验证机制与反馈闭环,让双方在各自擅长的区域工作。
可靠协作 = 明确意图 × 受控上下文 × 最小权限 × 可执行验证 × 人类问责 × 运行反馈
判断 01模型是非确定性参与者
输出可能正确、近似正确或自洽但错误。工程系统必须验证结果,而不是信任表达的流畅度。
判断 02上下文比提示词更重要
稳定的仓库说明、领域词汇、架构决策和可执行约束,比一条“聪明提示词”更能持续提升质量。
判断 03速度收益必须扣除返工
衡量从想法到安全上线的端到端时间,而非生成代码的局部速度;返工、事故和知识流失都要计入。
要解决的六类系统问题
| 问题 | 典型表现 | 架构回答 | 可验证结果 |
| 意图失真 | 需求模糊,模型自行补齐关键假设 | 结构化任务契约与验收标准 | 假设显式、范围可核对 |
| 上下文漂移 | 不同会话给出不同方案 | 版本化知识基线与检索策略 | 来源、版本、时效可追溯 |
| 权限失控 | 代理可读敏感数据或直接改生产 | 能力分级、最小权限、审批与沙箱 | 每次动作有主体、范围和日志 |
| 质量幻觉 | 代码能编译但语义不正确 | 独立测试、契约、静态检查和评审 | 证据包支持发布判断 |
| 知识断层 | 代码增长,团队理解下降 | 文档即产品、ADR 与变更同步 | 维护者可解释关键决策 |
| 运行脱节 | 模型只参与开发,不吸收线上反馈 | 可观测性、事件归因、复盘回写 | 故障经验进入下一轮约束 |
最终责任原则大模型可以提出、生成、检查和解释,但不能成为法律、业务或工程意义上的责任主体。每个需求、变更、发布、例外和事故都必须对应可识别的人类负责人。
分工不应按“写代码/不写代码”划线,而应按风险与证据能力动态分级:越不可逆、影响越大、语义越依赖业务判断,人类介入越深。
八条设计原则
01人定意图
人定义目标、边界、优先级、价值冲突与停止条件。
02模型提方案
模型探索选项、识别遗漏、生成候选实现,不隐式决定。
03系统给约束
规则应尽量编码为类型、测试、策略和自动化门禁。
04证据做裁决
以可运行、可重复、可审计的证据替代“看起来合理”。
05权限渐进
从只读到写入、发布、生产操作逐级授权,并可随时撤销。
06变更小步
缩小任务、差异和发布批次,降低审查成本与故障半径。
07来源可追
需求、知识、代码、测试与决策建立可回溯链路。
08失败安全
超时、冲突、证据不足或越权时默认停止,而非继续猜测。
自主级别
| 级别 | 模型权限 | 适用任务 | 必须的人类控制 |
| L0 建议 | 只读;提出分析与方案 | 解释代码、梳理文档、头脑风暴 | 人决定是否采用 |
| L1 草拟 | 在隔离区生成文档或补丁 | 测试草稿、重构候选、迁移计划 | 逐项审查后合入 |
| L2 执行 | 在工作分支运行受限工具 | 低风险缺陷、机械升级、文档同步 | 自动门禁 + 人批准合并 |
| L3 受监督交付 | 可提交、触发预发布 | 边界清晰且覆盖充分的组件 | 双人或高等级审批发布 |
| L4 受策略自治 | 在策略内自动处理可逆事项 | 依赖补丁、告警归类、非生产修复 | 持续审计、预算和熔断 |
禁止默认自治的事项生产数据删除、资金或权益变化、身份权限提升、密钥处理、法律承诺、安全策略降级、不可逆迁移、面向用户的高影响决策,不应仅由模型决定或执行。
整体架构的核心不是某个模型或代理框架,而是控制平面之间稳定的契约。模型可以更换,流程和证据链仍应保持有效。
Five control planes / 五平面架构
P1 / GOVERN意图与治理目标、责任、风险、预算、政策、审批与例外。
输出:任务契约、决策记录、风险等级
P2 / CONTEXT知识与上下文代码、领域知识、运行事实、依赖、标准与历史。
输出:可引用上下文包、来源与时效
P3 / EXECUTE工程执行规划、生成、修改、工具调用、环境与编排。
输出:小批量变更、构建物、操作日志
P4 / ASSURE验证与证据测试、扫描、评审、策略检查、差异与签名。
输出:证据包、门禁结论、残余风险
P5 / OPERATE运行与反馈发布、观测、告警、事故、回滚、容量与成本。
输出:遥测、事件、复盘、知识回写
平面之间传递什么
任务契约目标、约束、风险、验收
→
上下文包事实、来源、版本、禁区
→
变更集代码、配置、数据、说明
→
证据包测试、扫描、评审、风险
→
运行反馈指标、事件、用户结果
架构不变量
- 任何执行都能追溯到已授权的任务、主体与上下文版本。
- 任何发布都对应可复现构建、不可篡改证据和明确责任人。
- 任何生产动作都受最小权限、时间限制、环境隔离与审计约束。
- 任何失败都能安全停止、回滚或降级,不依赖模型继续“修补”。
- 任何事故与重要决策都会回写知识平面,改变后续约束或测试。
模型可替换,契约不可缺不要把核心流程绑定到特定厂商的会话格式或隐藏记忆。将输入、输出、权限、日志和评价标准放在组织可控制的契约层,才能升级模型而不重建治理体系。
治理的目标不是增加审批层,而是让决策在正确的层级发生:低风险事项自动化,高风险事项由具备上下文和授权的人判断。
| 角色 | 不可委托责任 | 模型可协助 | 关键产物 |
| 业务/产品负责人 | 价值、优先级、验收与业务风险 | 需求拆解、边界案例、影响分析 | 目标、验收标准、业务规则 |
| 系统/领域负责人 | 边界、质量属性、重大技术决策 | 方案比较、依赖图、ADR 草案 | 架构基线、ADR、演进路线 |
| 变更负责人 | 实现正确性与证据完整性 | 编码、重构、测试、说明 | 变更集、测试与风险说明 |
| 独立复核人 | 挑战假设、确认风险与可维护性 | 差异摘要、缺陷模式扫描 | 评审结论、整改项 |
| 安全/合规负责人 | 数据政策、威胁接受与例外 | 威胁枚举、规则检查、证据整理 | 策略、例外期限、合规证据 |
| 平台/SRE 负责人 | 发布、SLO、容量、事故与恢复 | 运行手册、告警归类、复盘草案 | SLO、运行手册、事故记录 |
三层治理
团队层日常交付
任务分级、仓库规则、评审与发布;由团队负责人和变更负责人承担。
平台层共同能力
模型网关、身份权限、沙箱、日志、策略、评测与成本管理;由平台团队维护。
组织层风险与制度
可接受使用、数据分类、供应商、合规、重大例外与成熟度;由技术治理委员会负责。
决策与例外
- 正常路径:策略可执行、证据充分,系统自动放行低风险变更。
- 升级路径:证据冲突、跨域影响、敏感数据或不可逆动作,升级到指定责任人。
- 例外路径:记录原因、补偿控制、批准人、适用范围与自动失效时间;禁止永久口头豁免。
- 紧急路径:先恢复服务,但保留双人确认、完整审计和事后限时复盘。
发现问题与价值
→
定义契约与风险
→
设计边界与方案
→
实现小批量变更
→
验证独立证据
→
交付渐进发布
→
运营反馈与演进
| 阶段 | 人类重点 | 模型重点 | 出口条件 |
| 发现 | 确认用户问题、价值和不做什么 | 材料归纳、竞品/历史检索、未知项清单 | 问题陈述可证伪 |
| 定义 | 明确验收、约束、风险与责任 | 边界案例、歧义检测、任务拆分 | 任务契约获负责人确认 |
| 设计 | 权衡质量属性和长期成本 | 候选方案、影响面、威胁与迁移分析 | 决策、接口、回退策略清楚 |
| 实现 | 监督方向、处理冲突和关键语义 | 编码、测试、重构、文档同步 | 变更小而完整,自检通过 |
| 验证 | 独立审查风险与业务语义 | 执行测试、扫描、差异归纳 | 证据门通过或风险被接受 |
| 交付 | 决定发布时间、范围和监控窗口 | 生成发布说明、核对清单、观察指标 | 可追溯构建、可回滚、责任人在线 |
| 运营 | 判断用户影响、事故等级和演进方向 | 告警聚合、异常解释、复盘初稿 | 反馈进入需求、测试与知识基线 |
双环反馈交付环优化一次变更从定义到上线的质量与速度;学习环把线上结果、评审缺陷和事故根因转化为新的测试、策略、文档或架构决策。没有学习环,团队只是在更快地重复旧错误。
上下文是生产资料。它需要所有权、生命周期、版本、访问控制与质量标准;会话历史不是可靠的知识库。
Context supply chain / 上下文供应链
任务上下文目标、范围、验收、风险、允许工具、停止条件每个任务生成
仓库上下文目录说明、构建方式、编码规范、测试策略、所有权随代码版本化
领域上下文术语、业务规则、数据定义、用户旅程、合规约束领域负责人维护
架构上下文系统边界、依赖、接口契约、质量属性、ADR 与禁区架构基线
运行上下文SLO、拓扑、发布状态、遥测、已知故障、运行手册实时或近实时
检索与策略层身份过滤、相关性、时效、引用、脱敏、提示注入防护横向控制
最小上下文包
TASK-CONTEXT.yaml
task:
goal: "要达成的可验证业务结果"
non_goals: ["明确不处理的事项"]
owner: "可识别的人类负责人"
risk: "low | medium | high | critical"
constraints:
architecture: ["必须保持的边界和不变量"]
security: ["数据等级、禁止动作、允许的外部服务"]
tools: ["允许读取、写入和执行的能力"]
acceptance:
functional: ["Given / When / Then"]
quality: ["性能、可靠性、可维护性目标"]
evidence:
required: ["测试、扫描、评审、运行观察"]
stop_when: ["冲突、证据不足、越权、预算达到上限"]
知识质量规则
| 维度 | 最低要求 | 失败处理 |
| 来源 | 标注文件、系统或责任人;重要事实可回到原始来源 | 无来源内容只作线索,不作决策依据 |
| 时效 | 含版本、更新时间或有效期 | 过期内容降权并提示人工确认 |
| 权限 | 检索继承调用者权限,敏感字段最小披露 | 越权时拒绝,不用“摘要”绕过 |
| 冲突 | 保留冲突来源,不静默合并 | 升级责任人确认优先级 |
| 引用 | 关键结论绑定证据片段和定位 | 无法引用时显式标为推测 |
| 注入防护 | 把外部文本视为数据而非指令 | 隔离、清洗、策略过滤与人工复核 |
不要让“记忆”替代事实模型记忆可用于偏好和低风险便利信息,不应保存密钥、个人敏感信息、授权状态或关键业务事实。真正的事实必须来自受控系统,并在使用时重新校验。
Reference platform architecture / 参考平台分层
协作入口层IDE、代码评审、任务系统、运维台、知识门户人机交互
代理与编排层任务规划、状态机、超时、重试、预算、人工接管非确定性协调
模型网关层模型路由、版本锁定、限流、脱敏、缓存、供应商切换模型可替换
上下文服务层检索、代码索引、知识图谱、运行事实、引用与权限过滤可信输入
工具与执行层仓库、构建、测试、数据库、云平台;通过受控代理暴露能力最小化
隔离环境层短生命周期沙箱、网络出口控制、文件与资源配额限制故障半径
证据与审计层提示摘要、工具调用、变更、测试、审批、构建与发布记录可追溯
横切控制身份、策略、密钥、数据分类、成本、遥测、保留与删除全链路执行
关键组件契约
| 组件 | 必须提供 | 不得承担 |
| 模型网关 | 统一身份、路由、版本、配额、审计与供应商降级 | 替代业务授权或隐藏模型版本变化 |
| 编排器 | 显式状态、幂等、超时、重试上限、人工接管和取消 | 无限自循环或静默扩大任务范围 |
| 工具代理 | 参数校验、资源范围、操作预览、结果摘要、审计 ID | 把原始管理员凭证交给模型 |
| 执行沙箱 | 临时身份、资源配额、网络白名单、自动销毁 | 共享生产密钥或持久化未审查状态 |
| 证据存储 | 关联任务、主体、模型、上下文、变更、测试与批准 | 无限保留敏感原始提示 |
| 策略引擎 | 基于身份、环境、数据和风险做一致决策 | 只依赖自然语言提醒执行安全边界 |
可靠性设计
- 所有工具调用使用幂等键;重试不应重复创建资源或发送外部通知。
- 编排状态持久化,模型超时或切换后可从已确认检查点恢复。
- 模型输出先通过结构化模式和业务规则验证,再进入下游系统。
- 外部模型不可用时支持降级为人工流程、较低能力模型或只读模式。
- 关键决策记录模型和提示模板版本,但避免把秘密与完整敏感数据写入日志。
任务定界
人明确目标、非目标、业务语义、风险等级、允许修改范围和验收方式;模型列出歧义与待确认假设。
只读探索
模型先理解仓库、依赖、历史决策与测试,输出影响面和风险;在计划确认前不修改。
可审查计划
说明将改哪些组件、如何验证、如何迁移和回退;高风险方案由领域或架构负责人批准。
小批量实现
每次只完成一个可验证增量,保持差异聚焦;模型同步代码、测试、配置与必要文档。
自检与证据
执行格式、类型、单测、契约、集成、安全扫描;模型解释失败,不通过删除测试或降低规则“修复”。
独立复核
由未参与生成的复核者或独立验证流程挑战业务语义、边界条件、性能、安全和可维护性。
合入与发布准备
确认差异、证据、风险、迁移、可观测性和回退;责任人批准后进入渐进发布。
变更说明必须回答
WHY / WHAT为什么改、改了什么
关联目标和需求;列出行为变化、数据或接口影响,以及明确未做的事项。
HOW / PROOF如何实现、如何证明
说明关键设计选择、测试结果、人工检查、已知限制和残余风险。
OPERATE如何上线与观察
迁移顺序、功能开关、目标指标、观察窗口、告警与负责人。
RECOVER如何停止与回退
回滚条件、步骤、数据兼容性、预计恢复时间和升级路径。
评审人不应只看模型摘要摘要用于导航,不是证据。复核者必须能看到真实差异、关键上下文、测试结果与运行影响,并对高风险逻辑做抽样或逐行核对。
质量体系验证的是系统行为,而不是模型是否自信。任何由模型生成的实现、测试或说明,都应接受独立规则、独立数据或独立人员的检验。
GATE A合入门
范围、代码规范、类型、单元测试、接口契约、秘密扫描、依赖许可和必要评审。
GATE B发布门
集成与端到端、性能、安全、迁移、可观测性、回滚、变更审批和构建来源。
GATE C运行门
金丝雀指标、错误预算、用户影响、资源成本、异常行为;不满足自动停止或回退。
测试组合
| 层次 | 主要证明 | 独立性要求 | 典型门禁 |
| 静态与策略 | 结构、类型、依赖、规则与权限合规 | 规则由平台/安全维护 | 必须自动通过 |
| 单元/属性测试 | 局部逻辑、边界、不变量 | 关键测试不只由同一生成上下文产生 | 新增逻辑有覆盖,突变测试抽查 |
| 契约测试 | 服务、事件和数据格式兼容 | 消费者/提供者双方基线 | 破坏性变更必须迁移 |
| 集成/端到端 | 真实依赖与关键用户旅程 | 隔离环境、稳定夹具 | 核心路径零阻断缺陷 |
| 非功能 | 性能、韧性、安全、可访问性 | 生产相似负载与威胁模型 | 达到质量属性预算 |
| 运行验证 | 真实流量下的安全与价值 | 独立遥测、对照或金丝雀 | 指标健康才扩大流量 |
证据包结构
- 任务 ID、负责人、风险等级、需求与验收标准。
- 模型、工具、关键上下文来源与执行环境版本。
- 代码/配置/数据差异和构建物摘要及完整性标识。
- 自动测试、扫描、性能和兼容性结果;失败与豁免不隐藏。
- 人工评审人、结论、时间和残余风险接受记录。
- 发布、观察、回退计划和上线后的实际结果。
防止“测试迎合实现”先于实现冻结关键验收样例;保留独立的隐藏测试、生产缺陷回归集和属性不变量;对关键代码使用差分、突变或影子流量验证。模型不应同时拥有修改实现、修改门禁和批准例外的权限。
| 威胁 | 攻击方式 | 主要控制 | 检测信号 |
| 提示注入 | 文档、网页、Issue 中嵌入恶意指令 | 指令/数据分离、来源信任、工具策略、人工确认 | 越权意图、异常工具序列 |
| 敏感数据泄露 | 提示、日志、外部模型或输出带出数据 | 分类、脱敏、私有路由、最小披露、保留策略 | DLP 命中、异常出站 |
| 过度代理 | 模型扩大任务、删除资源、修改权限 | 能力令牌、参数范围、预览、双人批准、熔断 | 高风险动作、范围偏移 |
| 供应链污染 | 引入恶意依赖、脚本或模型建议包 | 允许清单、锁定版本、来源证明、漏洞与许可扫描 | 新依赖、维护者变化、签名异常 |
| 不安全代码 | 注入、鉴权缺陷、危险默认值 | 安全基线、SAST/DAST、威胁建模、专门评审 | 规则命中、运行攻击信号 |
| 模型/供应商变化 | 行为漂移、数据策略或区域变化 | 版本锁定、评测、合同、区域路由、退出方案 | 基准回退、成本/延迟异常 |
权限设计:四个限定
IDENTITY主体限定
每次调用绑定用户、服务和代理身份,禁止共享不可归属凭证。
SCOPE资源限定
只允许指定仓库、路径、环境、数据集和操作类型。
TIME时间限定
临时令牌、单任务有效、到期自动撤销,并支持紧急熔断。
INTENT意图限定
能力与已批准任务绑定,超出目标必须重新授权。
数据处理分级
| 等级 | 示例 | 模型使用策略 |
| 公开 | 公开文档、开源代码 | 可使用批准模型,仍需防注入与许可检查 |
| 内部 | 一般设计、内部代码 | 企业合同/受控网关,不用于供应商训练 |
| 机密 | 未发布商业信息、客户配置 | 严格授权、脱敏或私有部署、细粒度审计 |
| 受限 | 密钥、支付、健康、身份和高敏个人数据 | 默认不进入模型;确需使用需专门批准与隔离控制 |
日志最小化可审计不等于保存所有原始提示。记录决策所需的主体、时间、策略结果、工具调用、模型与上下文引用;敏感正文采用脱敏、哈希或受限短期存储,并执行删除请求和保留期限。
发布路径
可复现构建锁定依赖与环境
→
完整性签名来源与证据关联
→
预发布验证迁移、回退、指标
→
渐进流量影子/金丝雀/分批
→
自动判断SLO 与业务护栏
→
扩大或回退责任人确认
三层可观测性
PRODUCT产品结果
任务成功率、用户转化、人工接管、错误决策、投诉和公平性。
SYSTEM软件系统
延迟、流量、错误、饱和、依赖、队列、数据质量和 SLO。
MODEL LOOP人机协作
模型版本、调用链、工具失败、上下文命中、重试、成本、越权拒绝和漂移。
事故响应分工
| 阶段 | 模型适合做 | 人必须做 |
| 发现与聚合 | 关联告警、日志、发布和已知问题,压缩噪声 | 确认真实用户影响与事故等级 |
| 诊断 | 生成假设、检索历史、提出低风险验证步骤 | 选择假设、控制实验范围 |
| 缓解 | 根据运行手册准备命令和影响预览 | 批准生产动作,必要时双人确认 |
| 恢复 | 监测恢复指标、识别残余异常 | 宣布恢复、决定观察窗口 |
| 复盘 | 整理时间线、证据和候选改进项 | 确定根因、责任边界、优先级与制度改进 |
自动修复的边界只对高度可观测、动作可逆、影响面受限、运行手册成熟的故障开放自动修复;设置执行次数、时间和资源预算。连续失败、信号冲突或需要数据修复时立即转人工。
维护阶段的最大风险是“代码更容易生成,系统更难理解”。因此要把可解释性、边界清晰度和知识新鲜度作为一等质量属性。
持续维护组合
| 工作流 | 模型贡献 | 人类控制 | 完成定义 |
| 依赖升级 | 兼容性分析、迁移草案、回归范围 | 供应链风险和发布时间 | 锁定版本、回归通过、可回退 |
| 缺陷修复 | 定位候选、最小复现、补丁与回归测试 | 根因和业务语义确认 | 复现先失败、修复后通过、无旁路 |
| 重构 | 调用图、重复模式、分步变更 | 边界目标与行为不变判断 | 差异可审查、指标不退化 |
| 架构现代化 | 依赖盘点、绞杀路径、适配层草案 | 目标架构与投资节奏 | 可分阶段交付,旧路径可下线 |
| 文档维护 | 检测代码/文档偏差、生成更新草案 | 确认意图和决策仍有效 | 文档与同一变更一并评审 |
| 知识回收 | 从 PR、事故、会议中提炼候选知识 | 去重、定责、批准和过期 | 进入有所有者的知识基线 |
技术债账本
- 债务类型:结构、测试、数据、依赖、安全、可观测性、知识与流程。
- 证据:事故、变更前置时间、缺陷热点、复杂度、人工绕行和认知负担。
- 利息:每次变更增加的时间、风险、成本与机会损失。
- 偿还策略:顺手治理、专项重构、隔离封装、替换或接受并设复查日期。
技术债优先级 ≈ 发生概率 × 影响 × 变更频率 × 债务利息 ÷ 偿还成本
架构守护规则将关键边界、依赖方向、接口兼容、数据所有权和禁止调用编码为架构测试或策略。模型越能快速修改代码,自动守护结构的价值越高。
FLOWTTV从想法到价值
任务等待、实现、评审、发布和验证的端到端时间。
QUALITYCFR变更失败率
回滚、热修、事故与未达业务目标的发布占比。
RISKESC升级与越权
需人工接管、策略拒绝、敏感数据命中和异常动作。
ECONOMY$/OK每个成功变更成本
模型、算力、平台、人工评审、返工与事故摊销。
平衡计分卡
| 维度 | 领先指标 | 滞后指标 | 防止误用 |
| 流动 | 任务批量、等待时间、一次评审通过率 | 前置时间、部署频率 | 不按生成代码行数奖励 |
| 质量 | 测试有效性、评审缺陷、证据完整度 | 逃逸缺陷、变更失败率、MTTR | 不以覆盖率单指标替代质量 |
| 风险 | 高风险动作拒绝、权限缩减、例外到期 | 安全事件、数据泄露、合规缺口 | 拒绝率高可能意味着任务设计差 |
| 知识 | 引用率、文档新鲜度、ADR 同步率 | 接手时间、关键人依赖、重复事故 | 不以文档数量衡量知识质量 |
| 经济 | 缓存命中、模型路由、重试率、人工接管 | 每成功变更成本、云成本、事故损失 | 低价模型导致返工时并不便宜 |
评测体系
- 离线基准:来自真实任务的版本化题集,覆盖功能、维护、安全和工具使用。
- 上线前回归:模型、提示模板、检索、策略或工具升级时运行对比,设硬性退化阈值。
- 在线观察:按团队、任务、风险和模型分层,关注成功率、接管、返工和真实业务结果。
- 人工校准:定期抽样评审模型评分与真实质量的相关性,防止评价器偏差。
成本预算是控制,不只是报表对任务设置令牌、调用、工具执行、重试和墙钟时间上限;接近上限时压缩上下文、切换模型或请求人工判断。无限探索通常意味着任务边界或证据条件不清。
| 反模式 | 为什么危险 | 替代做法 |
| 一句提示交付整项工程 | 假设、范围和风险不可见,差异难审 | 任务契约 + 先探索 + 小批量检查点 |
| 模型既实现又自批 | 相同盲点在生成和验证中重复 | 独立测试、独立规则或独立复核者 |
| 把全部知识塞进上下文 | 噪声、冲突、泄露、时效与成本失控 | 权限感知检索 + 来源 + 最小上下文 |
| 只看代码能否编译 | 业务语义、性能、安全和运行性未验证 | 分层测试 + 质量属性 + 运行门 |
| 追求生成量和接受率 | 鼓励大差异、浅评审与技术债积累 | 衡量价值前置时间、返工和事故 |
| 生产凭证直接给代理 | 指令注入或错误规划可扩大为事故 | 短期能力令牌 + 工具代理 + 人工批准 |
| 文档自动生成后无人负责 | 流畅但不准确,迅速形成错误权威 | 文档所有者、来源、评审和过期机制 |
| 模型升级即自动切换 | 行为、成本、延迟和安全能力可能漂移 | 版本锁定、基准评测、金丝雀和回退 |
| 用模型掩盖坏架构 | 代码更易写但耦合和认知负担继续增加 | 边界治理、架构测试和债务账本 |
四个停止信号
STOP 01目标冲突
需求、代码事实或约束互相矛盾,不能靠模型自行选边。
STOP 02越权需求
必须读取、修改或调用未授权资源才能继续。
STOP 03证据不足
无法构造可靠测试、环境差异过大或关键事实无来源。
STOP 04风险扩大
差异、依赖或影响面超过任务契约,需重新分级与批准。
Maturity model / 五级成熟度
L1 / ASSIST个人辅助零散使用、只读或草拟,规则依赖个人习惯。
目标:明确可接受使用和数据边界
L2 / CONTROL团队受控仓库规范、任务契约、分支隔离、自动检查和人工审批。
目标:建立可重复工作流
L3 / PLATFORM平台标准化统一网关、身份、上下文、沙箱、证据、评测与成本。
目标:规模化且不失控
L4 / OPTIMIZE数据驱动优化按任务动态路由,端到端度量,模型与规则持续回归。
目标:优化质量、速度与成本
L5 / AUTONOMY策略内自治低风险可逆任务自动完成,高风险即时升级,持续审计。
目标:让控制随风险自适应
90 天落地建议
第 1–2 周:建立边界与基线
选择一个低风险、高频、结果可验证的试点;完成数据分类、允许工具、风险分级、现状指标与责任人。
第 3–4 周:固化最小工作流
建立仓库说明、任务契约、只读探索、分支隔离、自动检查、人工评审和发布回退模板。
第 5–8 周:补齐平台控制
统一模型入口、身份、临时权限、日志、成本预算;建设真实任务评测集和版本升级门禁。
第 9–12 周:闭环与扩展
接入运行指标与事故回写;比较端到端质量、前置时间和成本,再扩展到相邻任务与团队。
试点选择矩阵
| 候选任务 | 可验证性 | 风险 | 频率 | 建议 |
| 文档同步、测试补齐、机械重构 | 高 | 低 | 高 | 优先试点 |
| 常规缺陷修复、依赖升级 | 高 | 中 | 高 | 在门禁完善后扩展 |
| 跨服务功能、数据迁移 | 中 | 中高 | 中 | 需要架构和迁移治理 |
| 权限、支付、安全核心逻辑 | 中 | 高 | 中 | 仅作建议与辅助验证 |
| 生产删除、法律/权益决定 | 低 | 极高 | 低 | 不适合作为自治试点 |
16
模板与行动清单
把方法压缩成团队可以立即采用的最小工件和检查项。
最小工件集
| 工件 | 关键字段 | 所有者 | 更新时点 |
| 任务契约 | 目标、非目标、约束、验收、风险、权限、停止条件 | 任务负责人 | 开始前;范围变化时 |
| 仓库协作说明 | 结构、构建、测试、规范、禁区、所有权 | 代码所有者 | 架构或流程变化时 |
| ADR | 背景、选项、决定、后果、复查触发器 | 架构/领域负责人 | 重大决策时 |
| 证据包 | 变更、测试、扫描、评审、风险、构建来源 | 变更负责人 | 合入与发布前 |
| 运行手册 | 信号、诊断、动作、权限、验证、回退、升级 | 服务负责人 | 发布、事故、演练后 |
| 模型变更记录 | 版本、用途、评测、风险、金丝雀、回退 | AI 平台负责人 | 模型/提示/检索升级时 |
任务开始前检查
- 目标与非目标清楚,关键术语没有歧义。
- 风险等级、负责人和审批路径明确。
- 允许读取、修改、执行和联网的范围已限定。
- 验收标准可执行,关键样例在实现前冻结。
- 冲突、越权、证据不足和预算耗尽的停止条件已写明。
代码合入前检查
- 真实差异与任务契约一致,没有隐藏扩大范围。
- 代码、测试、配置、迁移和文档保持同步。
- 关键业务语义、边界条件和失败路径经过独立复核。
- 所有自动门禁通过;失败和例外有记录、负责人和期限。
- 未引入秘密、敏感数据、不必要依赖或不可解释生成物。
发布前检查
- 构建可复现,来源、证据与批准记录可追溯。
- 兼容、迁移、容量、安全和可观测性满足要求。
- 发布批次、功能开关、金丝雀指标和观察窗口明确。
- 回退动作可执行,数据向后兼容,恢复负责人在线。
- 用户影响、支持沟通与事故升级路径已准备。
事故后回写检查
- 时间线区分事实、假设和模型生成内容。
- 根因不止归结为“模型出错”,还检查流程、权限和门禁。
- 改进行动转化为测试、策略、文档、架构或培训。
- 每项行动有负责人、期限和验证方法。
- 相似系统与任务完成横向排查。
团队启动会议的五个问题
- 我们最想缩短的端到端工作流是什么,成功结果如何验证?
- 模型在这个工作流中允许知道什么、做什么、绝对不能做什么?
- 哪些判断必须由谁负责,什么情况自动升级或停止?
- 合入、发布和继续运行分别需要哪些独立证据?
- 我们如何把线上反馈、缺陷和事故变成下一轮更强的约束?
一句话落地先选一个低风险且可验证的工作流,把任务契约、最小权限、独立证据和运行反馈做成闭环;确认质量和成本改善后,再扩大模型自主权与组织覆盖面。
- Human-in-the-loop
- Agentic Engineering
- Context Engineering
- Software Architecture
- AI Governance
- DevSecOps
- SRE
- Evidence-based Delivery