返回文档库 页集
Human × Model Engineering System

人与大模型共同开发、管理与维护软件系统

关键不是“让模型多写代码”,而是建立一套可治理的协作操作系统:人负责目标、约束、判断与问责;模型负责加速理解、生成、验证与归纳;平台负责权限、证据、门禁与可追溯性。

整体架构方法 16 个主题 研发 · 治理 · SRE 版本 1.0 · 2026.07
协作操作系统HUMAN–MODEL LOOP
意图 · 判断 · 责任
证据
反馈
大模型推理 · 生成 · 归纳
P1意图与治理平面WHY / WHO
P2知识与上下文平面KNOW
P3工程执行平面BUILD
P4验证与证据平面PROVE
P5运行与反馈平面OPERATE
安全、权限、审计、成本与可观测性横切所有平面;任何高风险动作都必须由可识别的人类责任人批准。
没有找到匹配章节。请尝试更短的关键词,例如“权限”“测试”“事故”或“知识”。
01

执行摘要与核心判断

把“AI 辅助编码”升级为可长期运行、可审计、可演进的工程管理体系。

人与大模型共同开发软件的最优解,不是把人的工作交给模型,而是重新设计信息流、决策权、工具权限、验证机制与反馈闭环,让双方在各自擅长的区域工作。

可靠协作 = 明确意图 × 受控上下文 × 最小权限 × 可执行验证 × 人类问责 × 运行反馈
判断 01

模型是非确定性参与者

输出可能正确、近似正确或自洽但错误。工程系统必须验证结果,而不是信任表达的流畅度。

判断 02

上下文比提示词更重要

稳定的仓库说明、领域词汇、架构决策和可执行约束,比一条“聪明提示词”更能持续提升质量。

判断 03

速度收益必须扣除返工

衡量从想法到安全上线的端到端时间,而非生成代码的局部速度;返工、事故和知识流失都要计入。

要解决的六类系统问题

问题典型表现架构回答可验证结果
意图失真需求模糊,模型自行补齐关键假设结构化任务契约与验收标准假设显式、范围可核对
上下文漂移不同会话给出不同方案版本化知识基线与检索策略来源、版本、时效可追溯
权限失控代理可读敏感数据或直接改生产能力分级、最小权限、审批与沙箱每次动作有主体、范围和日志
质量幻觉代码能编译但语义不正确独立测试、契约、静态检查和评审证据包支持发布判断
知识断层代码增长,团队理解下降文档即产品、ADR 与变更同步维护者可解释关键决策
运行脱节模型只参与开发,不吸收线上反馈可观测性、事件归因、复盘回写故障经验进入下一轮约束
最终责任原则

大模型可以提出、生成、检查和解释,但不能成为法律、业务或工程意义上的责任主体。每个需求、变更、发布、例外和事故都必须对应可识别的人类负责人。

02

协作原则与责任边界

按可逆性、影响面、不确定性和可验证性分配人机决策权。

分工不应按“写代码/不写代码”划线,而应按风险与证据能力动态分级:越不可逆、影响越大、语义越依赖业务判断,人类介入越深。

八条设计原则

01

人定意图

人定义目标、边界、优先级、价值冲突与停止条件。

02

模型提方案

模型探索选项、识别遗漏、生成候选实现,不隐式决定。

03

系统给约束

规则应尽量编码为类型、测试、策略和自动化门禁。

04

证据做裁决

以可运行、可重复、可审计的证据替代“看起来合理”。

05

权限渐进

从只读到写入、发布、生产操作逐级授权,并可随时撤销。

06

变更小步

缩小任务、差异和发布批次,降低审查成本与故障半径。

07

来源可追

需求、知识、代码、测试与决策建立可回溯链路。

08

失败安全

超时、冲突、证据不足或越权时默认停止,而非继续猜测。

自主级别

级别模型权限适用任务必须的人类控制
L0 建议只读;提出分析与方案解释代码、梳理文档、头脑风暴人决定是否采用
L1 草拟在隔离区生成文档或补丁测试草稿、重构候选、迁移计划逐项审查后合入
L2 执行在工作分支运行受限工具低风险缺陷、机械升级、文档同步自动门禁 + 人批准合并
L3 受监督交付可提交、触发预发布边界清晰且覆盖充分的组件双人或高等级审批发布
L4 受策略自治在策略内自动处理可逆事项依赖补丁、告警归类、非生产修复持续审计、预算和熔断
禁止默认自治的事项

生产数据删除、资金或权益变化、身份权限提升、密钥处理、法律承诺、安全策略降级、不可逆迁移、面向用户的高影响决策,不应仅由模型决定或执行。

03

整体架构:五个控制平面

把协作拆成五个可独立治理、又通过工件和事件连接的平面。

整体架构的核心不是某个模型或代理框架,而是控制平面之间稳定的契约。模型可以更换,流程和证据链仍应保持有效。

Five control planes / 五平面架构
P1 / GOVERN意图与治理

目标、责任、风险、预算、政策、审批与例外。

输出:任务契约、决策记录、风险等级
P2 / CONTEXT知识与上下文

代码、领域知识、运行事实、依赖、标准与历史。

输出:可引用上下文包、来源与时效
P3 / EXECUTE工程执行

规划、生成、修改、工具调用、环境与编排。

输出:小批量变更、构建物、操作日志
P4 / ASSURE验证与证据

测试、扫描、评审、策略检查、差异与签名。

输出:证据包、门禁结论、残余风险
P5 / OPERATE运行与反馈

发布、观测、告警、事故、回滚、容量与成本。

输出:遥测、事件、复盘、知识回写

平面之间传递什么

任务契约目标、约束、风险、验收
上下文包事实、来源、版本、禁区
变更集代码、配置、数据、说明
证据包测试、扫描、评审、风险
运行反馈指标、事件、用户结果

架构不变量

  • 任何执行都能追溯到已授权的任务、主体与上下文版本。
  • 任何发布都对应可复现构建、不可篡改证据和明确责任人。
  • 任何生产动作都受最小权限、时间限制、环境隔离与审计约束。
  • 任何失败都能安全停止、回滚或降级,不依赖模型继续“修补”。
  • 任何事故与重要决策都会回写知识平面,改变后续约束或测试。
模型可替换,契约不可缺

不要把核心流程绑定到特定厂商的会话格式或隐藏记忆。将输入、输出、权限、日志和评价标准放在组织可控制的契约层,才能升级模型而不重建治理体系。

04

组织、角色与治理机制

把“谁提出、谁执行、谁验证、谁批准、谁运营”写进责任模型。

治理的目标不是增加审批层,而是让决策在正确的层级发生:低风险事项自动化,高风险事项由具备上下文和授权的人判断。

角色不可委托责任模型可协助关键产物
业务/产品负责人价值、优先级、验收与业务风险需求拆解、边界案例、影响分析目标、验收标准、业务规则
系统/领域负责人边界、质量属性、重大技术决策方案比较、依赖图、ADR 草案架构基线、ADR、演进路线
变更负责人实现正确性与证据完整性编码、重构、测试、说明变更集、测试与风险说明
独立复核人挑战假设、确认风险与可维护性差异摘要、缺陷模式扫描评审结论、整改项
安全/合规负责人数据政策、威胁接受与例外威胁枚举、规则检查、证据整理策略、例外期限、合规证据
平台/SRE 负责人发布、SLO、容量、事故与恢复运行手册、告警归类、复盘草案SLO、运行手册、事故记录

三层治理

团队层

日常交付

任务分级、仓库规则、评审与发布;由团队负责人和变更负责人承担。

平台层

共同能力

模型网关、身份权限、沙箱、日志、策略、评测与成本管理;由平台团队维护。

组织层

风险与制度

可接受使用、数据分类、供应商、合规、重大例外与成熟度;由技术治理委员会负责。

决策与例外

  • 正常路径:策略可执行、证据充分,系统自动放行低风险变更。
  • 升级路径:证据冲突、跨域影响、敏感数据或不可逆动作,升级到指定责任人。
  • 例外路径:记录原因、补偿控制、批准人、适用范围与自动失效时间;禁止永久口头豁免。
  • 紧急路径:先恢复服务,但保留双人确认、完整审计和事后限时复盘。
05

端到端生命周期

从需求进入到运行反馈,每一阶段都有输入、协作方式、出口条件和责任人。

发现问题与价值
定义契约与风险
设计边界与方案
实现小批量变更
验证独立证据
交付渐进发布
运营反馈与演进
阶段人类重点模型重点出口条件
发现确认用户问题、价值和不做什么材料归纳、竞品/历史检索、未知项清单问题陈述可证伪
定义明确验收、约束、风险与责任边界案例、歧义检测、任务拆分任务契约获负责人确认
设计权衡质量属性和长期成本候选方案、影响面、威胁与迁移分析决策、接口、回退策略清楚
实现监督方向、处理冲突和关键语义编码、测试、重构、文档同步变更小而完整,自检通过
验证独立审查风险与业务语义执行测试、扫描、差异归纳证据门通过或风险被接受
交付决定发布时间、范围和监控窗口生成发布说明、核对清单、观察指标可追溯构建、可回滚、责任人在线
运营判断用户影响、事故等级和演进方向告警聚合、异常解释、复盘初稿反馈进入需求、测试与知识基线
双环反馈

交付环优化一次变更从定义到上线的质量与速度;学习环把线上结果、评审缺陷和事故根因转化为新的测试、策略、文档或架构决策。没有学习环,团队只是在更快地重复旧错误。

06

上下文与知识架构

让模型看到“刚好足够、来源可信、版本正确”的信息,而不是把所有资料塞进会话。

上下文是生产资料。它需要所有权、生命周期、版本、访问控制与质量标准;会话历史不是可靠的知识库。

Context supply chain / 上下文供应链
任务上下文目标、范围、验收、风险、允许工具、停止条件每个任务生成
仓库上下文目录说明、构建方式、编码规范、测试策略、所有权随代码版本化
领域上下文术语、业务规则、数据定义、用户旅程、合规约束领域负责人维护
架构上下文系统边界、依赖、接口契约、质量属性、ADR 与禁区架构基线
运行上下文SLO、拓扑、发布状态、遥测、已知故障、运行手册实时或近实时
检索与策略层身份过滤、相关性、时效、引用、脱敏、提示注入防护横向控制

最小上下文包

TASK-CONTEXT.yaml
task:
  goal: "要达成的可验证业务结果"
  non_goals: ["明确不处理的事项"]
  owner: "可识别的人类负责人"
  risk: "low | medium | high | critical"
constraints:
  architecture: ["必须保持的边界和不变量"]
  security: ["数据等级、禁止动作、允许的外部服务"]
  tools: ["允许读取、写入和执行的能力"]
acceptance:
  functional: ["Given / When / Then"]
  quality: ["性能、可靠性、可维护性目标"]
evidence:
  required: ["测试、扫描、评审、运行观察"]
stop_when: ["冲突、证据不足、越权、预算达到上限"]

知识质量规则

维度最低要求失败处理
来源标注文件、系统或责任人;重要事实可回到原始来源无来源内容只作线索,不作决策依据
时效含版本、更新时间或有效期过期内容降权并提示人工确认
权限检索继承调用者权限,敏感字段最小披露越权时拒绝,不用“摘要”绕过
冲突保留冲突来源,不静默合并升级责任人确认优先级
引用关键结论绑定证据片段和定位无法引用时显式标为推测
注入防护把外部文本视为数据而非指令隔离、清洗、策略过滤与人工复核
不要让“记忆”替代事实

模型记忆可用于偏好和低风险便利信息,不应保存密钥、个人敏感信息、授权状态或关键业务事实。真正的事实必须来自受控系统,并在使用时重新校验。

07

技术与平台架构

通过模型网关、上下文服务、工具代理、隔离执行与证据存储建立稳定的平台边界。

Reference platform architecture / 参考平台分层
协作入口层IDE、代码评审、任务系统、运维台、知识门户人机交互
代理与编排层任务规划、状态机、超时、重试、预算、人工接管非确定性协调
模型网关层模型路由、版本锁定、限流、脱敏、缓存、供应商切换模型可替换
上下文服务层检索、代码索引、知识图谱、运行事实、引用与权限过滤可信输入
工具与执行层仓库、构建、测试、数据库、云平台;通过受控代理暴露能力最小化
隔离环境层短生命周期沙箱、网络出口控制、文件与资源配额限制故障半径
证据与审计层提示摘要、工具调用、变更、测试、审批、构建与发布记录可追溯
横切控制身份、策略、密钥、数据分类、成本、遥测、保留与删除全链路执行

关键组件契约

组件必须提供不得承担
模型网关统一身份、路由、版本、配额、审计与供应商降级替代业务授权或隐藏模型版本变化
编排器显式状态、幂等、超时、重试上限、人工接管和取消无限自循环或静默扩大任务范围
工具代理参数校验、资源范围、操作预览、结果摘要、审计 ID把原始管理员凭证交给模型
执行沙箱临时身份、资源配额、网络白名单、自动销毁共享生产密钥或持久化未审查状态
证据存储关联任务、主体、模型、上下文、变更、测试与批准无限保留敏感原始提示
策略引擎基于身份、环境、数据和风险做一致决策只依赖自然语言提醒执行安全边界

可靠性设计

  • 所有工具调用使用幂等键;重试不应重复创建资源或发送外部通知。
  • 编排状态持久化,模型超时或切换后可从已确认检查点恢复。
  • 模型输出先通过结构化模式和业务规则验证,再进入下游系统。
  • 外部模型不可用时支持降级为人工流程、较低能力模型或只读模式。
  • 关键决策记录模型和提示模板版本,但避免把秘密与完整敏感数据写入日志。
08

开发协作工作流

先建立可执行任务契约,再让模型计划、探索、变更、自证并交给独立复核。

任务定界

人明确目标、非目标、业务语义、风险等级、允许修改范围和验收方式;模型列出歧义与待确认假设。

只读探索

模型先理解仓库、依赖、历史决策与测试,输出影响面和风险;在计划确认前不修改。

可审查计划

说明将改哪些组件、如何验证、如何迁移和回退;高风险方案由领域或架构负责人批准。

小批量实现

每次只完成一个可验证增量,保持差异聚焦;模型同步代码、测试、配置与必要文档。

自检与证据

执行格式、类型、单测、契约、集成、安全扫描;模型解释失败,不通过删除测试或降低规则“修复”。

独立复核

由未参与生成的复核者或独立验证流程挑战业务语义、边界条件、性能、安全和可维护性。

合入与发布准备

确认差异、证据、风险、迁移、可观测性和回退;责任人批准后进入渐进发布。

变更说明必须回答

WHY / WHAT

为什么改、改了什么

关联目标和需求;列出行为变化、数据或接口影响,以及明确未做的事项。

HOW / PROOF

如何实现、如何证明

说明关键设计选择、测试结果、人工检查、已知限制和残余风险。

OPERATE

如何上线与观察

迁移顺序、功能开关、目标指标、观察窗口、告警与负责人。

RECOVER

如何停止与回退

回滚条件、步骤、数据兼容性、预计恢复时间和升级路径。

评审人不应只看模型摘要

摘要用于导航,不是证据。复核者必须能看到真实差异、关键上下文、测试结果与运行影响,并对高风险逻辑做抽样或逐行核对。

09

质量、测试与证据门禁

用三道证据门控制“能合入、能发布、能继续运行”,并保证验证独立于生成。

质量体系验证的是系统行为,而不是模型是否自信。任何由模型生成的实现、测试或说明,都应接受独立规则、独立数据或独立人员的检验。

GATE A

合入门

范围、代码规范、类型、单元测试、接口契约、秘密扫描、依赖许可和必要评审。

GATE B

发布门

集成与端到端、性能、安全、迁移、可观测性、回滚、变更审批和构建来源。

GATE C

运行门

金丝雀指标、错误预算、用户影响、资源成本、异常行为;不满足自动停止或回退。

测试组合

层次主要证明独立性要求典型门禁
静态与策略结构、类型、依赖、规则与权限合规规则由平台/安全维护必须自动通过
单元/属性测试局部逻辑、边界、不变量关键测试不只由同一生成上下文产生新增逻辑有覆盖,突变测试抽查
契约测试服务、事件和数据格式兼容消费者/提供者双方基线破坏性变更必须迁移
集成/端到端真实依赖与关键用户旅程隔离环境、稳定夹具核心路径零阻断缺陷
非功能性能、韧性、安全、可访问性生产相似负载与威胁模型达到质量属性预算
运行验证真实流量下的安全与价值独立遥测、对照或金丝雀指标健康才扩大流量

证据包结构

  • 任务 ID、负责人、风险等级、需求与验收标准。
  • 模型、工具、关键上下文来源与执行环境版本。
  • 代码/配置/数据差异和构建物摘要及完整性标识。
  • 自动测试、扫描、性能和兼容性结果;失败与豁免不隐藏。
  • 人工评审人、结论、时间和残余风险接受记录。
  • 发布、观察、回退计划和上线后的实际结果。
防止“测试迎合实现”

先于实现冻结关键验收样例;保留独立的隐藏测试、生产缺陷回归集和属性不变量;对关键代码使用差分、突变或影子流量验证。模型不应同时拥有修改实现、修改门禁和批准例外的权限。

10

安全、隐私与合规

假设提示、检索内容、模型输出、工具和依赖都可能成为攻击面。

威胁攻击方式主要控制检测信号
提示注入文档、网页、Issue 中嵌入恶意指令指令/数据分离、来源信任、工具策略、人工确认越权意图、异常工具序列
敏感数据泄露提示、日志、外部模型或输出带出数据分类、脱敏、私有路由、最小披露、保留策略DLP 命中、异常出站
过度代理模型扩大任务、删除资源、修改权限能力令牌、参数范围、预览、双人批准、熔断高风险动作、范围偏移
供应链污染引入恶意依赖、脚本或模型建议包允许清单、锁定版本、来源证明、漏洞与许可扫描新依赖、维护者变化、签名异常
不安全代码注入、鉴权缺陷、危险默认值安全基线、SAST/DAST、威胁建模、专门评审规则命中、运行攻击信号
模型/供应商变化行为漂移、数据策略或区域变化版本锁定、评测、合同、区域路由、退出方案基准回退、成本/延迟异常

权限设计:四个限定

IDENTITY

主体限定

每次调用绑定用户、服务和代理身份,禁止共享不可归属凭证。

SCOPE

资源限定

只允许指定仓库、路径、环境、数据集和操作类型。

TIME

时间限定

临时令牌、单任务有效、到期自动撤销,并支持紧急熔断。

INTENT

意图限定

能力与已批准任务绑定,超出目标必须重新授权。

数据处理分级

等级示例模型使用策略
公开公开文档、开源代码可使用批准模型,仍需防注入与许可检查
内部一般设计、内部代码企业合同/受控网关,不用于供应商训练
机密未发布商业信息、客户配置严格授权、脱敏或私有部署、细粒度审计
受限密钥、支付、健康、身份和高敏个人数据默认不进入模型;确需使用需专门批准与隔离控制
日志最小化

可审计不等于保存所有原始提示。记录决策所需的主体、时间、策略结果、工具调用、模型与上下文引用;敏感正文采用脱敏、哈希或受限短期存储,并执行删除请求和保留期限。

11

交付、运行与 SRE

把模型纳入发布准备、运行分析和复盘,但把生产控制权放在策略与责任人手中。

发布路径

可复现构建锁定依赖与环境
完整性签名来源与证据关联
预发布验证迁移、回退、指标
渐进流量影子/金丝雀/分批
自动判断SLO 与业务护栏
扩大或回退责任人确认

三层可观测性

PRODUCT

产品结果

任务成功率、用户转化、人工接管、错误决策、投诉和公平性。

SYSTEM

软件系统

延迟、流量、错误、饱和、依赖、队列、数据质量和 SLO。

MODEL LOOP

人机协作

模型版本、调用链、工具失败、上下文命中、重试、成本、越权拒绝和漂移。

事故响应分工

阶段模型适合做人必须做
发现与聚合关联告警、日志、发布和已知问题,压缩噪声确认真实用户影响与事故等级
诊断生成假设、检索历史、提出低风险验证步骤选择假设、控制实验范围
缓解根据运行手册准备命令和影响预览批准生产动作,必要时双人确认
恢复监测恢复指标、识别残余异常宣布恢复、决定观察窗口
复盘整理时间线、证据和候选改进项确定根因、责任边界、优先级与制度改进
自动修复的边界

只对高度可观测、动作可逆、影响面受限、运行手册成熟的故障开放自动修复;设置执行次数、时间和资源预算。连续失败、信号冲突或需要数据修复时立即转人工。

12

维护、演进与技术债

让模型降低理解遗留系统的成本,但不让它用局部重写掩盖架构问题。

维护阶段的最大风险是“代码更容易生成,系统更难理解”。因此要把可解释性、边界清晰度和知识新鲜度作为一等质量属性。

持续维护组合

工作流模型贡献人类控制完成定义
依赖升级兼容性分析、迁移草案、回归范围供应链风险和发布时间锁定版本、回归通过、可回退
缺陷修复定位候选、最小复现、补丁与回归测试根因和业务语义确认复现先失败、修复后通过、无旁路
重构调用图、重复模式、分步变更边界目标与行为不变判断差异可审查、指标不退化
架构现代化依赖盘点、绞杀路径、适配层草案目标架构与投资节奏可分阶段交付,旧路径可下线
文档维护检测代码/文档偏差、生成更新草案确认意图和决策仍有效文档与同一变更一并评审
知识回收从 PR、事故、会议中提炼候选知识去重、定责、批准和过期进入有所有者的知识基线

技术债账本

  • 债务类型:结构、测试、数据、依赖、安全、可观测性、知识与流程。
  • 证据:事故、变更前置时间、缺陷热点、复杂度、人工绕行和认知负担。
  • 利息:每次变更增加的时间、风险、成本与机会损失。
  • 偿还策略:顺手治理、专项重构、隔离封装、替换或接受并设复查日期。
技术债优先级 ≈ 发生概率 × 影响 × 变更频率 × 债务利息 ÷ 偿还成本
架构守护规则

将关键边界、依赖方向、接口兼容、数据所有权和禁止调用编码为架构测试或策略。模型越能快速修改代码,自动守护结构的价值越高。

13

度量、成本与效能

从流动效率、质量、风险、知识和经济性五个维度判断真实收益。

FLOWTTV

从想法到价值

任务等待、实现、评审、发布和验证的端到端时间。

QUALITYCFR

变更失败率

回滚、热修、事故与未达业务目标的发布占比。

RISKESC

升级与越权

需人工接管、策略拒绝、敏感数据命中和异常动作。

ECONOMY$/OK

每个成功变更成本

模型、算力、平台、人工评审、返工与事故摊销。

平衡计分卡

维度领先指标滞后指标防止误用
流动任务批量、等待时间、一次评审通过率前置时间、部署频率不按生成代码行数奖励
质量测试有效性、评审缺陷、证据完整度逃逸缺陷、变更失败率、MTTR不以覆盖率单指标替代质量
风险高风险动作拒绝、权限缩减、例外到期安全事件、数据泄露、合规缺口拒绝率高可能意味着任务设计差
知识引用率、文档新鲜度、ADR 同步率接手时间、关键人依赖、重复事故不以文档数量衡量知识质量
经济缓存命中、模型路由、重试率、人工接管每成功变更成本、云成本、事故损失低价模型导致返工时并不便宜

评测体系

  • 离线基准:来自真实任务的版本化题集,覆盖功能、维护、安全和工具使用。
  • 上线前回归:模型、提示模板、检索、策略或工具升级时运行对比,设硬性退化阈值。
  • 在线观察:按团队、任务、风险和模型分层,关注成功率、接管、返工和真实业务结果。
  • 人工校准:定期抽样评审模型评分与真实质量的相关性,防止评价器偏差。
成本预算是控制,不只是报表

对任务设置令牌、调用、工具执行、重试和墙钟时间上限;接近上限时压缩上下文、切换模型或请求人工判断。无限探索通常意味着任务边界或证据条件不清。

14

反模式与失效模式

识别那些“短期看起来更快、长期让系统变脆”的协作方式。

反模式为什么危险替代做法
一句提示交付整项工程假设、范围和风险不可见,差异难审任务契约 + 先探索 + 小批量检查点
模型既实现又自批相同盲点在生成和验证中重复独立测试、独立规则或独立复核者
把全部知识塞进上下文噪声、冲突、泄露、时效与成本失控权限感知检索 + 来源 + 最小上下文
只看代码能否编译业务语义、性能、安全和运行性未验证分层测试 + 质量属性 + 运行门
追求生成量和接受率鼓励大差异、浅评审与技术债积累衡量价值前置时间、返工和事故
生产凭证直接给代理指令注入或错误规划可扩大为事故短期能力令牌 + 工具代理 + 人工批准
文档自动生成后无人负责流畅但不准确,迅速形成错误权威文档所有者、来源、评审和过期机制
模型升级即自动切换行为、成本、延迟和安全能力可能漂移版本锁定、基准评测、金丝雀和回退
用模型掩盖坏架构代码更易写但耦合和认知负担继续增加边界治理、架构测试和债务账本

四个停止信号

STOP 01

目标冲突

需求、代码事实或约束互相矛盾,不能靠模型自行选边。

STOP 02

越权需求

必须读取、修改或调用未授权资源才能继续。

STOP 03

证据不足

无法构造可靠测试、环境差异过大或关键事实无来源。

STOP 04

风险扩大

差异、依赖或影响面超过任务契约,需重新分级与批准。

15

成熟度与落地路线

从个人工具试用,逐步演进为组织级、可度量、策略驱动的协作系统。

Maturity model / 五级成熟度
L1 / ASSIST个人辅助

零散使用、只读或草拟,规则依赖个人习惯。

目标:明确可接受使用和数据边界
L2 / CONTROL团队受控

仓库规范、任务契约、分支隔离、自动检查和人工审批。

目标:建立可重复工作流
L3 / PLATFORM平台标准化

统一网关、身份、上下文、沙箱、证据、评测与成本。

目标:规模化且不失控
L4 / OPTIMIZE数据驱动优化

按任务动态路由,端到端度量,模型与规则持续回归。

目标:优化质量、速度与成本
L5 / AUTONOMY策略内自治

低风险可逆任务自动完成,高风险即时升级,持续审计。

目标:让控制随风险自适应

90 天落地建议

第 1–2 周:建立边界与基线

选择一个低风险、高频、结果可验证的试点;完成数据分类、允许工具、风险分级、现状指标与责任人。

第 3–4 周:固化最小工作流

建立仓库说明、任务契约、只读探索、分支隔离、自动检查、人工评审和发布回退模板。

第 5–8 周:补齐平台控制

统一模型入口、身份、临时权限、日志、成本预算;建设真实任务评测集和版本升级门禁。

第 9–12 周:闭环与扩展

接入运行指标与事故回写;比较端到端质量、前置时间和成本,再扩展到相邻任务与团队。

试点选择矩阵

候选任务可验证性风险频率建议
文档同步、测试补齐、机械重构优先试点
常规缺陷修复、依赖升级在门禁完善后扩展
跨服务功能、数据迁移中高需要架构和迁移治理
权限、支付、安全核心逻辑仅作建议与辅助验证
生产删除、法律/权益决定极高不适合作为自治试点
16

模板与行动清单

把方法压缩成团队可以立即采用的最小工件和检查项。

最小工件集

工件关键字段所有者更新时点
任务契约目标、非目标、约束、验收、风险、权限、停止条件任务负责人开始前;范围变化时
仓库协作说明结构、构建、测试、规范、禁区、所有权代码所有者架构或流程变化时
ADR背景、选项、决定、后果、复查触发器架构/领域负责人重大决策时
证据包变更、测试、扫描、评审、风险、构建来源变更负责人合入与发布前
运行手册信号、诊断、动作、权限、验证、回退、升级服务负责人发布、事故、演练后
模型变更记录版本、用途、评测、风险、金丝雀、回退AI 平台负责人模型/提示/检索升级时
任务开始前检查
  • 目标与非目标清楚,关键术语没有歧义。
  • 风险等级、负责人和审批路径明确。
  • 允许读取、修改、执行和联网的范围已限定。
  • 验收标准可执行,关键样例在实现前冻结。
  • 冲突、越权、证据不足和预算耗尽的停止条件已写明。
代码合入前检查
  • 真实差异与任务契约一致,没有隐藏扩大范围。
  • 代码、测试、配置、迁移和文档保持同步。
  • 关键业务语义、边界条件和失败路径经过独立复核。
  • 所有自动门禁通过;失败和例外有记录、负责人和期限。
  • 未引入秘密、敏感数据、不必要依赖或不可解释生成物。
发布前检查
  • 构建可复现,来源、证据与批准记录可追溯。
  • 兼容、迁移、容量、安全和可观测性满足要求。
  • 发布批次、功能开关、金丝雀指标和观察窗口明确。
  • 回退动作可执行,数据向后兼容,恢复负责人在线。
  • 用户影响、支持沟通与事故升级路径已准备。
事故后回写检查
  • 时间线区分事实、假设和模型生成内容。
  • 根因不止归结为“模型出错”,还检查流程、权限和门禁。
  • 改进行动转化为测试、策略、文档、架构或培训。
  • 每项行动有负责人、期限和验证方法。
  • 相似系统与任务完成横向排查。

团队启动会议的五个问题

  1. 我们最想缩短的端到端工作流是什么,成功结果如何验证?
  2. 模型在这个工作流中允许知道什么、做什么、绝对不能做什么?
  3. 哪些判断必须由谁负责,什么情况自动升级或停止?
  4. 合入、发布和继续运行分别需要哪些独立证据?
  5. 我们如何把线上反馈、缺陷和事故变成下一轮更强的约束?
一句话落地

先选一个低风险且可验证的工作流,把任务契约、最小权限、独立证据和运行反馈做成闭环;确认质量和成本改善后,再扩大模型自主权与组织覆盖面。

  • Human-in-the-loop
  • Agentic Engineering
  • Context Engineering
  • Software Architecture
  • AI Governance
  • DevSecOps
  • SRE
  • Evidence-based Delivery