Addy 把工程师角色从代码执行者挪到系统治理者,给了一整套判断框架,适合正在搞 AI 工程实践的人看。
Addy Osmani 指出在 AI 辅助编程时代,工程师应守住外环(outer loop)的决策与问责,而非内环执行。他提出三个关键词:质量(通过测试、类型、沙箱产生证据)、裁决(人工最终决定放行还是拒收)、可交代性(事后能解释决策链)。数据表明 Sonar 约 42% 提交已是 AI 生成或显著辅助,但审查能力稀缺,形成信任-验证缺口。Osmani 强调模型越强(如 Claude Fable 5、GPT-5.6),杠杆越大,义务越大。
推荐 Addy Osmani 最新分享「Own the Outer Loop」 Agent 可以写代码,但工程师必须守住边界上的决定与后果! 过去一年,大家谈 harness、loop、fleet...
推荐 Addy Osmani 最新分享「Own the Outer Loop」 Agent 可以写代码,但工程师必须守住边界上的决定与后果! 过去一年,大家谈 harness、loop、fleet、software factory,话语越来越“工厂化”。Osmani 的判断是:真正该守住的,不是内环执行,是外环问责——谁能说清改了什么、为什么安全、错了怎么办。说不清,组织就不会真正把关键系统交给你。 模型越强(Claude Fable 5、GPT-5.6),这点越关键:杠杆越大,义务越大。 三个关键词 · Quality(质量) 放行前装上的检查:测试、类型、沙箱、审计、监控。它们产出证据,不是感觉。 · Verdict(裁决) 进入依赖系统前的最终决定:放行、拦住、改道、收窄、加护栏,还是直接拒绝。 模型可以写台词,裁决必须是人的——“挂我名字的内容,我来拍板”。 · Answerability(可交代性) 有人追问时,你能讲清为什么。长时程 agent 会做大量中间决策,很多追不到原始 token;若不把可交代性写进系统设计,事后重建决策链会贵到做不起。 一句话:质量产证据 → 证据支撑裁决 → 裁决必须可交代。 系统分层:他怎么画这张图 · Model:引擎 · Harness:车——工具、记忆、权限、沙箱、测试、可观测、恢复 · Loop:调查 → 实现 → 验证 → 再来;且“做完”由独立检查判定,不是模型自说自话 · Factory:很多 loop 并行;agent 在里面干活,人在边界上做决定 边界内外各干一件事: · 里面是 capability:调查、实现、验证、回报——模型已经能做 · 外面是 agency:决定、核实、批准、承担——仍属人 所以不是“人退出工程”,是人从内环执行,挪到外环治理。 为什么现在特别急 数据指向同一缺口: · 生成变便宜(Sonar:约 42% 提交已是 AI 生成或显著辅助) · 稀缺的是审查、验证、理解、维护 · 生成速度跑赢了控制速度 → trust–verification gap · GitLab:治理常发生在代码已写出、风险已吃下之后——控制权已经丢了半截 他的提醒很实在:很多人嘴上不信 AI 代码,却没把这种不信写进验证流程。这比盲目信任更危险。 人该站在哪 人不需要卡在内环每一拍。人该在: · 约束环:输入、架构、指令、不变量 · 抽样环:抽多少、看什么 · 审计环:留什么证据、审计是否有效 · 所有权环:生产边界上哪一段归你 Agent 可以产出超过你能逐行看完的量。稀缺资源是带质量信号的人类判断。Quality 在这里被说成 back pressure(背压):不是给 agent 最大自主,是给到你还能拦住、调节、核查、保住人的判断力。 三个隐性成本 1. Cognitive surrender(认知投降) 把 agent 输出当成自己的答案,连带责任一起吞下。Wharton:AI 错时,近四分之三的人仍接受,且更自信。 2. Cognitive debt(认知债) 理解力被掏空。Anthropic RCT:靠 AI 写代码的人,理解测验低约 17 个百分点(50% vs 67%)。时程越长,债滚得越快。 3. Orchestration tax(编排税) Agent 能并行,人的注意力不能。纠偏、分拣、排序、先验硬约束——这些没法全自动化。 Brownfield 尤其险:要审计的行为往往不在代码里,而在伤疤里——历史事故、潜规则、数据怪癖、runbook。 品味、Alpha、Decay 当谁都能做时,选做什么更值钱。 · Alpha:高价值一手 · Decay:人人会的套路,会平台化 · Taste:证据还没齐时,先感到风向在变 工程上的下一步:把品味操作化——命名、用 critique 练、把理由写清楚。职业优势从“会做任务”,上移到:教会、系统化、决定何时做、并对结果负责。 他分得很干脆:人人都能是 developer;engineer 是更严的纪律——推理、约束、权衡、风险、问责。 工厂的十二根柱子 Brownfield 才是规模化的真战场。要把隐性知识变成显式约束,跨团队、跨代际保持一致,落成测试与规格,并绑到客观证据上;失败要能反哺学习。 自动化会制造新瓶颈——而这恰恰是值得人去拥有的瓶颈:从“能不能做”变成“该不该存在、能不能交代”。 操作模型可以概括为一句: 建工厂;保持运转;让工作可读、可验、有主。 Addy Osmani @addyosmani x.com/i/article/2074… 🔗 View Quoted Tweet 💬 2 🔄 0 ❤️ 3 👀 587 📊 3 ⚡