中文精炼导读
核心观点
- Addy Osmani(基于他在 AI Engineer World's Fair 2026 的闭幕主题演讲)论证:工程师需要"拥有外层循环"——对 agent 系统的问责。agent 有杠杆,杠杆带来义务:必须有人能解释"到底改了什么、为什么安全、出错会怎样",否则行动无法被正当化,组织也不会请求它们。
- 三个关键概念:Quality(质量)——放系统出去之前安装的全部检查,它们产生证据;Verdict(裁决)——工作进入依赖系统前我们做的最终决定(发布、阻止、重定向、收窄、加护栏或整体拒绝),"模型可能写出那行,但裁决是我的";Answerability(可问责)——如果有人问起,我能解释为什么。
- 结构清晰:agent(模型 + harness)运行循环(调查 → 实现 → 验证 → 重复),循环构成软件工厂;"agent 是引擎,harness 是围绕它造的车,循环是让一次好的运行变成可重复信任的流程,工厂是规模化的循环——agent 在内部交付工作、人在边界拥有决策"。
- 现状与缺口:Sonar 2026 State of Code 报告显示 42% 的提交代码由 AI 生成或显著辅助,但"生成速度跑在了控制速度前面"——创造变便宜了,稀缺资源变成评审、验证、理解与维护,形成"信任-验证差距";GitLab 2026 报告更令人担忧:治理通常发生在代码创建之后、在已经接受风险并失去所有权之后。
- 三个隐藏成本:认知投降(Cognitive surrender——盲目接受 AI 给的东西,AI 错了时近四分之三的人仍接受且更自信)、认知债务(Cognitive debt——委托 agent 后理解侵蚀;Anthropic 随机对照试验显示用 AI 写代码的工程师在理解测试上比手写者低 17 个百分点)、以及编排税(orchestration tax——现在轻易能拉起一群 agent,但你的认知带宽是瓶颈)。

内容精讲
演讲开场陈述核心立场:过去一年围绕 agentic engineering 的讨论已转向 harness 与循环、车队与软件工厂,而 Osmani 的"两分钱"是工程师需要拥有外层循环——随着 Fable、GPT-5.6 这类强模型出现,这一点只会更真。他定义的 agent 是"模型 + 一套 harness(文件、工具、记忆、技能、沙箱、权限、可观测性、恢复)";循环是"调查、实现、验证、重复";软件工厂就是由此创造出来的。"模型只是引擎,harness 是围绕引擎造的车,让它能安全地做真实工作";把 harness 包进可重复的循环——调查、实现、验证、重复——由一个独立的检查(而非模型自说自话)决定工作何时完成;再让许多循环同时运行,就得到工厂。
工厂的核心是"系统内"与"系统外"之间一条谨慎的边界。系统内:收集输入(产品团队意图、已交付工作的知识、近期事件、用户的具体反馈),agent 循环调查任务、实现计划、验证结果;然后证据跨过边界——拥有依赖系统的人类看到证据、决定是否继续。这就是正在发生的转变:以前 agent 做的是执行循环的内层,现在它们运行内层执行循环,工程师拥有外层循环。系统内部只有一种东西:capability(能力)——调查任务、实现计划、测试结果、报告回来,这是模型的能力,那个未来已经到来;系统外部也只有一种东西:agency(能动性)——决定、验证、批准、拥有。仍在谈论代码,但它需要存在于一个地方、由懂行的人执行。
数据印证了紧迫性。Sonar 2026 调查:团队被问及提交中 AI 辅助的占比,"小但非微不足道",且多名受访者预期会大幅增长;Sonar 2026 State of Code 报告显示 42% 的已提交代码由 AI 生成或显著辅助,且预期继续增长而非触顶。作者点出关键错位:"创造正在变便宜,稀缺的是评审、验证、理解与维护。我们把生成速度推进得比控制速度快,于是有了信任-验证差距。"很多人仍对 AI 代码表达一定程度的不信任,但越来越少人把这种不信任一致地构建进验证流程——这是一个危险的位置。需要更便宜、更清晰的方法来验证 AI 代码的可信度。GitLab 2026 年 6 月的 AI 问责研究表明:评审与验证是使用 AI 时当前的瓶颈,更令人担忧的是"治理通常发生在代码创建之后、在我们已经接受风险并失去所有权之后"。
关于 process 与 quality 的区分:quality 是"背压"(back pressure)的概念——不是授予 agent 尽可能多的自主权,而是授予刚好足够的自主权、留有足够的背压去阻止、规范、检查它们的工作、确保我们的人性。普通工程已经持有大量表明"工作正在做对"的信号:类型检查、测试、钩子、沙箱限制、审计日志、监控——工程系统充满这类信号,只要 agent 也在发出同样的信号,就能信任普通工程提供恰当的背压。"信任系统不意味着不想要人在环里,只是人不需要在内层循环里"——人在约束循环(设什么输入/架构/指令/不变量)、采样循环(采样并评审多少输出)、审计循环(保留什么证据、如何确保审计日志有效)、所有权循环(拥有生产边界的哪部分)里。但人不需要在内层循环里——agent 能交付你审查不过来的东西,稀缺的是你自己核心的人类判断力,由日志或测试这类质量信号来提供信息。
可问责性为何必须成为系统设计的核心:AI June 2026 报告显示实验性设置中"小时尺度时间视界的 agentic 委托"基本已到来;长视界 agent 在小时尺度上做的决定就是决定,且并非所有决定都会被记录、无法全部追溯到输入 token。如果你只是在信任"得到的输出是当前问题的正确选择",那么重构导致它的决策链所需的数百甚至数千小时人工将变得不可能。因此可问责性必须处于系统设计核心。
三个隐藏成本。认知投降:委托给 agent 的工作看起来是 agent 的工作,但其实是你的工作、你的声誉、你的责任——出错的软件是你的,需要修改以反映输出的软件也是你的;agent 的输出成为你的答案,连带所有问责。沃顿研究在 AI 正确时令人安心,但 AI 错误时消息不佳——近四分之三的人仍然接受了错误的答案,且比没有 AI 时更自信。认知债务:把工作委托给 agent 就是把所有思考工作卸载给 agent——自己在庞大的代码库上思考需要无法获得的资源,于是得到的输出往往"你无法企及";agentic 规划的时间视界越长,agent 产出的代码与你的理解之间的差距越大,差距复合、债务积累、学习曲线的成本几乎指数增长。Anthropic 的随机对照试验结论令人沮丧:理解测验上,借助 AI 写代码的工程师比亲手写的人低 17 个百分点(50% vs 67%)。编排税:现在很容易拉起很多 agent,但你的认知带宽并不会随之扩展——最终一切会崩溃。
"新工作也是真正的工作":规模化后工作会变得更有趣——当其他一切都建好了,人们会想建造新东西:运用通过技艺发展出的 alpha 与品味设计可嫁接到软件工厂上的新循环、构建承载软件工厂全部知识的原则性绿地系统、设计能上升到验证级别的新证据形式、照料复杂到需要专门关注的棕地系统、设计与管理新的背压机制、设计新 agent、构建能动性——而这一切都是真正的工作。自动化创造瓶颈:生产中的瓶颈值得拥有,因为自动化给了我们对工业规模的控制;但工业规模也带来新瓶颈——瓶颈从"我们能造这个吗"移到"这该存在吗、我们能为其负责吗"。他建议的实用运营模型:内层循环是做工作的地方、被设计得尽可能独立、把所有质量保证与验证放进循环;一旦设计并验证了循环本身,剩下要做的就是用背压机制授予自主权(控制循环运行的速率与操作范围)、把人放在应有的位置、放在正确的决策上;不要把理解当作交接或发布门,而是当作人类准备提供洞察的决策点;为每一个回流到生产与新团队的制品留下更好的制品。"建好工厂,让灯亮着,让工作清晰、可验证、有主"——agent 可以写它,但在它到达用户之前,必须有人解释它为什么应该存在、为什么足够安全成为生产的一部分、以及它出错时你会做什么。这就是外层循环的 agentic engineering——这就是现在的工作。
阅读价值
适合工程管理者、平台与技术负责人以及所有把 agent 引入团队工作流的人:这篇文章用 Quality/Verdict/Answerability 三个概念和"内外循环"框架,把"agent 时代工程师的职责从写代码转向拥有决策与问责"讲得很具体,并给出三个隐藏成本(认知投降、认知债务、编排税)与实证数据;对设计 agent 化开发流程、划定人机责任边界有直接指导意义。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://addyosmani.com/blog/own-the-outer-loop/