核心观点

内容精讲

Agentic 工程的主流叙事已经从「提示」转向「操作」:软件工厂、目标、循环、后台会话、子 Agent、hooks、沙箱、Agent 审批 Agent——这些词正在成为新一代产品的 day-1 功能。对工程师而言,核心问题始终是:一个动作该配多高的自主度,以及什么样的验证能让这个自主度站得住脚。

**双轴取代单梯。** 常被引用的 Steve Yegge 单轴阶梯(Welcome to Gas Town)用单一数字衡量你对单个 Agent 的信任度,在 2026 年初「从委派转向编排」时还是不错的风险度量。但当你开始同时运行很多 Agent,单根横档就无法度量「多 Agent 技能」。几乎每一场自主度争论都在混淆两个问题:我们允许这个 Agent 离自己多远(agency 轴),以及我们协调多个 Agent 的能力如何(orchestration 轴)。

**两条轴各自的刻度。** agency 轴从低到高:低端是「建议候选动作、等人类决定」;中端是 Agent 处理特定任务,但界定自己的行为范围、不断用证据回报,让人持续掌舵;高端是 Agent 朝目标工作——实验、学习、测试、找解法、被卡住、提问、换方案,把全部工作以证据的形式交回。orchestration 轴:低端是一个 Agent 一条线程;中端是几个 Agent 各在自己的 worktree 里、朝不同目标工作但彼此隔离;高端是编排器接管 backlog、issue 追踪、日程或队列,把它们转化为持续工作流,人只在失败时介入——「例外管理」。

**六个台阶与三个时代。** 把双轴合起来看,六个级别代表三段时间线:Level 0 Assist(Agent 提建议、你决定,验证在本地)——驾驶座时代;Level 1 Supervised action(Agent 代为编辑或执行,做任何有后果的事前先问——大多数人的默认姿态,失败模式是「审批疲劳」);再到更高级别的有界自主与目标驱动——委托时代;再到编排时代,系统有能力派发工作、你只需在出错时出现。把六层看成单次上升的阶梯,其实是因为 orchestration 只在顶端才显著介入。但正常的一天会多次上下这些台阶,几个时代间来回切换是常态。

**落地中的产品矩阵。** 这套框架不是空想:Claude Code 的 /plan、/goal、/loop、/background、/batch、/code-review、/security-review、subagents、hooks、checkpointing、后台会话、/schedule;Codex 的 local/cloud threads、Goal mode、worktrees、Automations、subagents、review panes、auto-review、rerun——这些能力都不适配单梯,正好印证双轴模型。管理者 Agent(被触发词唤醒、委派给助手并持续验证、只把人必须做的决策带回)已在许多 evergreen 代码库上以数百上千 Agent 的规模运行。

**判断的落点。** 对每个动作问「这个任务配什么级别、什么验证能让级别站得住」——低自主度不是退步而是杠杆:限制风险、提高可逆性;高自主度只给「明确活动」和「大规模并行安全重构」。设计自主度矩阵的能力,正成为 Agent 时代工程管理最核心的元技能。

阅读价值

对使用 Claude Code/Codex 等工具的工程师,这张自主度地图把「给 Agent 多大权力」变成了可讨论、可配置的工程决策,而不是玄学;对 Agent 平台设计者,agency/orchestration 双轴提供了一个设计自主度配置与验证机制的概念框架。

自主度分级示意图
自主度分级示意图
阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://addyosmani.com/blog/agentic-autonomy-levels/