核心观点

内容精讲

**1. Harness概念与设计模式**

Harness是围绕基础模型的系统层,负责编排执行、决定模型如何思考和计划、调用工具、管理上下文、存储工件并评估结果。与早期agent框架不同,现代harness更接近运行时和软件系统设计,包含工作流设计、权限控制、持久状态管理等。三种核心设计模式:工作流自动化(目标导向的规划-执行-观察-改进循环)

;文件系统作为持久记忆(将状态和工件存储在文件中,避免上下文膨胀);子代理和后端作业(并行执行子任务,通过文件系统管理状态)。这些模式借鉴操作系统设计,封装复杂逻辑,保持接口简单。

**2. 上下文工程:从ACE到MCE**

上下文管理是harness的核心挑战。Agentic Context Engineering (ACE) 将上下文视为不断演化的"战术手册",通过生成器、反射器和策展器三个组件维护结构化要点列表,避免上下文崩溃和简洁性偏差。

Meta Context Engineering (MCE) 进一步分离机制与内容,在元层面进化技能(定义上下文函数),在基础层面优化上下文。技能包含静态组件(提示、知识库)和动态算子(搜索、过滤、格式化),通过双层优化找到最优上下文。

MCE不强制启发式规则,而是自由形式技能与上下文迭代共进化。

**3. Meta-Harness:优化harness的harness**

Meta-Harness将优化目标提升到harness代码本身:一个编码agent作为提议者,生成新的harness候选(包含源代码、分数、轨迹等),通过外循环迭代创建并筛选Pareto前沿上的harness。

在Terminal-Bench-2上,从强基线(Terminus-KIRA和Terminus-2)初始化的搜索能进一步提升性能。

关键启示:一旦harness设计成为可执行的搜索空间,强编码agent就能利用与人类工程师相同的设计空间。

**4. 工作流设计自动化**

工作流设计可从手工转向自动搜索。AI Scientist构建了从想法提出到论文撰写的全自动流水线

;ScientistOne强调可验证性,每个声明必须追溯证据源。Autodata agent通过挑战者、弱求解器、强求解器和验证器角色生成"恰到好处"难度的合成数据

。Automated Design of Agentic Systems (ADAS) 将agent设计形式化为优化问题:元agent从存档中启发新设计,用代码实现并自我精炼,评估后加入存档

。AFlow将工作流表示为图,节点为LLM调用,边为逻辑操作,通过MCTS搜索优化工作流

,在QA、代码、数学任务上超越手工设计和ADAS

**5. 自我改进Harness**

Self-Taught Optimizer (STOP) 递归改进改进器本身:种子改进器优化解决方案,元效用衡量改进器性能,然后改进器自我改进。

STOP发现了遗传算法、模拟退火、束搜索等多种策略,但仅在GPT-4上有效,弱模型(GPT-3.5、Mixtral)会退化。

Lin et al. 进一步解耦了harness更新能力和harness收益能力,发现从Qwen3.5-9B到Claude Opus 4.6的模型在更新能力上持平,但收益能力非单调,中等模型获益最大。

Self-Harness 通过弱点挖掘、有界提议和验证循环更新harness,针对模型特定弱点学习指令,在Terminal-Bench-2上提升通过率。

Agentic Harness Engineering (AHE) 围绕可观测性构建闭环:组件可观测、经验可观测、决策可观测,每个编辑与可证伪预测配对。在Terminal-Bench-2上超越人工设计harness(OpenCode、Terminus-2、Codex),且冻结后迁移到SWE-bench Verified。

**6. 进化搜索**

进化搜索适用于搜索空间怪异且难以梯度优化的场景。AlphaEvolve 存储候选程序池,用冻结LLM生成diff改进,通过反复评估和保留优秀子代发现更好解。

消融实验显示进化过程、上下文提示、元提示、全文件进化等设计的重要性。

Darwin Gödel Machine (DGM) 允许agent修改自己的harness代码仓库,在SWE-bench Verified上从20%提升到50%,在Polyglot上从14.2%提升到30.7%。进化搜索依赖可自动评估的任务,在评估慢或模糊的领域效果有限。

**7. 联合优化与未来挑战**

SIA 尝试在同一个优化循环中结合harness改进和模型权重更新,由元agent、任务agent和反馈agent组成,反馈agent决定下一轮更新类型。

但实验设计存在混淆(任务agent弱于元agent),结果尚需验证。未来挑战包括:弱评估器(研究品味难以量化,当前自我改进循环在可客观评估的任务上效果最好);上下文与内存生命周期(需持久化关键信息,避免长项目丢失细节);负面结果(文献偏向成功,模型难以放弃假设);多样性崩溃(进化倾向利用已知高奖励模式,需防止种群同质化);奖励黑客(过度拟合测试或评判模型,评估器应位于循环外);长期成功(短期优化忽视可维护性、兼容性等);人类角色(人类应提升到监督层次,在适当抽象层提供反馈)。

阅读价值

适合AI研究者和工程师阅读,了解自我改进AI系统的最新进展和工程实践。读完可获得对harness工程全貌的把握,包括设计模式、优化方法(上下文工程、工作流搜索、进化算法)以及未来挑战,为构建自主进化的AI agent提供技术路线参考。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://lilianweng.github.io/posts/2026-07-04-harness/