中文精炼导读

核心观点

  • Liquid AI 发布 LFM2.5-2.6B:一个专为"完全端到端在设备上运行智能体"设计的 26 亿参数模型,支持工具调用与多步工作流,同时小到能在笔记本甚至手机上跑,让开发者可以随处部署智能体、把数据留在设备上、且没有云端推理账单。
  • 后训练分四阶段把基座模型变成"智能体":两轮 SFT(重度偏向工具使用、网页搜索、harness 轨迹等智能体数据)→ 领域教师模型特化 → 多领域在线策略蒸馏(MOPD)→ 在真实 agent harness 里跑多轮强化学习(Agentic RL)。
  • Agentic RL 的工程亮点是把"模型优化 / 推理 / 环境执行"解耦,并通过 Harness Proxy 把 OpenClaw、Hermes Agent 等 harness 当作黑盒、无需任何修改即可捕获 token 级轨迹用于重建与校验 RL 训练样本。
  • 性能同级领先:与 4 倍于自身规模的模型相比,在工具使用、指令跟随与多步智能体任务上不落下风甚至反超——在几乎所有指令跟随基准和除 BFCLv4 外的所有工具使用基准上都是第一。
  • 推理效率出色:Apple M5 Max 上 220 tok/s、AMD Ryzen 上 113 tok/s、内存占用不到 2.5GB;30 tok/s 就足够在手机上跑起能用的智能体,高并发下单张 H100 每天可产出约 13 亿 token。
LFM2.5-2.6B 训练流水线:四阶段后训练
LFM2.5-2.6B 训练流水线:四阶段后训练

内容精讲

LFM2.5-2.6B 的定位一句话可以概括:为边缘设备打造"可靠的智能体模型"。它的卖点是三合一——具备与 4 倍规模模型竞争的工具使用、指令跟随和多步智能体任务能力;推理高效到 220 tok/s(M5 Max)、113 tok/s(Ryzen CPU)、内存不到 2.5GB;并且"智能体兼容性"不是事后添加,而是在训练期就在最流行的 agent harness 里训练出来的。对开发者来说,这意味着可以"随处部署智能体":数据不出设备、按使用量扩展而没有云推理账单。

预训练与中期训练先打底:模型在约 34 万亿 token 上预训练,中期训练阶段把上下文窗口扩展到 128K。随后的后训练把基座模型改造成智能体,共四个阶段。第一阶段是有监督微调(SFT),做两轮,数据权重重度偏向智能体类数据——工具使用、网页搜索、harness 轨迹等。第二阶段是教师特化:每个领域(数学、代码、工具使用等)各训练一个专精教师模型。第三阶段是多领域在线策略蒸馏(MOPD):把各领域教师蒸馏进单一学生模型。第四阶段是智能体强化学习(Agentic RL):在真实 agent harness 里跑多轮 RL,让模型学会跨不同工具、系统 prompt 与多轮任务环境工作。

Agentic RL 架构:训练引擎、Rollout 引擎与沙箱服务解耦
Agentic RL 架构:训练引擎、Rollout 引擎与沙箱服务解耦

Agentic RL 的流水线设计是这篇文章最见工程功力的部分。它把模型优化、推理与环境执行分成独立组件:训练引擎负责优化模型,Rollout 引擎用最新策略生成动作,RL 框架通过启动 rollout、收集轨迹与奖励、更新模型来编排训练循环;动作在沙箱服务里执行——Blackbox Harness 在其中承载 agent(如 OpenClaw 或 Hermes Agent)并协调与任务环境的交互。最关键的是 Harness Proxy:它让团队可以把智能体 harness 当作"黑盒"使用而无需任何修改,同时透明地捕获重建与校验 RL 训练样本所需的 token 级轨迹。换句话说,真实世界里 agent 是怎么跟工具、环境打交道的,RL 训练就用这些真实交互来教模型。

基准结果印证了"小模型也能当 agent"。团队把 LFM2.5-2.6B 与约 4 倍于其规模的模型组(gemma-4-E2B-it 5.1B、gemma-4-E4B-it 8B、Qwen3.5-4B、Qwen3.5-9B)放在 STEM、指令跟随、工具使用与智能体任务上对比。它是组里最小的,却能与其余模型竞争并经常取胜:AIME25 数学 51.87(仅次于 9.7B 的 Qwen 56.07)、IFBench 指令跟随 59.17 全场最高、Multi-IF 80.07 全场最高、IFStruct 85.49 全场最高、ToolSandbox 77.83 全场最高、τ³-Bench Banking 5.67 全场最高、Claw-Eval(EN)62.85、PinchBench 68.22、BrowseComp+(OpenClaw)26.89 领先所有对比模型。文章给出的结论很具体:对应用来说,LFM2.5-2.6B 的优势在指令跟随与工具使用——在本文覆盖的每个指令跟随基准上都是第一,除 BFCLv4 外每个工具使用基准都是第一(BFCLv4 只有 9.7B 的 Qwen 领先);在智能体任务上它击败两个 Gemma、与两个 Qwen 持平;在知识与数学上也有领先或接近的表现;代码是唯一让更大模型保持明显优势的领域,需要更强代码能力就选更大的模型。

各基准上的模型对比
各基准上的模型对比

推理性能是"随处部署"承诺的根基。模型发布当天就支持全套推理生态:llama.cpp、MLX、vLLM、SGLang、ONNX。CPU 推理方面,得益于高效的 LFM2 架构,LFM2.5-2.6B 是团队测试过最快的模型——M5 Max 上解码速度 220 tok/s,Ryzen AI Max+ 395 上 113 tok/s;而 30 tok/s 就足以在手机上运行能用的智能体。GPU 推理方面,它是同尺寸级别最快的模型,高并发下输出吞吐接近每秒 1.5 万 token——单张 H100 每天约 13 亿 token。

使用与落地很直接:`pip install -U transformers`(需 ≥5.0.0),用 Hugging Face 的 AutoModelForCausalLM 加载 `LiquidAI/LFM2.5-2.6B` 即可;他们还提供了一个浏览器 WebGPU demo,无需配置即可在浏览器里体验由该模型驱动的"研究智能体"——帮用户研究特定问题并生成摘要。LFM2.5-2.6B 与 LFM2.5-2.6B-Base 今天都在 Hugging Face 上可下载,官方还提供了在 OpenClaw、Hermes Agent、Pi 等 harness 里跑本地智能体的指南。

阅读价值

适合做端侧/本地 LLM 应用、隐私敏感场景或高并发低成本推理的工程师,以及关注"小模型 + agent"技术路线的研究者:这篇文章完整展示了"如何用四阶段后训练把 2.6B 模型调教成可靠智能体"的方法论(尤其是把真实 harness 当黑盒做 RL 的训练管线),并有详尽的多基准对比与 CPU/GPU 实测数据,是评估边缘 agent 模型的理想参考。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://huggingface.co/blog/LiquidAI/lfm2-5-2-6b