核心观点
- LFM2.5-2.6B 是专为端侧 Agent 打造的小模型:支持工具调用与多步骤工作流,体积与速度足以在笔记本、手机等日常硬件上运行。
- 性能对标约 4 倍规模模型:在工具使用、指令跟随和多步 Agent 任务上不落下风,7 项指令跟随/工具调用基准拿到 5 项第一。
- 推理效率亮眼:Apple M5 Max 上 220 tok/s、AMD Ryzen CPU 上 113 tok/s,占用内存低于 2.5GB,手机上 30 tok/s 也够跑 Agent。
- 后训练是「在 Agent 环境里炼模型」:四阶段流程(SFT → 专家教师 → 多域蒸馏 → 真实 harness 内的 Agentic RL),并配套 black-box harness 采样基建。
内容精讲
端侧 AI 的叙事正在从「跑个聊天机器人」升级为「跑一个真正的 Agent」。LFM2.5-2.6B 把目标定在这里:让工具调用、多步骤工作流完整在设备端跑起来,数据留在本地,规模上量不产生云推理账单。34T token 预训练、128K 上下文窗口、不到 2.6B 参数,这是当前端侧 Agent 模型里最有代表性的配置之一。
**后训练:从通用模型到 Agent 的四级火箭。** 预训练之后,模型被分四步锻造成 Agent。第一步 SFT 两轮,训练数据强烈偏向工具使用、网页搜索、harness 轨迹等 Agent 类数据;第二步教师特化,为数学、代码、工具使用等每个领域单独训练一个专家教师;第三步多域在线策略蒸馏(MOPD),把多位专家教师蒸馏进单个学生模型;第四步 Agentic RL——在多轮、多工具、多系统提示的真实 Agent harness 环境里跑强化学习。把 RL 放进真实 harness,是为消除「训练环境与部署环境不一致」这一 Agent 模型的经典痛点。
**配套基建值得单独关注。** Agentic RL 流水线把模型优化、推理、环境执行拆成独立组件:Training Engine 负责优化模型,Rollout Engine 用最新策略生成动作,RL 框架编排训练循环(启动 rollout、收集轨迹与奖励、更新模型);动作在一个 Sandbox Service 中执行,Blackbox Harness 承载 Agent(如 OpenClaw、Hermes Agent)并与任务环境交互。Harness Proxy 让各种 harness 以黑盒方式接入而无需修改,同时透明捕获 token 级轨迹,用于重构和验证 RL 训练样本。这套设计让「在别人的 Agent 框架里训练模型」成为可复现的工程。
**基准:小身材,大嗓门。** 评估对象是比自己大最多 4 倍的模型:gemma-4-E2B(5.1B)、gemma-4-E4B(8B)、Qwen3.5-4B(4.7B)、Qwen3.5-9B(9.7B)。结果很有层次:指令跟随是强项——IFBench 59.17 全场第一、Multi-IF 80.07 第一、IFStruct 85.49 第一;工具使用同样领先——BFCLv4 56.88(仅次 9.7B Qwen)、ToolSandbox 77.83 第一;Agent 任务上与 Qwen 持平、全面胜过 Gemma(τ³-Bench Banking 5.67、Claw-Eval 62.85);AIME25 数学 51.87,仅次于 Qwen3.5-9B。唯一明显的短板是代码:更大的模型保持清晰领先。结论很直白——端侧场景选它,重码场景选大的。
**效率:快到可以忽略推理成本。** 得益于 LFM2 架构,LFM2.5-2.6B 在测试中是最快的小模型:M5 Max 上 220 tok/s、Ryzen AI Max+ 395 上 113 tok/s,内存占用 <2.5GB;即使在手机上以 30 tok/s 运行,也足以支撑一个能用的 Agent。GPU 侧同样亮眼:高并发下接近每秒 1.5 万输出 token,单张 H100 一天可产约 13 亿 token。生态支持首发即齐:llama.cpp、MLX、vLLM、SGLang、ONNX 全部可用。
**用它意味着什么。** 对开发者,模型名 `LiquidAI/LFM2.5-2.6B` 已在 Hugging Face 开放下载,还提供了浏览器里直接跑的 WebGPU demo 和一个真实的科研 Agent 演示。对行业,2.6B 参数在 Agent 任务上追上 4 倍规模模型,说明 Agent 能力的「规模门槛」正在被训练方法(尤其是 Agentic RL 与 harness 内训练)显著下压——本地、私密、零边际成本的 Agent 部署,第一次看起来像是个可行选项。
阅读价值
对做端侧应用的工程师,这是小模型 Agent 化的完整配方:四阶段后训练、black-box harness 采样、效率数据都可直接借鉴;对关注 Agent 与边缘计算的读者,它提供了「能力门槛下压」的量化证据,可用来判断本地 Agent 的成熟度。

内容与图片版权归原作者所有 · 原文: https://huggingface.co/blog/LiquidAI/lfm2-5-2-6b