首页
/
模型
/
LFM2.5-2.6B:随处部署智能体(8分钟阅读)
LFM2.5-2.6B:随处部署智能体(8分钟阅读)
摘要
Liquid AI 发布了 LFM2.5-2.6B,这是一款紧凑的智能体模型,设计为完全在设备端运行,从而实现免费推理、低延迟和隐私保护。文章详细介绍了其训练流程,包括 SFT、教师特化、蒸馏和智能体强化学习。
LFM2.5-2.6B 是一款拥有 2.6B 参数的端侧智能体模型,通过在手机或 CPU 等硬件上本地运行,实现免费推理、低延迟和强隐私保护。
查看缓存全文
缓存时间:
2026/08/05 13:33
# LFM2.5-2.6B:将智能体部署到任何地方
今天,我们发布 **LFM2.5-2.6B**,一款完全在设备端运行的智能体模型。它足够小,可以在手机上运行;足够快,在 CPU 上也能保持响应;能力足够强,能够驱动智能体工作流:规划、调用工具和处理多步骤任务。
与依赖云 API 的智能体不同,本地智能体提供免费推理、低延迟和真正的隐私。消除按 token 计费的成本改变了开发者的构建方式:智能体现在可以在本地硬件上大规模并行化,运行消耗数百万 token 的后台任务而无需额外成本。当 token 开销不再是约束时,智能体可以全天候在任何地方运行。
基础模型(LFM2.5-2.6B-Base)和后训练模型(LFM2.5-2.6B)今天已在 [Hugging Face](https://huggingface.co/LiquidAI/LFM2.5-2.6B) 上提供。查看我们的[文档](https://docs.liquid.ai/lfm/models/lfm25-2.6b),了解如何在本地运行和微调它们。
## 训练
LFM2.5-2.6B 是一个 2.6B 参数的模型,专门为智能体工作负载训练。它在大约 34T token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过[就地扩展现有 tokenizer](https://www.liquid.ai/blog/tokenizer-expansion) 将词表扩大了一倍至 128K,而不是从头重新训练模型,采用了与 [LFM2.5-8B-A1B](https://www.liquid.ai/blog/lfm2-5-8b-a1b) 相同的流程。训练中期包含一个专门的 128K 上下文扩展阶段,使模型能够处理智能体工作负载所需的长输入。
该示意图总结了将 LFM2.5-2.6B-Base 转化为智能体版 LFM2.5-2.6B 的四阶段后训练流程:**监督微调**(SFT)、**专家教师化**(Teacher Specialization)、**多领域同策略蒸馏**(MOPD)和**智能体强化学习**(Agentic RL)。
**监督微调。** 后训练从两个连续的 SFT 阶段开始:首先是覆盖所有领域的广泛训练,然后是针对优先技能(如智能体任务、推理和工具使用)的定向塑造。在这两个阶段中,SFT 训练混合数据量约为 LFM2.5-8B-A1B 所用数据的七倍,其中更侧重智能体任务,例如工具使用、网络搜索、软件工程和智能体轨迹。最终的 SFT 检查点既作为学生模型,也作为训练一组专家教师以用于后续蒸馏阶段的初始化检查点。
**专家教师化。** 从共享的 SFT 检查点出发,我们针对每个目标领域训练一位专家:先在重新加权后的数据混合上进行一轮聚焦的 SFT,然后进行基于可验证奖励的强化学习(RLVR)。由此产生的专家模型覆盖指令遵循、数学、知识(包括幻觉控制)、代码、工具使用和长上下文。分别训练它们可以让每位专家在自己的领域内深入优化,使用针对性的数据和奖励,而不会受到无关目标带来的竞争性更新干扰。
**MOPD。** 然后,我们使用这些专家教师,将他们的能力蒸馏到一个学生模型中。与离策略蒸馏(学生从另一个模型生成的轨迹中学习)不同,MOPD 允许学生在其自身策略下进行 rollout。每个提示会被路由到对应领域的教师,由教师以 token 级反馈监督学生的响应。
由于教师与学生源自同一个 SFT 检查点,他们的反馈与学生的分布保持足够接近,从而能够在不大幅扰动训练的情况下引导学习。这种密集的、按路由的监督帮助学生快速收敛,同时将各领域的专门能力整合到单一模型中。
**智能体强化学习。** 最后阶段教会模型在真实的智能体环境中运行。我们通过真实的智能体框架进行多轮智能体 RL,模型需要完成现实的生产力任务,这些任务评估其研究、写作、编程、数据分析、文档管理、外部工具使用以及自动化多步骤工作流的能力。
训练期间,我们会采样一个任务并随机选择对应的框架。每次 rollout 都在带有独立运行时的专用沙盒中执行。我们使用 GRPO 进行优化,采用基于结果的奖励,结合了 LLM 作为评估者的评分标准、程序化检查以及硬安全门控。直接在 Hermes Agent、OpenClaw 和其他框架中训练,让模型接触它们的工具、系统提示和交互模式,帮助它在不同智能体环境中可靠地工作。
训练流水线将模型优化、推理和环境执行分离为不同的组件。**训练引擎**(FSDP)优化模型,而 **rollout 引擎**(SGLang)使用最新策略生成动作。**RL 框架**(verl)通过启动 rollout、收集轨迹和奖励以及更新模型来编排训练循环。
动作在**沙盒服务**中执行,其中 **Blackbox Harness** 承载智能体(例如 OpenClaw 或 Hermes Agent),并通过工具调用、代码执行和其他任务特定操作
相似文章
Hugging Face Blog
Liquid AI releases LFM2.5-2.6B, a compact agentic model designed for on-device deployment, supporting tool calling and multi-step workflows with efficient inference on CPUs and GPUs.
Reddit r/LocalLLaMA
Liquid AI 发布了 LFM2.5-2.6B,一款专注于智能体能力的新型小模型。作者很期待测试它在文档摘要等大规模任务中的表现。
Hugging Face Models Trending
Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。
Hugging Face Models Trending
Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.
X AI KOLs Following
Liquid AI 发布了 LFM2.5-2.6B,这是一款端侧智能体模型,能够在手机、笔记本电脑、PC 和机器人上规划任务、调用工具并完成多步操作,且数据始终不离开设备。