2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行

Reddit r/LocalLLaMA 模型

摘要

Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。

Liquid AI 今天发布了 LFM2.5-2.6B,与那些大多数人无法运行的大规模模型相比,这可能更与本地 AI 相关。该模型仅 2.69B 参数,支持 128K 上下文,支持工具调用,并专门针对多步骤智能体工作流进行了后训练。官方 Q4_K_M GGUF 文件约 1.67GB,已支持在 llama.cpp 中运行。他们报告的 CPU 速度:- 手机上 30 tok/s - Ryzen AI Max+ 395 上 113 tok/s - M5 Max 上 220 tok/s - 测试中内存占用低于 2.5GB。这些是厂商基准测试,因此显然需要独立验证结果。基准测试结果在同等规模下出人意料地有竞争力:- ToolSandbox:77.83,而 Qwen3.5-9B 为 76.44 - IFBench:59.17,而 Qwen3.5-9B 为 56.47 - BFCLv4:56.88,仍落后于 Qwen3.5-9B 的 60.13 - LiveCodeBench:59.41,而 Qwen3.5-9B 为 69.86。所以它并不能神奇地取代更大的模型。编码和知识密集型工作仍是弱点,Liquid 自家的模型卡也表示不建议用于智能体编码。但我认为这恰恰是小型本地模型真正有意义的场景:不是作为你最聪明的助手,而是作为廉价的执行型智能体,在本地进行信息提取、搜索、文件操作和重复性工具调用。只有在小型模型卡住时,才由更大的模型来负责规划。128K 的宣称也需要实测。支持 128K 和在手机上流畅运行是完全不同的两回事,尤其涉及 KV 缓存和较长的智能体历史记录时。有没有人在 Android、老式笔记本电脑或迷你 PC 上测试过 Q4 GGUF?如果有硬件、上下文大小、真实 tok/s 以及它能否在连续 10 多次工具调用中不跑偏的测试结果,将会很有参考价值。
查看原文

相似文章

LiquidAI/LFM2.5-2.6B

Hugging Face Models Trending

Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.

Liquid AI 发布 LFM2.5-8B-A1B

Reddit r/LocalLLaMA

Liquid AI 发布了 LFM2.5-8B-A1B,这是一款边缘模型,拥有 128K 上下文窗口、38T 预训练 token 和大规模强化学习,支持工具调用和复杂任务,同时可运行于入门级笔记本电脑。

LiquidAI/LFM2.5-230M

Hugging Face Models Trending

Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。