@maximelabonne: 你无法阻止我们变得更小。
摘要
一条推文讨论了通过将量化从F16切换到QAD Q4_0来优化本地LFM2.5-2.6B AI模型,从而减小体积、提高速度、降低延迟,并保持高性能。
查看缓存全文
缓存时间: 2026/08/20 14:59
技术进步让人惊叹——模型压缩的极致之旅
用户 @noctus91 的发现确实令人震撼:
将本地运行的 LFM2.5-2.6B 模型从 F16 精度切换到 QAD Q4_0 量化格式后——
- 内存占用从 5.4GB 降至 1.6GB
- 生成速度从 21 tok/s 提升至 64 tok/s
- 工具调用延迟从 3.0s 缩短至 1.2s
- 且仍保留约 97% 的 BF16 原始性能
这种压缩技术的突破意味着:
- 硬件门槛大幅降低:原本需要高端显存的模型,现在可在消费级设备流畅运行
- 实时交互体验质变:工具调用延迟低于人类感知阈值,接近“即时响应”
- 开源生态再革新:让更多开发者能以极低资源探索尖端语言模型
正如 @LiquidAI 所展现的——模型小型化并非牺牲性能,而是用更聪明的方式释放潜能。这或许正是边缘AI时代的关键钥匙。 🔑
相似文章
@noctus91: 我最近从 Qwen 3.5 9B 切换到了 @liquidai 的 LFM2.5-8B-A1B,它迅速成为我在 H… 中的默认本地模型
一位用户分享了从 Qwen 3.5 9B 切换到 Liquid AI 新推出的 LFM2.5-8B-A1B 模型的积极体验,称赞其在代理任务上的速度和可靠性,同时指出编码仍然是其弱项。该模型是一个 8B MoE 架构,具有 1.5B 活跃参数和 128K 上下文,针对设备和服务器端使用进行了优化。
@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
@maximelabonne: 哇,这让我想起了早期的模型合并。完全疯狂,我喜欢!
一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。
别再问该跑哪个模型了。其实只有两个。
一位科技爱好者认为,只有两个本地AI模型(Qwen 3.6 35b a3b 和 Qwen 3.6 27b)值得运行,他否定了更小的模型,并推荐对更大模型进行重度量化。