LiquidAI LFM2.5-VL-3B:一款3.1B本地视觉语言模型超越Gemma-4 E4B——屏幕理解从2.5提升至82.2

Reddit r/artificial 模型

摘要

LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B本地视觉语言模型,性能超越Gemma-4 E4B,并在屏幕理解上展现了显著提升,使得设备端AI更加实用。

LiquidAI LFM2.5-VL-3B:一款3.1B本地视觉语言模型超越Gemma-4 E4B——屏幕理解从2.5提升至82.2 摘要:LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B视觉语言模型,完全本地运行(llama.cpp、MLX、vLLM,甚至WebGPU演示)。 • 战胜Gemma-4 E4B (8B) 69.4 对 59.7;略胜Qwen3.5-4B • 屏幕理解:在ScreenSpot-v2 Web上从2.5提升至82.2(巨大飞跃) • 在M5 Max上为228 tok/s,在Galaxy S26 Ultra上为20 tok/s • 包含函数调用/对象定位 我认为有趣的是商业角度:对于简单的文档/屏幕任务,本地AI将'AI功能'从每月API账单转变为一次性的工程任务,且数据不会外泄。大型云模型在复杂推理上仍然占优——这仅仅使小模型类别真正可用。我在此写了一篇简短分析:https://www.zyntopia.com/news/lfm2-5-vl-3b-edge-vision
查看原文

相似文章

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.

LiquidAI/LFM2.5-230M

Hugging Face Models Trending

Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。

Liquid AI 发布 LFM2.5-8B-A1B

Reddit r/LocalLLaMA

Liquid AI 发布了 LFM2.5-8B-A1B,这是一款边缘模型,拥有 128K 上下文窗口、38T 预训练 token 和大规模强化学习,支持工具调用和复杂任务,同时可运行于入门级笔记本电脑。