LFM2.5-VL-3B 在 iPhone 17 上本地运行,能识别《我的世界》中的 Steve

Reddit r/LocalLLaMA 模型

摘要

Liquid AI 发布了 LFM2.5-VL-3B,这是一个 3.1B 参数的视觉模型,可在 iPhone 17 上本地运行,能识别《我的世界》中的 Steve 玩偶等物体,空间定位能力显著提升(ScreenSpot-v2 桌面端从 6 分提升到 78.7 分)。

Liquid AI 今天发布了 LFM2.5-VL-3B,这是一个 3.1B 参数的视觉模型,大小约 2GB,非常适合在手机上运行。基准测试归基准测试,所以我试了点更傻的事。我给我手头的一个小 Steve 玩偶拍了张照片,把它交给模型,问它看到了什么。结果它在 iPhone 17 上思考了大约 2 分 31 秒,有点太长了,但它最终确实认出了 Steve,并给出了详细的描述。与上一代的主要区别在于,它在定位物体位置方面表现好得多。ScreenSpot-v2 桌面端从 6 分提升到 78.7 分。这就是为什么它能够逐部分描述 Steve,而不是仅仅说出他的名字。LFM2.5-VL-3B HF 卡片:https://huggingface.co/LiquidAI/LFM2.5-VL-3B 该模型通过 atomic.chat 移动应用运行(我是创始人,欢迎任何反馈)。
查看原文

相似文章

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.

LiquidAI/LFM2.5-2.6B

Hugging Face Models Trending

Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.

Liquid AI 发布 LFM2.5-8B-A1B

Reddit r/LocalLLaMA

Liquid AI 发布了 LFM2.5-8B-A1B,这是一款边缘模型,拥有 128K 上下文窗口、38T 预训练 token 和大规模强化学习,支持工具调用和复杂任务,同时可运行于入门级笔记本电脑。