@ma_sc_:我一直在测试除官方支持的14种语言之外的许多其他语言,结果真的非常令人惊讶。……
摘要
一位用户分享了在多种语言上测试Liquid AI新推出的LFM2.5-VL-3B视觉语言模型的惊人结果,指出其视觉能力很强,但指令跟随能力低于预期;Liquid AI宣布该模型能够读取屏幕、文档,并将物体定位到坐标。
查看缓存全文
缓存时间: 2026/08/12 20:34
我一直在用除官方支持的14种语言之外的许多其他语言测试这个模型,结果真的令人惊讶。 现在就试试这个模型吧!
视觉能力很棒,但指令遵循比我预期的要差一些。
我在伦敦的AIE遇到了@maximelabonne,只能说:他们在搞大事
Liquid AI(@liquidai): 今天,我们发布了LFM2.5-VL-3B,一个轻量级的视觉语言模型,能够读取屏幕、文档和物理世界。它处理移动端、网页和桌面端的数字屏幕,将对象定位到坐标,读取文本和图表,并可通过文本或图像调用工具。
相似文章
LiquidAI LFM2.5-VL-3B:一款3.1B本地视觉语言模型超越Gemma-4 E4B——屏幕理解从2.5提升至82.2
LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B本地视觉语言模型,性能超越Gemma-4 E4B,并在屏幕理解上展现了显著提升,使得设备端AI更加实用。
LiquidAI/LFM2.5-VL-3B · Hugging Face
LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.
@liquidai: 推出 LFM2.5-VL-1.6B-Extract 和 LFM2.5-VL-450M-Extract:返回结构化JSON的视觉语言模型,而非…
Liquid AI发布了LFM2.5-VL-1.6B-Extract和LFM2.5-VL-450M-Extract,这些视觉语言模型能从图像和字段列表中输出结构化JSON。模型为开放权重,提供两种规格。
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型——结果比预期的要好
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型,发现结果比预期的要好。
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
LiquidAI announces LFM2.5-VL-3B, an efficient vision-language model for edge hardware with improved screen understanding, grounding, multi-image input, and function calling, trained with 4x more vision data and post-training via SFT and RL.