@ma_sc_:我一直在测试除官方支持的14种语言之外的许多其他语言,结果真的非常令人惊讶。……

X AI KOLs Following 模型

摘要

一位用户分享了在多种语言上测试Liquid AI新推出的LFM2.5-VL-3B视觉语言模型的惊人结果,指出其视觉能力很强,但指令跟随能力低于预期;Liquid AI宣布该模型能够读取屏幕、文档,并将物体定位到坐标。

我一直在测试除官方支持的14种语言之外的许多其他语言,结果真的非常令人惊讶。 现在就试试这个模型吧! 视觉能力很棒,但指令跟随能力比我预期的要弱。 我在伦敦的AIE遇到了@maximelabonne,只需知道:他们正在酝酿大事。
查看原文
查看缓存全文

缓存时间: 2026/08/12 20:34

我一直在用除官方支持的14种语言之外的许多其他语言测试这个模型,结果真的令人惊讶。 现在就试试这个模型吧!

视觉能力很棒,但指令遵循比我预期的要差一些。

我在伦敦的AIE遇到了@maximelabonne,只能说:他们在搞大事

Liquid AI(@liquidai): 今天,我们发布了LFM2.5-VL-3B,一个轻量级的视觉语言模型,能够读取屏幕、文档和物理世界。它处理移动端、网页和桌面端的数字屏幕,将对象定位到坐标,读取文本和图表,并可通过文本或图像调用工具。

相似文章

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.