Qwen3-VL-2B 是在“土豆”设备上进行 JSON 提取的唯一可行的 VLM 吗?

Reddit r/LocalLLaMA 模型

摘要

作者声称 Qwen3-VL-2B 是低端硬件上进行 JSON 提取的唯一可行的视觉语言模型,性能优于 Qwen3-VL-4B 等大型模型,但它却未出现在主要基准测试中。

在 3 台“土豆”笔记本(Intel i3、8GB 内存、Win11、集成显卡)上花费了无数小时测试后,我得出了这个结论。要在低端硬件上可靠地从图像中提取数据并转为 JSON,其他模型根本无法望其项背。然而,它却完全缺席了主要基准测试,比如 Artificial Analysis 或 Open LLM Leaderboard(而 4B 版本却榜上有名)。在我(非科学)的测试中,Qwen3-VL-2B Q4_K_M GGUF 在此特定数据提取任务上轻松胜过 Qwen3-VL-4B 和 Qwen3.5 2B。其余模型甚至远未达到可接受的结果。 - 为什么它被基准测试忽略? - 还有没有其他模型能在土豆设备、手机或树莓派上真正处理 JSON 提取?
查看原文

相似文章

Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。