Qwen3-VL-2B 是在“土豆”设备上进行 JSON 提取的唯一可行的 VLM 吗?
摘要
作者声称 Qwen3-VL-2B 是低端硬件上进行 JSON 提取的唯一可行的视觉语言模型,性能优于 Qwen3-VL-4B 等大型模型,但它却未出现在主要基准测试中。
在 3 台“土豆”笔记本(Intel i3、8GB 内存、Win11、集成显卡)上花费了无数小时测试后,我得出了这个结论。要在低端硬件上可靠地从图像中提取数据并转为 JSON,其他模型根本无法望其项背。然而,它却完全缺席了主要基准测试,比如 Artificial Analysis 或 Open LLM Leaderboard(而 4B 版本却榜上有名)。在我(非科学)的测试中,Qwen3-VL-2B Q4_K_M GGUF 在此特定数据提取任务上轻松胜过 Qwen3-VL-4B 和 Qwen3.5 2B。其余模型甚至远未达到可接受的结果。
- 为什么它被基准测试忽略?
- 还有没有其他模型能在土豆设备、手机或树莓派上真正处理 JSON 提取?
相似文章
在RTX 3060上运行的Qwen3.6-35B-A3B能否取代Google Vision进行收据到JSON的提取?
一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。
@liquidai: 推出 LFM2.5-VL-1.6B-Extract 和 LFM2.5-VL-450M-Extract:返回结构化JSON的视觉语言模型,而非…
Liquid AI发布了LFM2.5-VL-1.6B-Extract和LFM2.5-VL-450M-Extract,这些视觉语言模型能从图像和字段列表中输出结构化JSON。模型为开放权重,提供两种规格。
我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
Qwen3.5 122B 是最好的吗?
一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。