仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒

Reddit r/LocalLLaMA 模型

摘要

VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。

一款名为 VisionPsy-Nano-460M-Flash 的全新460M视觉模型在端侧VLM速度上采用了略有不同的方法。它不是把语言模型做得更小,而是减少传入语言模型的视觉信息量。对于512x512图像: - VisionPsy Flash: 64个视觉token - LFM2.5-VL-450M: 256 - Qwen3.5-0.8B: 256 - nanoVLM-460M: 1,088 - SmolVLM2-500M: 1,088 团队在每一部手机上使用最快的测试后端,报告了以下 Q4_0 GGUF 基准测试的首token时间: - Pixel 9: 6.1秒 - Galaxy S23: 5.9秒 - Galaxy S25 Ultra: 2.6秒 - iPhone 15: 0.3秒 作为对比,Qwen3.5-0.8B 在同一批设备上分别耗时21.4秒、19.9秒、8.4秒和0.7秒。SmolVLM2 和原版 nanoVLM 则慢得多,因为它们处理了1,088个图像token。 其机制出奇地简单。完整模型会先对图像进行上采样,然后再切分图块。Flash 则保留原始分辨率,最低为512x512。这样就避免了因上采样新增的像素产生额外视觉token。他们报告称,Flash 保留了完整模型约99%的归一化基准分数: - 完整模型: 62.3 - Flash: 61.4 但这种权衡并不均匀。OCR密集型和精细细节任务(如 TextVQA、OCRBench 和 ScienceQA)损失的质量比普通场景理解更多。 一些重要注意事项: - 这些是模型创建者自己的基准测试结果,并非独立结果 - 0.3秒是首token时间,不是完整回答时间 - 设计为每次查询一张图像 - 上下文限制为8K - 官方 llama.cpp 指令目前使用打过补丁的分支 - 若干评估改动仍在等待合并到 VLMEvalKit 对于一句话图像描述,他们报告的完整响应时间为:Pixel 9 上10.6秒,S23 上7.4秒,S25 Ultra 上4.2秒,iPhone 15 上0.7秒。 我觉得一个有趣的问题是,64个视觉token是否真的足以支持实用的相机VQA,还是当你把它对准小票、内容密集的截图或小字号文本时,缺失的细节马上就会变得明显。有没有人独立测试过 Q4_0 GGUF?在 Flash、LFM2.5-VL 和 Qwen3.5 之间使用同一张普通照片、小票和截图进行对比,会比另一个聚合基准有用得多。 模型:https://huggingface.co/qvac/VisionPsy-Nano-460M-Flash GGUF:https://huggingface.co/qvac/VisionPsy-Nano-460M-Flash-GGUFs 代码和官方设备基准:https://github.com/tether-ai-research/qvac-visionpsy-nano
查看原文

相似文章