仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒
摘要
VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。
一款名为 VisionPsy-Nano-460M-Flash 的全新460M视觉模型在端侧VLM速度上采用了略有不同的方法。它不是把语言模型做得更小,而是减少传入语言模型的视觉信息量。对于512x512图像:
- VisionPsy Flash: 64个视觉token
- LFM2.5-VL-450M: 256
- Qwen3.5-0.8B: 256
- nanoVLM-460M: 1,088
- SmolVLM2-500M: 1,088
团队在每一部手机上使用最快的测试后端,报告了以下 Q4_0 GGUF 基准测试的首token时间:
- Pixel 9: 6.1秒
- Galaxy S23: 5.9秒
- Galaxy S25 Ultra: 2.6秒
- iPhone 15: 0.3秒
作为对比,Qwen3.5-0.8B 在同一批设备上分别耗时21.4秒、19.9秒、8.4秒和0.7秒。SmolVLM2 和原版 nanoVLM 则慢得多,因为它们处理了1,088个图像token。
其机制出奇地简单。完整模型会先对图像进行上采样,然后再切分图块。Flash 则保留原始分辨率,最低为512x512。这样就避免了因上采样新增的像素产生额外视觉token。他们报告称,Flash 保留了完整模型约99%的归一化基准分数:
- 完整模型: 62.3
- Flash: 61.4
但这种权衡并不均匀。OCR密集型和精细细节任务(如 TextVQA、OCRBench 和 ScienceQA)损失的质量比普通场景理解更多。
一些重要注意事项:
- 这些是模型创建者自己的基准测试结果,并非独立结果
- 0.3秒是首token时间,不是完整回答时间
- 设计为每次查询一张图像
- 上下文限制为8K
- 官方 llama.cpp 指令目前使用打过补丁的分支
- 若干评估改动仍在等待合并到 VLMEvalKit
对于一句话图像描述,他们报告的完整响应时间为:Pixel 9 上10.6秒,S23 上7.4秒,S25 Ultra 上4.2秒,iPhone 15 上0.7秒。
我觉得一个有趣的问题是,64个视觉token是否真的足以支持实用的相机VQA,还是当你把它对准小票、内容密集的截图或小字号文本时,缺失的细节马上就会变得明显。有没有人独立测试过 Q4_0 GGUF?在 Flash、LFM2.5-VL 和 Qwen3.5 之间使用同一张普通照片、小票和截图进行对比,会比另一个聚合基准有用得多。
模型:https://huggingface.co/qvac/VisionPsy-Nano-460M-Flash
GGUF:https://huggingface.co/qvac/VisionPsy-Nano-460M-Flash-GGUFs
代码和官方设备基准:https://github.com/tether-ai-research/qvac-visionpsy-nano
相似文章
本地iPhone AI图像生成正变得实用 - 每张图片仅需3秒
基准测试显示,在iPhone上本地运行Stable Diffusion 1.5,使用Realistic Vision V5.1 Hyper等优化模型,生成512x512图像最快仅需3.1秒,使得设备端AI图像生成变得切实可行。
@andimarafioti:没有视觉编码器,VLM也能‘看见’吗?我们受Gemma 4 12B启发,花100美元训练了一个。在M3 Pro MacBook上的延迟:…
研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。
UltraViT:面向大型视觉语言模型的延迟优化端侧视觉编码器
UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。
TurboVLA:在RTX 4090上以32 Hz运行且显存占用小于1 GB的实时视觉-语言-动作模型
TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。
本地图像转3D(<2GB内存,<20秒,Apple Silicon,iPhone)
一种新模型可在Apple Silicon设备和iPhone上本地从单张图像生成3D模型,内存占用低于2GB,耗时不到20秒。