标签
VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。
Santiago Valdarrama 报道称,Kimi K3 是他测试过的最好的开放权重模型,一个2.8T参数的视觉模型,支持工具调用和推理,并拥有1M上下文窗口。
一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。
Corbin Braun 构建了一个进化式 A/B 缩略图测试工具,该工具每次只突变一个维度,使用 ABBA 模式轮换缩略图以避免偏差,并在多轮迭代中学习获胜突变。
NVIDIA 展示了一个编码智能体,它自主构建了训练环境并教会 Qwen3-VL-2B 数彩色星星,使用 NeMo RL 和 NeMo Gym 框架将准确率从 25% 提升至 96.9%。
Robbyant发布了LingBot-Vision,一个基于边界训练的1B参数视觉模型,在深度估计上优于DINOv3-7B,且权重开放。
VisionBridge是一个开源代理,通过让推理模型查询独立的视觉模型进行图像检查、OCR等操作,为纯文本LLM赋予视觉能力。
一项并排画布测试,对比了Qwen 3.5 35B A3B和Ornith 1.0 35B在三种纸张销毁任务(切割、碎纸、揉团)上的表现,Ornith取得决定性胜利,展示了在Qwen 3.5和Gemma 4上进行后训练的价值。
PixelRAG 是一款开源工具,通过使用截图和视觉模型从网页中提取数据,取代了传统的网页抓取。它包含一个 Claude Code 插件。
讨论可在RTX 6000 Pro GPU上运行的最佳图像视觉模型,可能侧重于本地推理性能和兼容性。
DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。
此拉取请求为 llama.cpp(一个开源 LLM 推理引擎)增加了对 Granite4 Vision 模型的支持。
Kapa.ai 描述了他们为RAG索引图像的方法:在索引时使用廉价的视觉模型生成文本描述,避免查询时的视觉成本,从而以最小的每次查询开销获得更优的答案。
Stepfun 3.7 Flash 是一款紧凑型视觉模型,在美学方面接近 GLM 5.1,在 3D 世界理解方面达到其 80% 的水平,同时仅使用 25% 的参数,因此内存效率极高。
OlmoEarth v1.1 是 Allen AI 推出的一系列新型卫星图像分析模型,通过减少基于 Transformer 的模型中的令牌序列长度,在保持性能的同时将计算成本降低高达 3 倍。
在两台 M5 Max MacBook Pro 上通过 Thunderbolt 5 RDMA 运行 Qwen3.6 35B(视觉版)。模型能描述图片并正确识别 Apple Park,但把 John Ternus 错认成 Jeff Williams。借助前缀缓存,响应几乎瞬间完成。
Anthropic Labs 发布了 Claude Design,这是一款由 Claude Opus 4.7 视觉模型驱动的新产品,允许用户与 AI 协作创建视觉设计、原型和演示文稿。