标签
本综述论文系统回顾了大型语言模型与视觉语言模型的解码方法,聚焦于推理时方法以提升效率和控制生成过程。文中识别了新兴范式,指出了当前挑战,并探讨了未来研究方向。
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
微软研究院推出MindTopo基准,用于测试多模态AI模型是否理解连通性、包围和打结等拓扑关系。当前模型在静态识别上表现良好,但在交互式规划任务上存在困难,这揭示了机器人和交互式环境中的关键差距。
一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。
OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。
LlamaIndex 宣布在 LlamaParse 中改进了路由机制,该机制为简单的文本密集型 PDF 选择轻量级解析,而为包含表格或图表的复杂页面选择更重的基于 VLM 的解析,从而优化成本和准确性。
Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。
Jerry Liu的团队正在CVPR 2026上展示ParseBench,这是一个针对视觉语言模型(VLM)的全面文档理解基准。该基准包含2000页真实企业文档,以及针对表格、图表和视觉定位的评估指标。
本文介绍了一个嵌套的几何分解框架,用于分析提示如何重新组织大型语言模型和视觉-语言模型的内部表征。作者表明,仿射变换,特别是跨维度的线性混合,是解释提示引起的行为变化的关键。
Fast-dDrive是一种用于端到端自动驾驶的块扩散VLA模型,实现了最先进的轨迹精度,同时相比自回归基线提供了超过12倍的吞吐量加速,解决了高保真规划与边缘部署高效推理之间的权衡。
本文提出SpaceNum,一个统一的框架,用于评估视觉语言模型(VLMs)在空间上下文中理解数值的能力,发现当前模型在很大程度上未能将数字与空间对应起来,且常常表现出接近随机猜测的性能。
GridProbe 是一种无需训练的长视频 VLM 推理范式,它通过后验探测自适应地选择相关帧,在几乎不损失准确率的情况下实现了低于二次方的注意力计算成本。
GeoStack 引入了一种几何框架,用于在视觉语言模型中组合独立训练的领域专家,而不会出现灾难性遗忘,实现了常数时间推理,并将几何误差降低了10倍。
来自麻省理工学院(MIT)、伍斯特理工学院(WPI)和 Google 的研究人员提出了 WRING,这是一种用于视觉语言模型(VLM)的新型后处理去偏方法,旨在避免在消除特定偏见时放大其他偏见的“打地鼠困境”。