标签
UniCAR-RL 引入了一个强化学习框架,通过解耦感知与推理,无需标注即可提升多模态大语言模型的视觉数学推理能力。
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
CoVA-SFT是一个大规模数据集与基准,专为训练多模态语言模型在视觉抽象链上构建,以提升视觉推理任务中超越基线的性能。
TempCloze 是一个视频完形填空基准,用于评估视频大语言模型中的视觉时序推理,要求模型从干扰项中识别缺失的视频片段,以减少在语义、对齐和进展方面的语言捷径。
作者质疑依赖 API 访问的传统移动代理方法,并提出通过类似 aiden-firmware 的硬件使用屏幕理解来实现更通用的代理,使其能像人类一样交互。
本文提出证据优先反思(EFR)方法,通过解耦动作引发的视觉差异提取与结果验证,以改进桌面GUI代理中的反思过程,在基准测试上实现7.11%的准确率提升。
VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。
本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。
本文提出了一种面向大型视觉语言模型的测试时对齐方法,利用轨迹引导的结构化采样和迭代MCMC细化,在不进行大量后训练的情况下提高视觉推理准确性。
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。
视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。
本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。
TRACE是一个基于分类指导的环境,包含跨11个领域的1000个视觉推理任务。在64,000个TRACE实例上训练Qwen2.5-VL-3B和Qwen2.5-VL-7B,使其在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。
HDR 是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步视觉推理。与基线方法相比,它实现了更好的推理一致性、更低的延迟和强大的数据效率。
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
Muse Spark 1.1 在放射学最后考试 2.0(一项面向医疗自主 AI 诊断的新型视觉推理基准)上表现优于 GPT-5.6 Sol 和 Gemini 3.1,但落后于 Fable 和人类放射科医生。