标签
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。
本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
MAGE是一个多模态多智能体框架,通过结合结构化布局规划规则、视觉检查和迭代优化,改进了VLSI物理设计中的宏布局,在时序指标上优于商业布局工具和人类专家。
S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。
本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。
本文研究了在面向多语言视觉多选题基准EXAMS-V上,针对小规模开放视觉语言模型(参数量≤7B)的测试时扩展技术。研究发现,推理预算和可解析性比复杂的搜索或验证方法更为重要。最佳配置在ImageCLEF 2026测试集上达到84.1%的准确率,在排行榜上排名第一。
提出非对称互变分学习(AMVL),通过双向校准防止答案泄露并提升潜在空间稳定性,解决多模态连续推理中的训练-推理不匹配问题,在BLINK基准测试上取得了显著的性能提升。
提出一种辩论者混合(MoD)框架,利用混合专家模型实现单个LLM内的动态自我辩论,在显著降低延迟和令牌消耗的同时实现更优的准确率。
CogniRoute 是一个基于模式引导的专家混合框架,用于社交视频问答,通过认知模式分解和路由感知的强化学习提升了多模态推理能力。在新的 OmniSocialBench 基准上,它相较于基线取得了显著提升。
本文介绍了MathVis-Fine,一个用于多模态数学推理中细粒度视觉依赖建模的框架,同时包含一个新数据集和一个两阶段渐进式训练范式,该范式根据每个样本固有的视觉依赖水平平衡答案正确性奖励和视觉接地奖励。
FinAcumen是一个框架,它将先前轨迹中的推理经验累积到持久记忆库中,用于金融多模态推理,在四个基准测试上提升了性能,同时保持冻结的8B视觉语言模型不变。
VeriGeo提出了一种可控几何问题生成框架,利用验证引导的反思确保数值与分析一致性。该方法生成高质量合成数据,在GeoQA上取得最先进结果,并在PGPS9K和MathVista-GPS上表现强劲。
本文提出了多模态多维度标量化过程奖励建模(MMS-PRM),该方法在多模态推理中强制最差维度的鲁棒性,以防止视觉幻觉等失败被强大的文本逻辑掩盖。
提出SpecFlow,一种轻量级多模态空间推理框架,在固定大小的离散余弦空间中表示中间视觉思维,将计算和KV缓存成本降低多达2.1倍,同时保持有竞争力的性能。
LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。
Faithful-MR1 是一个训练框架,通过 <Focus> 令牌锚定视觉注意,并利用反事实图像干预强化可信使用,从而提升多模态大语言模型(MLLM)中可信的多模态推理能力。它在使用更少训练数据的情况下,在 Qwen2.5-VL 骨干网络上的表现优于基线模型。
本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。
本研究引入了一个 3D 基准,用于评估视觉语言模型(VLM)智能体是否能够实现镜子自我识别,这是高阶认知能力的一种替代指标。研究发现,虽然更强的 VLM 可以利用反射证据指导行动,但较弱的模型往往无法提取与自身相关的信息或错误归因反射影像,这突显了语言顺从与基于现实的自我识别之间的区别。
UniPath 提出了一种框架,用于统一多模态模型中理解与生成的适应性协调,利用协调路径多样性来提升相对于固定策略的性能。