标签
本文介绍了MIFS,一个用于合成RL就绪多模态数据的流程,旨在增强多模态大语言模型(MLLMs)的指令跟随能力,在基准测试中实现了平均8.13%的提升,并加快了训练收敛速度。
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
Aphanta是一个自动化诊断框架,用于评估图像编辑中间步骤在多模态推理管道中的效用,显示任务依赖的益处,并提高特定任务的性能。
研究人员提出了CaptureGuide-Bench,一个用于拍摄实时摄影指导的基准测试,以及ShutterMuse,一个统一的多模态大语言模型,经过训练可提供构图和姿势建议,展示了优于通用模型的性能。
本文识别并解决了多模态大语言模型中的“编辑解耦失败”问题,即通过多模态输入进行知识更新后,当查询变为单模态时更新效果无法泛化。作者提出DECODE方法,用于解耦并定位模态特定神经元,从而实现更有效的知识编辑。
本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。
介绍了SynCred-Bench,这是一个包含600张AI生成的虚假信息图像的基准测试,涵盖六种可信形式类别,表明现有检测器(包括MLLMs、开源AIGC检测器和商业API)表现不佳,人类标注者同样难以识别。
介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。