mllms

标签

Cards List
#mllms

迈向可扩展的RLVR:多模态指令跟随数据合成与提炼

arXiv cs.CL · 2天前 缓存

本文介绍了MIFS,一个用于合成RL就绪多模态数据的流程,旨在增强多模态大语言模型(MLLMs)的指令跟随能力,在基准测试中实现了平均8.13%的提升,并加快了训练收敛速度。

0 人收藏 0 人点赞
#mllms

选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究

Hugging Face Daily Papers · 2026-09-03 缓存

本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。

0 人收藏 0 人点赞
#mllms

Aphanta: 诊断任务对齐的图像编辑中间步骤以用于多模态推理

Hugging Face Daily Papers · 2026-08-27 缓存

Aphanta是一个自动化诊断框架,用于评估图像编辑中间步骤在多模态推理管道中的效用,显示任务依赖的益处,并提高特定任务的性能。

0 人收藏 0 人点赞
#mllms

ShutterMuse:基于多模态大语言模型的拍摄实时摄影指导

Hugging Face Daily Papers · 2026-06-24 缓存

研究人员提出了CaptureGuide-Bench,一个用于拍摄实时摄影指导的基准测试,以及ShutterMuse,一个统一的多模态大语言模型,经过训练可提供构图和姿势建议,展示了优于通用模型的性能。

0 人收藏 0 人点赞
#mllms

配对时正确,拆分时错误:解耦与编辑多模态大语言模型中的模态特定神经元

arXiv cs.LG · 2026-06-17 缓存

本文识别并解决了多模态大语言模型中的“编辑解耦失败”问题,即通过多模态输入进行知识更新后,当查询变为单模态时更新效果无法泛化。作者提出DECODE方法,用于解耦并定位模态特定神经元,从而实现更有效的知识编辑。

0 人收藏 0 人点赞
#mllms

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

arXiv cs.AI · 2026-06-09 缓存

本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。

0 人收藏 0 人点赞
#mllms

SynCred-Bench: AI生成视觉虚假信息中合成可信度的基准测试

Hugging Face Daily Papers · 2026-06-02 缓存

介绍了SynCred-Bench,这是一个包含600张AI生成的虚假信息图像的基准测试,涵盖六种可信形式类别,表明现有检测器(包括MLLMs、开源AIGC检测器和商业API)表现不佳,人类标注者同样难以识别。

0 人收藏 0 人点赞
#mllms

ESI-Bench:迈向闭环感知-行动的具身空间智能

Hugging Face Daily Papers · 2026-05-18 缓存

介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈