mllms

标签

Cards List
#mllms

ShutterMuse:基于多模态大语言模型的拍摄实时摄影指导

Hugging Face Daily Papers · 2026-06-24 缓存

研究人员提出了CaptureGuide-Bench,一个用于拍摄实时摄影指导的基准测试,以及ShutterMuse,一个统一的多模态大语言模型,经过训练可提供构图和姿势建议,展示了优于通用模型的性能。

0 人收藏 0 人点赞
#mllms

配对时正确,拆分时错误:解耦与编辑多模态大语言模型中的模态特定神经元

arXiv cs.LG · 2026-06-17 缓存

本文识别并解决了多模态大语言模型中的“编辑解耦失败”问题,即通过多模态输入进行知识更新后,当查询变为单模态时更新效果无法泛化。作者提出DECODE方法,用于解耦并定位模态特定神经元,从而实现更有效的知识编辑。

0 人收藏 0 人点赞
#mllms

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

arXiv cs.AI · 2026-06-09 缓存

本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。

0 人收藏 0 人点赞
#mllms

SynCred-Bench: AI生成视觉虚假信息中合成可信度的基准测试

Hugging Face Daily Papers · 2026-06-02 缓存

介绍了SynCred-Bench,这是一个包含600张AI生成的虚假信息图像的基准测试,涵盖六种可信形式类别,表明现有检测器(包括MLLMs、开源AIGC检测器和商业API)表现不佳,人类标注者同样难以识别。

0 人收藏 0 人点赞
#mllms

ESI-Bench:迈向闭环感知-行动的具身空间智能

Hugging Face Daily Papers · 2026-05-18 缓存

介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈