超越文本主导:理解全模态大语言模型的模态偏好
摘要
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
查看缓存全文
缓存时间: 2026/04/21 07:20
论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好
来源:https://huggingface.co/papers/2604.16902
摘要
研究表明,原生全模态大语言模型相比文本表现出视觉偏好,模态偏好在中后层逐步涌现,并可用于诊断跨模态幻觉。
原生全模态大语言模型 (https://huggingface.co/papers?q=Omni-modal%20Large%20Language%20Models)(OLLMs) 已从流水线架构转向统一的表示空间。然而,这种原生整合引发了一个关键但尚未被充分探索的现象:模态偏好 (https://huggingface.co/papers?q=modality%20preference)。为填补这一空白,我们首先利用一个新构建的冲突基准 (https://huggingface.co/papers?q=conflict-based%20benchmark) 和模态选择率 (https://huggingface.co/papers?q=modality%20selection%20rate) 指标,系统量化了 OLLMs 的模态偏好。我们对十个代表性 OLLMs 的评估揭示了一个显著的范式转变:与传统视觉语言模型(VLMs)的“文本主导”不同,大多数 OLLMs 表现出明显的视觉偏好。为了进一步理解其潜在机制,我们进行了逐层探测 (https://huggingface.co/papers?q=layer-wise%20probing),并证明这种模态偏好 (https://huggingface.co/papers?q=modality%20preference) 并非静态,而是在中后层逐步涌现。基于这些洞察,我们利用这些内部信号来诊断跨模态幻觉 (https://huggingface.co/papers?q=cross-modal%20hallucinations),在无需任务特定数据的情况下,在三个下游多模态基准上取得了有竞争力的性能。我们的工作为构建更可信的 OLLMs 提供了机制层面的理解和实用工具。我们的代码及相关资源已公开:https://github.com/icip-cas/OmniPreference
查看 arXiv 页面 (https://arxiv.org/abs/2604.16902)查看 PDF (https://arxiv.org/pdf/2604.16902)GitHub3 (https://github.com/icip-cas/OmniPreference)添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2604.16902)
在你的 agent 中获取这篇论文:
hf papers read 2604.16902
还没有安装最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型引用此论文
在模型的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
引用此论文的数据集0
暂无数据集引用此论文
在数据集的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
引用此论文的 Spaces0
暂无 Space 引用此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
包含此论文的合集0
暂无合集包含此论文
将此论文添加到一个合集 (https://huggingface.co/new-collection) 中,即可从此页面建立链接。
相似文章
Tri-PvP:通过感知-命题证据冲突揭示全模态大语言模型中的模态偏差
本文介绍了Tri-PvP,这是一个基准测试,揭示了全模态大语言模型中的视觉偏差和非对称证据形式偏好,表明深层模态偏差可以从早期层线性解码,并且难以通过表面干预缓解。
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
OmniHallu:用于多模态大语言模型中跨模态理解与生成的统一幻觉检测
OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。