超越文本主导:理解全模态大语言模型的模态偏好
摘要
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
查看缓存全文
缓存时间: 2026/04/21 07:20
论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好
来源:https://huggingface.co/papers/2604.16902
摘要
研究表明,原生全模态大语言模型相比文本表现出视觉偏好,模态偏好在中后层逐步涌现,并可用于诊断跨模态幻觉。
原生全模态大语言模型 (https://huggingface.co/papers?q=Omni-modal%20Large%20Language%20Models)(OLLMs) 已从流水线架构转向统一的表示空间。然而,这种原生整合引发了一个关键但尚未被充分探索的现象:模态偏好 (https://huggingface.co/papers?q=modality%20preference)。为填补这一空白,我们首先利用一个新构建的冲突基准 (https://huggingface.co/papers?q=conflict-based%20benchmark) 和模态选择率 (https://huggingface.co/papers?q=modality%20selection%20rate) 指标,系统量化了 OLLMs 的模态偏好。我们对十个代表性 OLLMs 的评估揭示了一个显著的范式转变:与传统视觉语言模型(VLMs)的“文本主导”不同,大多数 OLLMs 表现出明显的视觉偏好。为了进一步理解其潜在机制,我们进行了逐层探测 (https://huggingface.co/papers?q=layer-wise%20probing),并证明这种模态偏好 (https://huggingface.co/papers?q=modality%20preference) 并非静态,而是在中后层逐步涌现。基于这些洞察,我们利用这些内部信号来诊断跨模态幻觉 (https://huggingface.co/papers?q=cross-modal%20hallucinations),在无需任务特定数据的情况下,在三个下游多模态基准上取得了有竞争力的性能。我们的工作为构建更可信的 OLLMs 提供了机制层面的理解和实用工具。我们的代码及相关资源已公开:https://github.com/icip-cas/OmniPreference
查看 arXiv 页面 (https://arxiv.org/abs/2604.16902)查看 PDF (https://arxiv.org/pdf/2604.16902)GitHub3 (https://github.com/icip-cas/OmniPreference)添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2604.16902)
在你的 agent 中获取这篇论文:
hf papers read 2604.16902
还没有安装最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型引用此论文
在模型的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
引用此论文的数据集0
暂无数据集引用此论文
在数据集的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
引用此论文的 Spaces0
暂无 Space 引用此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2604.16902,即可从此页面建立链接。
包含此论文的合集0
暂无合集包含此论文
将此论文添加到一个合集 (https://huggingface.co/new-collection) 中,即可从此页面建立链接。
相似文章
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。