逐令牌关注多模态生成
摘要
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
查看缓存全文
缓存时间: 2026/07/09 07:52
论文页面 - 一次关注一个 Token 的多模态生成
来源:https://huggingface.co/papers/2607.03738
摘要
多模态大语言模型在生成过程中展现出独特的注意力模式,对视觉和文本模态的关注会根据语义需求而动态转移,而这些模式可以被利用来通过针对性干预提升任务性能。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) (MLLMs) 以自回归方式生成响应,在持续的上下文中整合视觉与语言信息。先前关于可解释性的工作主要集中于单个层和电路(即“在哪里”),而忽略了生成过程中多模态计算的 token 级动态(即“何时”)。我们填补了这一空白,将注意力转移 (https://huggingface.co/papers?q=attention%20shifts) 视为语义角色 (https://huggingface.co/papers?q=semantic%20role);通过一次关注一个 Token(One Token at a Time, OTaT)的方法跟踪模型对图像、文本、指令以及已生成 token 的注意力。我们引入了需要在单个响应内明确切换视觉和文本上下文的多模态任务。在两种主流模型家族和四个不同大小的开源权重 MLLM 中,我们发现了一致的规律:对图像的注意力在需要图像信息的 token 处达到峰值,在任务切换期间会重新关注指令 token,而随着生成的进行,对已生成 token 的注意力会增加。因果注意力阻断 (https://huggingface.co/papers?q=Causal%20attention%20blocking) 干预验证了这些趋势的功能性作用。我们描述了模型在注意力被干扰下的行为,观察到响应会退化为语言先验,或表现出跨模态泄漏 (https://huggingface.co/papers?q=cross-modal%20leakage)、拒绝或恢复。最后,基于我们新颖分析揭示的注意力动态,我们提出了一种简单的测试时干预 (https://huggingface.co/papers?q=test-time%20intervention) 方法,在恰当的时刻增强对相关模态的注意力,从而显著提升多模态任务性能。
查看 arXiv 页面 (https://arxiv.org/abs/2607.03738) 查看 PDF (https://arxiv.org/pdf/2607.03738) 项目页面 (https://katha-ai.github.io/projects/otat/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03738)
在你的智能体中获取这篇论文:
hf papers read 2607.03738
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。
引用该论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。
引用该论文的 Spaces0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。
包含该论文的收藏集0
没有收藏集包含此论文
请将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
面向主体驱动生成的多模态大语言模型能力挖掘
本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。
OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型
OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。
BitLM:利用位级连续扩散解锁多 Token 语言生成
本文介绍了 BitLM,一种利用位级连续扩散并行生成多个 Token 的语言模型,旨在克服传统自回归生成的顺序瓶颈,同时保留因果结构。
Token 最大化
讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。