逐令牌关注多模态生成

Hugging Face Daily Papers 论文

摘要

本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。

多模态大语言模型(MLLMs)以自回归方式生成响应,在不断演化的上下文中整合视觉和语言信息。先前关于可解释性的工作集中于单个层和电路(何处),而忽略了生成过程中多模态计算的令牌级动态(何时)。我们填补了这一空白,并研究了基于语义角色的注意力转移;以逐令牌(One Token at a Time, OTaT)的方式追踪模型对图像、文本、指令和已生成令牌的注意力。我们引入了需要在单次响应中显式切换视觉和文本上下文的多模态任务。在两个主流模型家族和四个不同大小的开放权重MLLM上,我们建立了一致的模式:对图像的注意力在需要图像衍生信息的令牌处达到峰值,在任务转换期间会重新访问指令令牌,并且随着生成的进行,对已生成令牌的注意力增加。因果注意力阻断干预验证了这些趋势的功能性作用。我们分析了注意力受干扰情况下的模型行为,观察到响应回退到语言先验,或表现出跨模态泄露、拒绝或恢复。最后,通过我们的新颖分析了解注意力动态后,我们提出了一种简单的测试时干预,在正确的时间提升对相关模态的注意力,显著改善了多模态任务性能。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:52

论文页面 - 一次关注一个 Token 的多模态生成

来源:https://huggingface.co/papers/2607.03738

摘要

多模态大语言模型在生成过程中展现出独特的注意力模式,对视觉和文本模态的关注会根据语义需求而动态转移,而这些模式可以被利用来通过针对性干预提升任务性能。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) (MLLMs) 以自回归方式生成响应,在持续的上下文中整合视觉与语言信息。先前关于可解释性的工作主要集中于单个层和电路(即“在哪里”),而忽略了生成过程中多模态计算的 token 级动态(即“何时”)。我们填补了这一空白,将注意力转移 (https://huggingface.co/papers?q=attention%20shifts) 视为语义角色 (https://huggingface.co/papers?q=semantic%20role);通过一次关注一个 Token(One Token at a Time, OTaT)的方法跟踪模型对图像、文本、指令以及已生成 token 的注意力。我们引入了需要在单个响应内明确切换视觉和文本上下文的多模态任务。在两种主流模型家族和四个不同大小的开源权重 MLLM 中,我们发现了一致的规律:对图像的注意力在需要图像信息的 token 处达到峰值,在任务切换期间会重新关注指令 token,而随着生成的进行,对已生成 token 的注意力会增加。因果注意力阻断 (https://huggingface.co/papers?q=Causal%20attention%20blocking) 干预验证了这些趋势的功能性作用。我们描述了模型在注意力被干扰下的行为,观察到响应会退化为语言先验,或表现出跨模态泄漏 (https://huggingface.co/papers?q=cross-modal%20leakage)、拒绝或恢复。最后,基于我们新颖分析揭示的注意力动态,我们提出了一种简单的测试时干预 (https://huggingface.co/papers?q=test-time%20intervention) 方法,在恰当的时刻增强对相关模态的注意力,从而显著提升多模态任务性能。

查看 arXiv 页面 (https://arxiv.org/abs/2607.03738) 查看 PDF (https://arxiv.org/pdf/2607.03738) 项目页面 (https://katha-ai.github.io/projects/otat/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03738)

在你的智能体中获取这篇论文:

hf papers read 2607.03738

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。

引用该论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。

引用该论文的 Spaces0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.03738 以在此页面建立链接。

包含该论文的收藏集0

没有收藏集包含此论文

请将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。

相似文章

多模态大语言模型能理解OCT吗?

Hugging Face Daily Papers

本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。

面向主体驱动生成的多模态大语言模型能力挖掘

Hugging Face Daily Papers

本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。

Token 最大化

Reddit r/singularity

讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。