文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试

arXiv cs.CL 论文

摘要

本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。

arXiv:2606.00477v1 公告类型:新 摘要:统一多模态模型(UMMs)已成为通用多模态智能的一种有前景的范式。随着它们被部署到实际应用中,有效更新内部知识变得至关重要。虽然知识编辑在纯文本模型中已经成熟,但尚不清楚成功修改文本输出的编辑是否也能迁移到UMMs的图像生成中。为了研究这个问题,我们引入了UniKE,这是第一个针对UMMs中跨模态知识编辑的基准测试,包含2,971个编辑主题,涵盖属性编辑和关系编辑。通过基于VQA的视觉验证,我们揭示了一个显著的模态差距:文本端的效果可达约92%,而直接图像生成下的最佳整体VQA准确率仅为18.5%。我们进一步提出了Reasoning-augmented Parameter Editing,该方法在生成前显式激活编辑后的知识,并提高了所有评估模型-编辑器对的整体VQA准确率,提升高达18.6个百分点。机制分析表明,这一差距与编辑后的文本表示与视觉生成的条件路径之间的部分对齐有关,其中足以用于文本输出的编辑可能仍然太弱或未对齐,无法引导图像合成。这些发现表明,文本知识编辑不能保证可靠的跨模态迁移,并推动了模态感知编辑方法的发展。我们的代码和数据可在 https://github.com/gxx27/UniKE 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

# 文本编辑能泛化到视觉生成吗?统一多模态模型跨模态知识编辑基准测试 来源:https://arxiv.org/html/2606.00477 ###### 摘要 统一多模态模型\(UMMs\)已成为通用多模态智能的一种有前景的范式。随着它们在现实世界应用中的部署,有效更新内部知识变得至关重要。虽然知识编辑在纯文本模型中已趋于成熟,但对于成功修改文本输出的编辑是否也能转移到UMMs的图像生成中,目前仍不清楚。为了研究这个问题,我们提出了UniKE,这是首个针对UMMs跨模态知识编辑的基准测试,包含2,971个编辑主题,涵盖属性和关系编辑。通过基于VQA的视觉验证,我们揭示了一个显著的模态差距:文本侧的有效性可达约92%,而在直接图像生成下,最佳整体VQA准确率仅为18.5%。我们进一步提出了推理增强参数编辑,该方法在生成前显式激活编辑后的知识,并为所有评估的模型-编辑器组合提高了整体VQA准确率,最高提升18.6个百分点。机制分析表明,这一差距与编辑后的文本表示与视觉生成的条件路径之间的部分对齐有关,其中足以改变文本输出的编辑可能仍然太弱或未对齐,无法引导图像合成。这些发现表明,文本知识编辑并不能保证可靠的跨模态迁移,并激励了模态感知的编辑方法。我们的代码和数据可在https://github.com/gxx27/UniKE获取。 Machine Learning, ICML ## 1引言 统一多模态模型\(UMMs\)已成为通用多模态智能的一种有前景的范式\(Zhou et al.,2024 (https://arxiv.org/html/2606.00477#bib.bib41); Wang et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib28); Deng et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib6); Yang et al.,2026 (https://arxiv.org/html/2606.00477#bib.bib33)\)。与依赖级联组件的传统流水线不同\(Shen et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib23); Wu et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib31); Lian et al.,2024 (https://arxiv.org/html/2606.00477#bib.bib12)\),UMMs采用统一的骨干网络联合表示图像和文本,实现了理解和生成之间的无缝参数共享\(Zhang et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib36),2026 (https://arxiv.org/html/2606.00477#bib.bib37)\)。通过继承来自文本预训练的世界知识和推理能力,UMMs可以利用这些先验知识来指导视觉内容合成,使我们更接近能够通过统一界面解释和模拟物理世界的基础模型。随着UMMs在现实世界应用中的部署日益广泛,有效更新其内部知识的能力成为一个关键问题。在文本领域,知识编辑\(KE\)\(Wang et al.,2023a (https://arxiv.org/html/2606.00477#bib.bib29); Zhang et al.,2024b (https://arxiv.org/html/2606.00477#bib.bib35)\)旨在修改特定事实而无需从头重新训练,已成为应对这一挑战的解决方案。然而,尽管语言模型的技术已经成熟,但UMMs的知识编辑仍然在很大程度上未被探索。鉴于UMMs在共享骨干网络内统一了文本和图像生成,一个自然的问题出现了:如果我们仅通过文本模态编辑知识,这些编辑是否会传播到视觉生成,使模型能够合成反映更新知识的图像?具体来说,如图1 (https://arxiv.org/html/2606.00477#S1.F1)\(a\)所示,如果我们编辑模型使文本输出“苹果是蓝色的”,那么当提示图像生成时,它是否会生成一个蓝色的苹果? 参见图注 图1:统一多模态模型中的跨模态知识编辑。我们编辑一个UMM来改变一个属性(即*苹果颜色:红色→蓝色*)。(a) 跨模态知识编辑未被充分探索:虽然文本领域的编辑成功更新了模型的文本答案,但这种更新知识向视觉生成的传播仍未被充分探索。(b) 推理增强参数编辑:通过引出显式的推理步骤,模型激活潜在的被编辑知识并将其转移到图像生成。 为了系统研究这个问题,我们建立了UniKE,这是首个专为UMMs中跨模态知识编辑定制的基准测试。在UniKE中,我们应用文本侧知识编辑,并测试更新后的知识是否在视觉生成中一致表达。该基准包含2,971个精心构建的编辑主题,涵盖事实知识的两个轴:属性和关系。这些编辑主题在扩展到阶段特定和视觉可验证的生成设置后,产生5,535个评估实例。由于生成图像中细粒度的事实正确性难以用通用的文本到图像指标评估,我们使用基于VQA的视觉验证来评估每个生成图像是否与编辑后的知识一致。在UniKE上的实证结果揭示了一个显著的跨模态知识编辑差距:显著改善文本输出的参数编辑方法在图像生成中产生的变化更弱且更不可靠。为了缓解这一差距,我们引入了推理增强参数编辑(图1 (https://arxiv.org/html/2606.00477#S1.F1)\(b\))。我们的关键假设是,存储在参数中的编辑知识可能对图像生成保持潜在状态,除非在文本上下文中被显式激活。通过在图像生成之前引出中间文本推理步骤,我们鼓励模型表达被编辑的事实,从而为后续的视觉合成提供更强的语义约束。我们进一步提供了机制证据,说明为什么高文本侧编辑成功率不能可靠地转化为视觉变化。我们的分析指出一个条件路径瓶颈:足以改变文本回忆的编辑引起的扰动,不一定在条件图像生成的表示中得到保留或表达。在具有显式投影接口的架构中,这个瓶颈可能在编辑引起的信号到达图像生成器之前就衰减了它们;在没有这种投影的架构中,传递的扰动仍然可能不足以可靠地覆盖强大的视觉先验。推理增强协议通过引入一个显式的文本条件偏移(比直接编辑更大且性质不同)部分缓解了这个问题,从而改善了跨模态的编辑知识转移。总而言之,我们强调我们的贡献如下: - •我们引入了UniKE,这是首个用于UMMs中跨模态知识编辑的基准测试,涵盖属性和关系中心的编辑。该基准包含2,971个编辑主题和5,535个评估实例,旨在测试文本侧编辑是否在视觉可验证的图像生成中反映出来。 - •我们系统评估了参数编辑基线,并展示了显著的模态差距:在纯文本指标下成功的编辑不一定会导致一致的视觉变化。我们进一步提出了推理增强参数编辑,该方法在图像生成前通过中间推理步骤显式激活被编辑的知识。 - •我们提供了机制分析,表明有限的跨模态转移与条件路径瓶颈有关。编辑引起的扰动可能在到达图像生成器之前被衰减或弱表达,而推理增强引入了一个更强的文本条件偏移,部分改善了视觉接地。 表1:与代表性知识编辑基准的比较。T2T表示文本到文本评估,T2I表示文本到图像生成,I2T表示图像条件文本回答。Size报告编辑案例的数量。 ## 2相关工作 #### 知识编辑。 更新大模型的事实信念而无需昂贵的重新训练是一个关键挑战。当前方法主要分为参数保留方法,如MemPrompt\(Madaan et al.,2022 (https://arxiv.org/html/2606.00477#bib.bib16)\)、MeLLo\(Zhong et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib40)\)、IKE\(Zheng et al.,2023a (https://arxiv.org/html/2606.00477#bib.bib38)\),它们利用上下文示范来指导模型行为;以及参数修改方法,如ROME\(Meng et al.,2022 (https://arxiv.org/html/2606.00477#bib.bib17)\)、MEMIT\(Meng et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib18)\)、PMET\(Li et al.,2024 (https://arxiv.org/html/2606.00477#bib.bib11)\)和AlphaEdit\(Fang et al.,2025a (https://arxiv.org/html/2606.00477#bib.bib7)\),它们定位并修改与事实回忆相关的特定神经权重。将这一领域扩展到视觉领域,文本到图像\(T2I\)编辑方法如TIME\(Orgad et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib19)\)、ReFACT\(Arad et al.,2024 (https://arxiv.org/html/2606.00477#bib.bib1)\)和DiffQuickFix\(Basu et al.,2024 (https://arxiv.org/html/2606.00477#bib.bib3)\)已被提出用于纠正视觉概念。然而,这些T2I方法主要操作于模块化架构\(Rombach et al.,2021 (https://arxiv.org/html/2606.00477#bib.bib20)\),通过针对不同的文本编码器或交叉注意力层,而不是统一系统中发现的单片骨干网络。 #### 知识编辑基准。 已经提出了许多基准来评估语言和多模态模型中的知识编辑。ZsRE\(Levy et al.,2017 (https://arxiv.org/html/2606.00477#bib.bib10)\)评估基于文本的问答编辑和对改写查询的鲁棒性。CounterFact\(Meng et al.,2022 (https://arxiv.org/html/2606.00477#bib.bib17)\)关注反事实的主语-关系-宾语重写及局部性探测,而MQuAKE\(Zhong et al.,2023 (https://arxiv.org/html/2606.00477#bib.bib40)\)测试编辑后的事实是否传播到多跳文本推理。最近,TMKE\(Fang et al.,2025b (https://arxiv.org/html/2606.00477#bib.bib8)\)研究了多模态知识编辑中的跨模态一致性,主要通过图像条件文本回答。相比之下,UniKE评估了一条新颖的路径:在将文本侧编辑应用于UMM后,测试编辑后的知识是否出现在生成的图像中。 #### 统一多模态模型。 与解耦理解和生成的模块化框架不同,UMMs\(Wang et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib28); Deng et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib6); Cui et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib5)\)在单一框架内集成文本和视觉模态\(Liang et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib13)\)。这些架构通常采用共享的transformer骨干网络,通过量化或扩散头将视觉表示与文本令牌对齐,通常利用统一的自回归目标或流匹配机制\(Liang et al.,2025 (https://arxiv.org/html/2606.00477#bib.bib13)\)。然而,UMMs中知识存储和跨模态交互的机制仍然不透明。因此,尚不清楚文本知识编辑如何影响图像生成过程,特别是事实更新是否能有效跨越模态边界\(Tao et al.,2026 (https://arxiv.org/html/2606.00477#bib.bib26)\)。 ## 3UniKE基准测试 ### 3.1任务定义 在本工作中,我们研究统一多模态模型中的跨模态知识编辑。在应用文本侧编辑来改变模型对某个事实的文本响应后,我们测试更新后的知识是否在视觉生成中一致表达,并且是否可以自动验证。UniKE中的每个评估实例指定一个陈述补全编辑目标qq,包含编辑前补全yy和编辑目标补全y′y^\{\\prime\}。它还提供了一个图像生成提示pimgp\_\{\\mathrm\{img\}\}、一个视觉目标描述tvist\_\{\\mathrm\{vis\}\}描述y′y^\{\\prime\}的可观察含义,以及一个用于验证的VQA查询qvqaq\_\{\\mathrm\{vqa\}\}\。我们将一个评估实例表示为: I=\(q,y,y′,pimg,tvis,qvqa\)。\\mathcal\{I\}=\\bigl\(q,\\;y,\\;y^\{\\prime\},\\;p\_\{\\mathrm\{img\}\},\\;t\_\{\\mathrm\{vis\}\},\\;q\_\{\\mathrm\{vqa\}\}\\bigr\)。\(1\)图2 (https://arxiv.org/html/2606.00477#S3.F2)展示了一些具体的UniKE实例。该基准涵盖两类编辑。属性编辑修改一个实体的内在视觉属性,如颜色或图案,并通过逐步更具组合性的图像提示进行实例化。关系编辑修改关于一个实体的关系事实,并限于在图像中具有可描绘含义的类别,如位置或职业,以便通过特征性视觉证据验证编辑后的关系。在所有情况下,成功要求生成的图像满足tvist\_\{\\mathrm\{vis\}\},并且对图像的回答qvqaq\_\{\\mathrm\{vqa\}\}与编辑后的补全y′y^\{\\prime\}一致。表1 (https://arxiv.org/html/2606.00477#S1.T1)总结了UniKE与代表性知识编辑基准之间的关键差异。 ### 3.2基准测试构建 我们按照一个系统化的流水线构建UniKE,该流水线围绕一个关键约束组织:可视觉化。这个约束确保每个目标补全y′y^\{\\prime\}暗示一个具体的视觉结果,可以通过VQA评估可靠验证。图像提示被设计为答案中性:它们描绘主语或场景而不揭示原始值或编辑后的值,因此任何正确的视觉输出必须源自模型编辑后的内部知识,而不是基于提示的捷径。图3 (https://arxiv.org/html/2606.00477#S3.F3)展示了两个编辑家族的结果分布。 参见图注 图2:来自UniKE的示例数据实例,展示了跨阶段的属性编辑和关系编辑的结构。 ### 3.3属性编辑 我们通过自指令风格流水线\(Wang et al.,2023b (https://arxiv.org/html/2606.00477#bib.bib30)\)使用Gemini-3.0-Flash\(Gemini Team, Google,2025 (https://arxiv.org/html/2606.00477#bib.bib9)\)生成属性编辑候选。每个候选指定一个对象和一个从颜色、材质、形状、大小和图案中抽取的属性域,以及一个编辑前补全yy和一个反事实目标补全y′y^\{\\prime\}\。生成提示强制执行答案中性的图像提示,这些提示描绘主语而不揭示原始或编辑后的属性值,以及非同义反复的视觉目标,并带有类别特定的约束。对于图案域,我们使用一个策划的主语池,其中的实体具有特征性的表面纹理,配以从常见图案形容词词典中抽取的平衡目标,以避免目标选择中的退化分布。 #### 阶段设计。 为了评估UMMs在日益增加的难度下的跨模态知识编辑,我们将每个编辑实例化为最多四个阶段,对接地和组合泛化提出逐步更严格的要求: 1. 1.原子对象。在直接引用提示下查询编辑后的属性,其中图像提示描绘实体而不揭示编辑后的值。 2. 2.现实上下文。将实体嵌入现实上下文中,并测试在

相似文章

揭示多模态知识编辑中的实体身份混淆问题

arXiv cs.CL

本文在多模态知识编辑中发现了一种称为实体身份混淆的故障模式,即模型错误地绑定图像-实体关系。文章提出了EC-Bench用于诊断该问题,并探讨了缓解策略以实现更可靠的编辑。