DiffImaginE:用Diffusio想象验证实体类型
摘要
DiffImaginE是一篇研究论文,提出了一种基于扩散的多模态命名实体识别验证器,用条件潜扩散推理取代确定性想象,以实现更稳健的实体类型验证。
arXiv:2608.03025v1 公告类型:新
摘要:多模态命名实体识别(MNER)判断每个候选片段和实体类型假设是否得到联合文本和视觉证据的支持。现有的“想象-比较”验证器将每个(片段,类型)对映射到一个预测的视觉特征,将多样的视觉实现压缩为单一原型,并提供不带显式概率语义的兼容性分数。我们引入DiffImaginE,将MNER类型验证建模为条件潜扩散推理。给定片段定位的视觉证据,类型条件去噪器预测注入到其标准化潜变量中的噪声。由此产生的去噪误差提供了类型条件负对数似然的ELBO一致性替代,使得竞争类型假设可以根据它们对观测的解释程度进行排序。DiffImaginE保留标准的多模态编码器堆栈,并用基于无分类器引导的扩散评分器取代确定性验证器,该评分器使用Min-SNR加权进行训练。我们直接监督每种类型的扩散分数作为分类logits,学习跨噪声水平的聚合,并使用对偶采样来降低蒙特卡洛比较方差。我们的分析表明,无分类器引导增强了诱导的类型后验,并刻画了对偶配对在相同去噪器成本下降低方差的条件。在Twitter-2015和Twitter-2017上的实验表明,在相同的编码器、辅助目标和评估协议下,与匹配的确定性ImaginE对照组相比,取得了持续改进,并得到消融实验和配对显著性检验的支持。
查看缓存全文
缓存时间: 2026/08/05 07:38
# DiffImaginE:借助扩散模型想象以验证实体类型 来源:https://arxiv.org/html/2608.03025 冯张1,\*,韩飞宇2,\*,杨荣鑫3,\*,刘洋2,陈彦成2王瑞4,杨英光5,田学云2,张重阳6,7,郑浩6徐可夫3,冉从敬8,陈福海1,丛斌3,†1福州大学;2中国科学院;3北京大学;4阿里巴巴集团 5中国科学技术大学;6Fullive创新(北京)人工智能科技有限公司;7百度;8武汉大学 \*同等贡献。†通讯作者:[email protected](https://arxiv.org/html/2608.03025v1/mailto:[email protected]) ###### 摘要 多模态命名实体识别(MNER)针对每个候选片段判断某个实体类型假设是否得到文本与视觉联合证据的支持。现有“想象-比较”式验证器通常将每个\(span,type\)\(\\text\{span\},\\text\{type\}\)映射到单一的预测视觉特征,并将其与观察到的图像表征进行比较。这种确定性想象将一个实体类型的多种视觉表现压缩为单一原型,使得当同一类型通过截然不同的视觉线索出现时,验证器变得脆弱。此外,由此产生的兼容性分数缺乏概率解释,并且仅对拒绝易混淆的类型假设提供间接监督。 我们提出DiffImaginE,它将MNER类型验证建模为条件潜变量扩散推断。给定片段定位的视觉证据,一个类型条件下的去噪器预测注入到其标准化潜在表征中的噪声。由此产生的去噪误差提供了一个与ELBO一致的、关于类型条件负对数似然的替代指标,从而可以依据不同类型假设对观察证据的解释程度来比较它们。DiffImaginE保留标准的编码器栈,仅将确定性验证器替换为使用Min-SNR加权训练的、基于无分类器引导的扩散评分器。为了弥合生成式似然估计与判别式预测之间的差距,我们直接监督每个类型的扩散分数作为分类逻辑值,学习跨噪声水平聚合证据,并使用对偶抽样来降低蒙特卡洛比较方差。我们的理论分析表明,无分类器引导会锐化诱导的类型后验,并刻画了在对偶去噪器成本下对偶配对何时能产生更低方差。在Twitter-2015和Twitter-2017上的实验表明,在相同编码器、辅助目标和评估协议下,DiffImaginE相对于匹配的确定性ImaginE对照持续带来改进,并得到消融实验和配对显著性检验的进一步支持。 ## 1 引言 社交媒体文本上的命名实体识别(NER)具有挑战性,因为帖子通常简短、嘈杂且词汇模糊。多模态NER(MNER)利用随附的图像来消解这种歧义。例如,“Jordan dropped 40”可能指一个人、一个品牌或其他实体,而相关图像可以揭示“Jordan”是指运动员、组织还是杂项实体(Moon等,2018(https://arxiv.org/html/2608.03025#bib.bib17);Zhang等,2018(https://arxiv.org/html/2608.03025#bib.bib18);Lu等,2018(https://arxiv.org/html/2608.03025#bib.bib19))。因此,一种广泛采用的公式会枚举候选片段,并验证每个拟议的实体类型是否与联合的文本-图像上下文兼容(Yu等,2020(https://arxiv.org/html/2608.03025#bib.bib20);Chen等,2022(https://arxiv.org/html/2608.03025#bib.bib23);Wang等,2022(https://arxiv.org/html/2608.03025#bib.bib24))。在这种公式下,验证是核心:编码器提供上下文化的多模态表示,但最终决策取决于分配给每个\(span,type\)\(\\text\{span\},\\text\{type\}\)假设的兼容性。 先前的工作通常通过*想象*来进行验证。给定一个片段和候选类型,预测器合成在该假设下预期的视觉特征,比较器则测量其与观察证据的一致性(Chen等,2022(https://arxiv.org/html/2608.03025#bib.bib23);Xu等,2022(https://arxiv.org/html/2608.03025#bib.bib25))。尽管直观,这种确定性公式将一个类型的多种视觉表现压缩为单一想象点。一个PER提及可能表现为正面脸部、侧面轮廓、远处的身影或动作场景,而一个ORG提及可能由标志、店面、制服或广告支持。单一原型无法充分捕捉这种类型内变化,尤其是对于像MISC这样异质且视觉上重叠的类别。 此外,确定性兼容性分数不提供明确的似然解释。它们衡量与一个想象特征的相似性,但不衡量在每种竞争类型下观察证据被解释的合理性。因此,负假设主要受到间接的对比压力,使得相关类型可能获得同样高的分数。更合适的验证器应询问:*在哪种类型假设下,观察到的片段定位视觉证据最合理?* 扩散模型为这种比较提供了自然机制。一个在多个损坏水平上训练的条件去噪器建模的是可能观察结果的分布,而非单一代表点。其期望的类别条件去噪误差可以解释为条件对数似然的负变分界,从而能够通过比较不同假设下的重建误差进行分类(Li等,2023(https://arxiv.org/html/2608.03025#bib.bib12);Clark和Jaini,2023(https://arxiv.org/html/2608.03025#bib.bib13))。然而,现有的扩散分类器主要操作于完整图像。将其应用于MNER并非易事,因为被评分的对象是一个低维、片段条件下的跨模态潜在表征,其尺度随联合训练的编码器而变化,而生成式分数最终必须支持判别式片段分类和拒绝非实体假设。 我们提出DiffImaginE,一种用于MNER的条件潜变量扩散验证器。它保留标准的文本编码器、视觉编码器和片段-视觉交互模块,同时将确定性想象替换为类型条件的扩散评分。对于每个候选片段,交叉注意力提取片段定位的视觉证据,该证据被标准化并用高斯噪声破坏。一个共享去噪器在每种候选类型下预测注入的噪声,由此产生的Min-SNR加权误差定义类型特定的验证分数。一个NULL条件分支还支持无分类器引导(Ho和Salimans,2022(https://arxiv.org/html/2608.03025#bib.bib8);Hang等,2023(https://arxiv.org/html/2608.03025#bib.bib9))。因此,DiffImaginE根据其条件去噪过程解释同一观察结果的好坏来评估每个假设。 由于生成式似然替代并不一定是最优判别式分类器,我们进一步以三种方式调整评分器。我们直接监督每个类型的分数作为分类逻辑值,学习时间步聚合权重以强调判别性噪声水平,并使用对偶噪声对在奇数分量占主导时减少蒙特卡洛比较方差。由此产生的分数由最终实体分类器与原始多模态表示融合。 DiffImaginE仅改变验证机制。我们匹配的ImaginE对照使用相同的编码器、片段定位模块、辅助目标、分类头、优化过程和解码协议,但保留确定性的想象-比较验证。这种受控比较隔离了将单点想象替换为分布式扩散评分的效果(第4.5节(https://arxiv.org/html/2608.03025#S4.SS5.SSS0.Px1))。 我们的贡献总结如下: - •基于扩散的类型验证。我们将MNER验证建模为条件潜变量扩散推断,将单点视觉想象替换为基于ELBO的分布式评分器。 - •适应多模态片段潜变量。我们结合了潜在标准化、片段和类型条件的去噪、无分类器引导以及Min-SNR加权,用于低维片段定位证据。 - •判别式且方差降低的评分。我们将扩散分数作为类型逻辑值进行监督,学习其跨时间步的聚合,并推导了对偶估计何时能降低比较方差的条件(第3.7节(https://arxiv.org/html/2608.03025#S3.SS7)和第3.9节(https://arxiv.org/html/2608.03025#S3.SS9))。 - •受控评估。在Twitter-2015和Twitter-2017上的实验显示,相对于匹配的确定性验证器有一致的改进,并得到消融和配对检验的支持。 参见图1的说明:DiffImaginE将单点想象-比较验证替换为对片段定位视觉证据的类型条件去噪:每种类型通过其去噪误差评分,当类型的视觉证据多样时,这能更好地分离易混淆的假设。 ## 2 预备知识 我们介绍片段级MNER公式、由DiffImaginE评分的视觉证据,以及我们验证器所依据的扩散分类器估计器。 ### 2.1 多模态NER与片段级类型验证 一个MNER实例由标记序列x=\(x1,...,xL\)\\bm\{x\}=\(x\_\{1\},\\dots,x\_\{L\}\)和图像m\\bm\{m\}组成。任务是识别所有实体片段,并从Y=\{PER,LOC,ORG,MISC\}\\mathcal\{Y\}=\\\{\\texttt\{PER\},\\texttt\{LOC\},\\texttt\{ORG\},\\texttt\{MISC\}\\\}中为每个片段分配一个类型。遵循枚举-验证公式,我们枚举满足1≤i≤j≤L1\\leq i\\leq j\\leq L且j−i\+1≤Wj\-i\+1\\leq W的候选片段s=\(i,j\)s=\(i,j\),并将每个分类为K=\|Y\|\+1=5K=\|\\mathcal\{Y\}\|\+1=5个标签,包括非实体类O。因此,验证器共同确定候选是否是实体,如果是,则确定其类型。 ### 2.2 片段定位的视觉证据 文本编码器(RoBERTa(Liu等,2019(https://arxiv.org/html/2608.03025#bib.bib28)))产生上下文标记状态,而视觉编码器(CLIP-ViT(Radford等,2021(https://arxiv.org/html/2608.03025#bib.bib29);Dosovitskiy等,2020(https://arxiv.org/html/2608.03025#bib.bib30)))产生全局和块级图像特征。两者都被投影到共享的dd维空间中。边界感知池化产生片段表示s∈Rd\\bm\{s\}\\in\\mathbb\{R\}^\{d\},该表示关注图像块以产生片段定位的视觉证据zsv∈Rd\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\}\\in\\mathbb\{R\}^\{d\}(Vaswani等,2017(https://arxiv.org/html/2608.03025#bib.bib31);Chen等,2022(https://arxiv.org/html/2608.03025#bib.bib23))。DiffImaginE针对zsv\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\}评分类型假设;所有上游编码器和交互模块与确定性基线共享。 ### 2.3 扩散模型与扩散分类器 我们使用方差保持的DDPM(Ho等,2020(https://arxiv.org/html/2608.03025#bib.bib2);Nichol和Dhariwal,2021(https://arxiv.org/html/2608.03025#bib.bib3)),具有TT步和余弦调度\{α ̄t\}t=0T−1\\\{\\bar\{\\alpha\}\_\{t\}\\\}\_\{t=0\}^\{T\-1\}。给定干净潜变量v∈Rd\\bm\{v\}\\in\\mathbb\{R\}^\{d\},前向过程为 vt=α ̄tv\+1−α ̄tε,ε∼N\(0,I\),\\bm\{v\}\_\{t\}=\\sqrt\{\\bar\{\\alpha\}\_\{t\}\}\\,\\bm\{v\}\+\\sqrt\{1\-\\bar\{\\alpha\}\_\{t\}\}\\,\{\\epsilon\},\\qquad\{\\epsilon\}\\sim\\mathcal\{N\}\(0,I\),(1)其中条件去噪器εθ\(vt,c,t\)\{\\epsilon\}\_\{\\theta\}\(\\bm\{v\}\_\{t\},\\bm\{c\},t\)在条件c\\bm\{c\}下预测注入的噪声。相应的信噪比为SNR\(t\)=α ̄t/\(1−α ̄t\)\\mathrm\{SNR\}\(t\)=\\bar\{\\alpha\}\_\{t\}/\(1\-\\bar\{\\alpha\}\_\{t\}\)。 扩散分类器(Li等,2023(https://arxiv.org/html/2608.03025#bib.bib12);Clark和Jaini,2023(https://arxiv.org/html/2608.03025#bib.bib13))通过其期望去噪误差评估类别假设kk: errk=Et,ε\[w\(t\)‖ε−εθ\(α ̄tv\+1−α ̄tε,ck,t\)‖22\]\.\\mathrm\{err\}\_\{k\}=\\mathbb\{E\}\_\{t,\{\\epsilon\}\}\\\!\\left\[w\(t\)\\left\\\|\{\\epsilon\}\-\{\\epsilon\}\_\{\\theta\}\\\!\\left\(\\sqrt\{\\bar\{\\alpha\}\_\{t\}\}\\bm\{v\}\+\\sqrt\{1\-\\bar\{\\alpha\}\_\{t\}\}\{\\epsilon\},\\bm\{c\}\_\{k\},t\\right\)\\right\\\|\_\{2\}^\{2\}\\right\]\.(2)当w\(t\)w\(t\)适当时,errk\\mathrm\{err\}\_\{k\}对应于logpθ\(v∣ck\)\\log p\_\{\\theta\}\(\\bm\{v\}\\mid\\bm\{c\}\_\{k\}\)的负ELBO(除类别无关常数外),因此较低误差表示类别更可能(Kingma等,2021(https://arxiv.org/html/2608.03025#bib.bib6);Ho等,2020(https://arxiv.org/html/2608.03025#bib.bib2))。 DiffImaginE设置v=zsv\\bm\{v\}=\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\},并使用复合条件ck=\(s,ek\)\\bm\{c\}\_\{k\}=\(\\bm\{s\},\\bm\{e\}\_\{k\}\),从而得到去噪器εθ\(vt,s,ek,t\)\{\\epsilon\}\_\{\\theta\}\(\\bm\{v\}\_\{t\},\\bm\{s\},\\bm\{e\}\_\{k\},t\)。由此产生的误差衡量类型kk解释与片段ss相关的视觉证据的好坏。我们通过对\(t,ε\)\(t,\{\\epsilon\}\)进行蒙特卡洛采样来估计期望,将errk,n\\mathrm\{err\}\_\{k,n\}记为单个估计值,将errk\\mathrm\{err\}\_\{k\}记为聚合值。 ## 3 DiffImaginE模型 ### 3.1 概述 DiffImaginE将确定性想象-比较验证器替换为公式2(https://arxiv.org/html/2608.03025#S2.E2)的条件扩散评分器。对于每个有效片段,片段-视觉交叉注意力产生zsv\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\},该证据被标准化(第3.2节(https://arxiv.org/html/2608.03025#S3.SS2)),在所有KK个类型假设下评分(第3.4节(https://arxiv.org/html/2608.03025#S3.SS4)),并与文本和视觉表示融合以进行最终分类(图2(https://arxiv.org/html/2608.03025#S3.F2))。反向想象和视觉相关性门从ImaginE原样继承,详见技术附录。填充和无效片段在所有扩散前向过程中被掩蔽。 参见图2的说明:DiffImaginE流水线:交叉注意力产生片段表示s和片段定位的视觉证据z;扩散验证器通过类型条件去噪(含用于无分类器引导的NULL分支)对每种类型评分,分类器将这些分数与多模态特征融合以进行最终预测。 ### 3.2 潜在标准化 zsv\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\}的信号尺度由编码器设定,而非扩散调度,因此针对单位方差数据校准的余弦调度在原始的低维跨模态潜变量上会失配。在扩散前,我们在训练批次的校准集上估计zsv\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\}的逐维均值μ\\bm\{\\mu\}和标准差σ\\bm\{\\sigma\},并在标准化潜变量v=\(zsv−μ\)⊘σ\\bm\{v\}=\(\\bm\{z\}^\{\\mathrm\{v\}\}\_\{s\}\-\\bm\{\\mu\}\)\\oslash\\bm\{\\sigma\}上运行扩散过程,这类似于潜在扩散模型的潜变量缩放(Rombach等,2022(https://arxiv.org/html/2608.03025#bib.bib10))。由于在联合训练过程中编码器会漂移,\(μ,σ\)\(\\bm\{\\mu\},\\bm\{\\sigma\}\)在去噪器预热后重新估计,并在此后周期性重新估计,从而使SNR曲线跟踪实时编码器。与图像扩散不同,这里评分的对象是add维片段摘要而非空间场,因此失配……(原文在此结束)
相似文章
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。
UniDDT: 通过解耦扩散变换器统一多模态理解与生成
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
PerceptionDLM: 基于多模态扩散语言模型的并行区域感知
PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。
MobiDiff:面向人类移动数据生成的多通道语义感知离散扩散框架
介绍MobiDiff,一种端到端的离散扩散框架,通过对多通道语义骨架进行去噪来生成人类移动数据,在实际数据集上实现了更快的推理速度和具有竞争力的保真度。