用于非对称表示学习的角色感知神经凸散度头

arXiv cs.LG 论文

摘要

本文引入了角色感知神经凸散度头,在评估输入凸神经Bregman散度之前应用源角色和目标角色投影,从而为词汇蕴含、句子蕴含和本体层级等任务实现结构化和可解释的非对称距离学习。实验表明,在语义和本体基准上,角色感知投影相较于普通ICNN-Bregman头在方向准确性上持续提升。

arXiv:2607.01762v1 Announce Type: new 摘要:许多表示学习问题涉及有向关系,例如词汇蕴含、句子蕴含、本体层级和引用链接。标准的欧几里得、余弦和马氏距离头是对称的,而通用的神经评分器可以建模方向性但几何结构有限。本文提出了一种用于非对称表示学习的角色感知神经凸散度头。该头在评估输入凸神经Bregman散度之前应用源角色和目标角色投影,在角色投影空间中生成非负结构化分数。我们刻画了其投影空间恒等性、源角色凸性、方向差距分解以及基于Hessian的局部曲率。在词汇、句子、本体和有向图基准上的实验比较了对称距离、非结构化非对称评分器、序/双曲基线、普通ICNN-Bregman头和所提出的角色感知变体。在主语义和本体基准上,跨十个随机种子,角色感知投影在保持零观察负散度率的同时,始终提高了方向准确性。结果还识别出一个边界情况:在大规模固定特征引用预测中,专门的对称或双曲基线在排序准确性上仍然更强。总体而言,所提出的头最适合被理解为一种结构化和可解释的即插即用距离模块,适用于方向性关系重要的任务。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:43

# 角色感知的神经凸散度头用于非对称表示学习
Source: https://arxiv.org/html/2607.01762
Lu Shen²²黄鹤与陆沉对本文贡献相同\.黄云峰李奇重庆工商大学数学与统计学院,重庆,400067,中国重庆统计智能计算与监测重点实验室,重庆工商大学,重庆,400067,中国重庆工商大学食品科学学院,重庆,400067,中国多特蒙德工业大学电气工程与信息技术学院,多特蒙德,德国

###### 摘要

许多表示学习问题涉及有向关系,例如词汇蕴涵、句子蕴涵、本体层次结构和文献引用链接。标准的欧几里得距离、余弦距离和马氏距离头都是对称的,而通用的神经评分器可以建模方向性,但提供的几何结构有限。本文提出了一种用于非对称表示学习的角色感知神经凸散度头。该头在评估输入凸神经布雷格曼散度之前应用源角色和目标角色投影,从而在角色投影空间中产生一个非负的结构化分数。我们刻画了其在投影空间中的恒等式、源角色凸性、方向间隙分解以及基于海森矩阵的局部曲率。在词汇、句子、本体和有向图基准上的实验比较了对称距离、无结构非对称评分器、顺序/双曲基线、普通ICNN-布雷格曼头和所提出的角色感知变体。在主要语义和本体基准上,跨十个随机种子的结果表明,角色感知投影在保持零观察负散度率的同时,一致地提高了普通ICNN-布雷格曼头的方向准确性。结果也识别出一个边界情况:在大规模固定特征的引用预测任务中,专门的对称或双曲基线在排序准确性上仍然更强。总体而言,所提出的头最好被理解为一个结构化的、可解释的即插即用距离模块,适用于有向关系重要的任务。

###### 关键词:

非对称度量学习,布雷格曼散度,输入凸神经网络,角色感知投影,有向表示学习,可解释性

††期刊:Neurocomputing## 1 引言

距离函数是表示学习的核心组成部分。它们用于度量学习中的样本比较、最近邻检索、候选链接评分、基于原型的样本分类以及嵌入空间的正则化。大量实际系统仍然依赖对称距离,如欧几里得距离、余弦距离或马氏距离。当感兴趣的关系是相似性时,这些选择是有效的。然而,机器学习中研究的许多关系并非对称的。上位关系是从特定概念指向更一般概念的方向;蕴涵关系是从前提指向假设的方向;本体边是从子术语指向父术语的方向;引用链接是从引用论文指向被引论文的方向。

相似性判断中非对称性的重要性并非新事:特沃斯基基于特征的理论表明,相似性可以具有方向性和上下文依赖性,挑战了纯粹的度量比较观点\[22 (https://arxiv.org/html/2607.01762#bib.bib28)\]。在表示学习中,一种应对方法是放弃距离结构,使用通用的神经评分器,例如在拼接的成对特征上使用多层感知机。这提供了表达性的非对称性,但削弱了学习分数的几何意义。另一种应对方法是使用结构化的非对称几何,包括顺序嵌入\[23 (https://arxiv.org/html/2607.01762#bib.bib29)\]或双曲嵌入\[15 (https://arxiv.org/html/2607.01762#bib.bib20)\]。这些方法与层次数据匹配良好,但它们的假设可能具有限制性,并且通常作为完整的嵌入模型实现,而不是作为任意编码器的即插即用头。

本文研究一个中间地带。我们探讨一个非对称头是否可以同时具备神经性和几何结构性。我们的出发点是布雷格曼散度,最初在凸规划中引入\[6 (https://arxiv.org/html/2607.01762#bib.bib3)\],

Dφ\(x,y\)=φ\(x\)−φ\(y\)−∇φ\(y\)⊤\(x−y\),D\_\{\\phi\}\(x,y\)=\\phi\(x\)\-\\phi\(y\)\-\\nabla\\phi\(y\)^\{\\top\}\(x\-y\),\(1\)其中φ\\phi是一个可微凸势函数。布雷格曼散度通常是非对称且非负的,并且包含许多经典散度作为特例\[2 (https://arxiv.org/html/2607.01762#bib.bib4)\]。它们的性质扎根于经典凸分析和凸优化\[18 (https://arxiv.org/html/2607.01762#bib.bib23),5 (https://arxiv.org/html/2607.01762#bib.bib5)\]。最近的工作探索了布雷格曼散度和凸势函数的神经参数化\[1 (https://arxiv.org/html/2607.01762#bib.bib1),8 (https://arxiv.org/html/2607.01762#bib.bib8),12 (https://arxiv.org/html/2607.01762#bib.bib17)\]。我们在这条研究线上构建,但针对一个特定问题:使用神经凸散度作为非对称表示学习的即插即用距离头。

所提出的方法,称为角色感知神经凸散度头,在计算神经布雷格曼散度之前应用两个可学习的角色投影:

Dφ,Ps,Pt\(x,y\)=Dφ\(Psx,Pty\),D\_\{\\phi,P\_\{s\},P\_\{t\}\}\(x,y\)=D\_\{\\phi\}\(P\_\{s\}x,P\_\{t\}y\),\(2\)其中PsP\_\{s\}和PtP\_\{t\}将输入嵌入映射到源角色和目标角色。这种构造将一个已知的非对称散度转变为实用的、角色感知的、与编码器无关的头。其贡献在于将即插即用的ICNN势函数、角色特定投影、有向训练损失以及用于非对称成对学习的解释工具结合在一起。

本文做出三项主要贡献。

首先,我们提出了一种用于非对称表示学习的角色感知神经凸散度头。该头可以附加到固定嵌入或学习到的编码器上,并在源-目标投影空间中返回一个非负的布雷格曼散度。

其次,我们提供了该头的理论和诊断特征刻画。我们展示了经典布雷格曼性质在角色投影后如何保留,推导了方向间隙的二次特例分解,并将这种分解与基于海森矩阵的局部曲率分析联系起来。

第三,我们在词汇蕴涵、句子蕴涵、本体层次结构和有向引用任务上进行了系统的实证研究。实验比较了对称距离、无结构非对称评分器、顺序/双曲基线、普通ICNN-布雷格曼头和所提出的角色感知变体,并进行了消融研究、显著性测试和可解释性诊断。

## 2 相关工作

### 2.1 度量学习和对称距离头

经典的度量学习方法学习保持邻域或约束结构的距离,包括大间隔最近邻学习\[25 (https://arxiv.org/html/2607.01762#bib.bib31)\]和信息论度量学习\[9 (https://arxiv.org/html/2607.01762#bib.bib12)\]。更广泛的文献由Kulis \[11 (https://arxiv.org/html/2607.01762#bib.bib16)\]回顾,他强调度量学习是将表示空间的几何适应于任务特定比较约束的问题。在现代深度学习流水线中,学习到的编码器通常与欧几里得距离、余弦距离或马氏距离头配对。这些头在相似性任务上稳定、高效且可解释,但它们满足d\(x,y\)=d\(y,x\)d\(x,y\)=d\(y,x\),因此设计上压扁了方向特定信息。

### 2.2 非对称表示学习

有向关系激发了专门的嵌入几何。顺序嵌入通过坐标方向不等式建模偏序关系,并已用于视觉语义层次和蕴涵\[23 (https://arxiv.org/html/2607.01762#bib.bib29)\]。双曲和庞加莱嵌入利用负曲率来紧凑地表示树和层次\[15 (https://arxiv.org/html/2607.01762#bib.bib20)\]。知识图谱模型如TransE和RotatE提供了关系数据上结构化方向评分的额外示例\[3 (https://arxiv.org/html/2607.01762#bib.bib7),20 (https://arxiv.org/html/2607.01762#bib.bib27)\]。这些模型功能强大,但通常强加任务特定的几何或关系特定的评分假设。

### 2.3 输入凸网络和神经布雷格曼散度

输入凸神经网络(ICNN)通过约束选定权重为非负来参数化凸标量函数\[1 (https://arxiv.org/html/2607.01762#bib.bib1)\]。凸神经势函数与凸分析、布雷格曼距离和投影方法的更悠久传统相联系\[6 (https://arxiv.org/html/2607.01762#bib.bib3),7 (https://arxiv.org/html/2607.01762#bib.bib9),18 (https://arxiv.org/html/2607.01762#bib.bib23)\]。深度散度学习和神经布雷格曼散度模型表明,神经势函数可以学习灵活的不相似性,同时保留从凸性继承的结构\[8 (https://arxiv.org/html/2607.01762#bib.bib8),19 (https://arxiv.org/html/2607.01762#bib.bib26),12 (https://arxiv.org/html/2607.01762#bib.bib17)\]。我们的工作在侧重点上有所不同:我们将散度视为有向表示学习的可重用头,并评估角色特定投影是否能在不放弃布雷格曼结构的情况下改进方向行为。

### 2.4 有向语义和图关系基准

HyperLex评估分级词汇蕴涵和上位关系\[24 (https://arxiv.org/html/2607.01762#bib.bib30)\]。WordNet提供大规模的词汇分类\[14 (https://arxiv.org/html/2607.01762#bib.bib19)\]。SICK和SNLI是标准的句子对蕴涵资源\[13 (https://arxiv.org/html/2607.01762#bib.bib18),4 (https://arxiv.org/html/2607.01762#bib.bib6)\]。基因本体提供有向生物概念关系\[21 (https://arxiv.org/html/2607.01762#bib.bib14)\]。OGB链接预测数据集评估大规模固定特征设置下的有向图预测\[10 (https://arxiv.org/html/2607.01762#bib.bib15)\]。这些资源使我们能够测试所提出的头是否在单一狭窄数据集之外有用。

## 3 方法

### 3.1 问题设定

设x,y∈Rdx,y\\in\\mathbb\{R\}^\{d\}是由编码器产生的两个嵌入,或直接提供的固定输入特征。有向对\(x,y\)\(x,y\)表示xx应以源到目标的方向与yy相关。本文使用的数据集不提供真实的散度值D\(x,y\)D\(x,y\)。相反,它们提供有向关系标签或分级关系分数,例如子到父的本体边、前提到假设的蕴涵标签,或引用到被引论文的链接。因此,散度是一个学习到的评分函数。目标是学习一个分数s\(x,y\)s\(x,y\)或类似距离的量D\(x,y\)D\(x,y\),使得正有向对的散度小于破坏的负对,并且当任务要求时,正向可以与反向区分。

该头设计为在两种意义上即插即用。数学上,它仅消费嵌入并返回成对散度,因此可以放置在不同的编码器之后。在软件中,它实现为一个具有与普通距离头相同接口的模块:给定两批嵌入,它返回每对的一个标量。

### 3.2 输入凸势函数

我们使用ICNN参数化一个可微的强凸势函数φθ:Rk→R\\phi\_\{\\theta\}:\\mathbb\{R\}^\{k\}\\rightarrow\\mathbb\{R\}\[1 (https://arxiv.org/html/2607.01762#bib.bib1)\]。典型层的形式为

zl\+1=σ\(Wl\(z\)zl\+Wl\(u\)u\+bl\),z\_\{\\ell\+1\}=\\sigma\(W\_\{\\ell\}^\{\(z\)\}z\_\{\\ell\}\+W\_\{\\ell\}^\{\(u\)\}u\+b\_\{\\ell\}\),\(3\)其中uu是输入,σ\\sigma是凸非递减激活函数,且Wl\(z\)W\_\{\\ell\}^\{\(z\)\}被约束为逐元素非负。为了提高数值稳定性并确保强凸性,我们使用二次项:

φθ\(u\)=gθ\(u\)\+λ2∥u∥22,λ\>0,\\phi\_\{\\theta\}\(u\)=g\_\{\\theta\}\(u\)\+\\frac\{\\lambda\}\{2\}\\lVert u\\rVert\_\{2\}^\{2\},\\quad\\lambda\>0,\(4\)其中gθg\_\{\\theta\}是ICNN的输出。

诱导的布雷格曼散度为

Dφθ\(u,v\)=φθ\(u\)−φθ\(v\)−∇φθ\(v\)⊤\(u−v\)\.D\_\{\\phi\_\{\\theta\}\}\(u,v\)=\\phi\_\{\\theta\}\(u\)\-\\phi\_\{\\theta\}\(v\)\-\\nabla\\phi\_\{\\theta\}\(v\)^\{\\top\}\(u\-v\)\.\(5\)当φθ\\phi\_\{\\theta\}是凸函数时,该量为非负,并且通常是非对称的。

### 3.3 角色感知投影散度

普通布雷格曼散度是非对称的,但实践中,如果两个参数通过相同的表示角色传递,学习到的方向可能较弱。因此,我们引入角色投影:

u=Psx,v=Pty,u=P\_\{s\}x,\\quad v=P\_\{t\}y,\(6\)其中PsP\_\{s\}和PtP\_\{t\}是可学习的源映射和目标映射。所提出的头为

Dθ,Ps,Pt\(x,y\)=Dφθ\(Psx,Pty\)\.D\_\{\\theta,P\_\{s\},P\_\{t\}\}\(x,y\)=D\_\{\\phi\_\{\\theta\}\}\(P\_\{s\}x,P\_\{t\}y\)\.\(7\)投影可以是线性映射、浅层MLP或受约束的仿射映射。实验主要使用线性映射,因为它们提供最清晰的解释:模型学习当项目充当源时嵌入空间的哪些方向重要,以及当项目充当目标时哪些方向重要。

图1 (https://arxiv.org/html/2607.01762#S3.F1)总结了所提出头的系统级角色。一对项目被编码为两个嵌入,所提出的头对有序对进行评分,得到的散度可用于排序、链接预测或解释。在实验中,该评分模块通过下面描述的三元组风格成对排序进行训练。虽然报告的实验使用固定嵌入来隔离头,但该模块本身具有与普通距离头相同的输入输出接口,并且可以放置在学习到的编码器之后。

有向对编码器嵌入xxyy角色感知的即插即用头DD训练解释所提出头的放大视图zxz\_\{x\}zyz\_\{y\}PsP\_\{s\}PtP\_\{t\}源角色目标角色uuvv输入凸势函数DD损失诊断同一个头可以附加在固定嵌入或学习到的编码器之后。

图 1: 所提出的角色感知即插即用散度头的神经网络架构视图。一个有向对被编码为两个嵌入,所提出的头应用源角色和目标角色投影,然后ICNN诱导的布雷格曼散度返回一个有序对分数。该分数用于成对排序损失以及几何诊断,如方向间隙和局部曲率。
### 3.4 训练目标

对于有向链接预测和成对关系学习,实验使用三元组风格的成对排序目标,遵循大间隔度量学习的观点,即监督可以以相对比较约束的形式给出,而不是绝对距离\[25 (https://arxiv.org/html/2607.01762#bib.bib31),11 (https://arxiv.org/html/2607.01762#bib.bib16)\]。每个观察到的有向关系\(x,y\+\)\(x,y^\{\+\}\)被视为一个正源-目标对。在训练期间,从候选池中为每个正对采样一个破坏的目标y−y^\{\-\},该候选池排除了同一源的注释正目标。这种负采样协议在基于嵌入的链接预测中也很常见,其中模型被训练为对观察到的边给予高于破坏边的分数\[3 (https://arxiv.org/html/2607.01762#bib.bib7)\]。然后我们 mi(原文截断,但根据要求,翻译到提供的部分为止)

相似文章

用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

用上下文集成统一保形语言任务

arXiv cs.CL

本文提出了保形相关性框架,该框架利用上下文学习和集成方法,在通过保形预测维持覆盖率保证的同时,提升自然语言处理任务的简洁性。

通过非对称互变分学习的多模态连续推理

Hugging Face Daily Papers

提出非对称互变分学习(AMVL),通过双向校准防止答案泄露并提升潜在空间稳定性,解决多模态连续推理中的训练-推理不匹配问题,在BLINK基准测试上取得了显著的性能提升。