文档内非对称预测学习在科学文献表征中的应用

arXiv cs.CL 论文

摘要

本文提出SciJEPA,一种无需引用网络、利用文档内非对称预测学习构建科学文献表征的框架,并证明正则化可有效提升模型性能。

arXiv:2608.28625v1 公告类型:新研究 摘要:本研究探讨利用论文话语结构进行科学文献表征的预测预训练方法。我们提出SciJEPA,这是一种无需引用网络的框架,通过文档内非对称预测任务进行学习:利用标题和摘要的表征预测方法章节表征,再利用方法章节表征预测结论表征。在RELISH、高影响力引用、SciDocs和引用预测任务上的实验表明,纯预测训练具有可行性,但性能弱于使用相同章节对构建的受控对比学习基线。引入切片各向同性高斯正则化(SIGReg)能显著提升性能并缩小差距。正则化效果因任务而异:适度SIGReg有助于细粒度排序,但过强的正则化可能削弱局部语义对齐。进一步分析表明,不同的编码分支支持不同的检索模式。这些结果表明,只要谨慎控制嵌入空间几何结构,文档内预测学习可作为科学文献表征的可靠无引用替代方案。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:54

# 面向科学文档表征的非对称文档内预测学习
来源:https://arxiv.org/html/2608.28625
作者:You Zuo\\up1,2 Éric de la Clergerie\\up2 Benoît Sagot\\up2 \(1\) Questel, 法国巴黎 \(2\) Inria, 法国巴黎 firstname\.lastname@inria\.fr

###### 摘要

面向科学文档表征的非对称文档内预测学习

\\NoAutoSpacing

摘要

我们研究利用论文话语结构进行科学文档表征的预测预训练。我们提出SciJEPA,这是一个无需引用的框架,通过非对称的文档内预测进行学习:标题和摘要表征用于预测方法部分表征,方法部分表征则用于预测结论部分表征。在RELISH、高影响力引用、SciDocs和引用预测数据集上的实验表明,单纯的预测训练是可行的,但弱于使用相同章节对的受控对比基线。加入切片各向同性高斯正则化显著提升了性能并缩小了这一差距。正则化效果依赖于任务:适度的SIGReg有助于细粒度排序,而更强的正则化可能削弱局部对齐。我们进一步证明不同的编码分支支持不同的检索模式。这些结果表明,只要仔细控制嵌入几何结构,文档内预测学习可以作为科学文档表征的一个有前景的、无需引用的补充方法。

Nous étudions le pré\-entraînement prédictif pour la représentation de documents scientifiques en exploitant la structure discursive des articles\. Nous proposons SciJEPA, un cadre sans supervision par citations qui apprend par prédiction asymétrique intra\-document : les représentations du titre et du résumé sont utilisées pour prédire les représentations de la section méthodologique, puis les représentations de la section méthodologique pour prédire celles de la conclusion\. Des expériences sur RELISH, high\-influence citation, SciDocs et cite prediction montrent que l’apprentissage prédictif seul est viable, mais reste inférieur à une baseline contrastive contrôlée utilisant les mêmes paires de sections\. L’ajout de la régularisation gaussienne isotrope esquissée \(SIGReg\) améliore nettement les performances et réduit cet écart\. L’effet de la régularisation dépend de la tâche : une SIGReg modérée aide le classement fin, tandis qu’une régularisation plus forte peut affaiblir l’alignement local\. Nous montrons également que différentes branches d’encodage soutiennent différents régimes de recherche\. Ces résultats positionnent l’apprentissage prédictif intra\-document comme un complément prometteur, sans supervision par citations, pour la représentation de documents scientifiques, à condition que la géométrie des plongements soit soigneusement contrôlée\.

关键词:自监督学习,联合嵌入预测架构(JEPA),文档表征。

Mots\-clés:apprentissage auto\-supervisé, architecture prédictive à plongements conjoints \(JEPA\), représentation de documents\.

## 1引言

学习有效的科学文档表征对于学术检索、引文推荐、文献发现和文档排名至关重要。强大的科学文档编码器,如SPECTER(Cohan等人,2020年(https://arxiv.org/html/2608.28625#bib.bib9))和SPECTER2(Singh等人,2023年(https://arxiv.org/html/2608.28625#bib.bib21)),通常编码论文的标题和摘要,并从引文链接或相关学术任务衍生的跨文档监督中学习。这种策略非常有效,尤其是在面向引用的基准测试中,但引文链接定义了一种特定的监督信号:对于新发表的论文,这种信号是延迟的(Xing等人,2021年(https://arxiv.org/html/2608.28625#bib.bib24)),在不同领域和文章类型间存在差异(Radicchi等人,2008年(https://arxiv.org/html/2608.28625#bib.bib20)),并且服务于超越语义相似性的修辞功能,例如提供背景、认可方法或数据集、支持论点或与先前工作进行对比(Jurgens等人,2018年(https://arxiv.org/html/2608.28625#bib.bib16))。因此,受引用监督的编码器结合了文本语义和由图诱导的学术相关性。在这项工作中,我们探讨是否可以仅从论文内容和内部话语结构中学习有用的科学文档表征,而无需引文链接,以及这些无需引用的表征是否能够迁移到与引用相关的检索任务中。当密集的引文图可用时,我们认为这种信号是引文监督的补充,而非替代。

为研究这个问题,我们提出了SciJEPA,一个用于科学文档表征的联合嵌入预测架构。科学论文遵循从问题陈述到方法论和发现或意义的结构化演进:标题和摘要描述问题和贡献,方法部分详细说明如何解决问题,结论则总结结果和意义。一个有用的基于内容的表征应能支持这种推理:从高级摘要中,应该能推断出可能的方法;从方法中,应该能推断出合理的结论或结果。

SciJEPA通过两个非对称的文档内预测任务来实现这一思想:标题+摘要→方法,以及方法→结论。遵循联合嵌入预测架构(LeCun等人,2022年(https://arxiv.org/html/2608.28625#bib.bib17)),SciJEPA在表征空间中预测目标章节,而不是逐个标记地重建它。这一点很重要,因为前面的章节并不决定后面章节的确切措辞或细节,但确实约束了它们更广泛的话语角色和语义内容。因此,该目标鼓励模型在不使用引文链接或负例的情况下,学习问题陈述、方法和结论之间的依赖关系。

我们在来自SciRepEval(Singh等人,2023年(https://arxiv.org/html/2608.28625#bib.bib21))的科学检索基准上评估SciJEPA,并将其与使用相同语料库、主干网络和章节对的受控对比基线进行比较。单纯的预测训练能学习到有用的无需引用的表征,但仍弱于对比学习;加入SIGReg(Balestriero & LeCun, 2025年(https://arxiv.org/html/2608.28625#bib.bib2))显著提升了性能并缩小了这一差距。我们的分析确定嵌入几何结构是关键瓶颈:如果不进行正则化,预测训练倾向于产生各向异性的表征,其方差集中在少数几个主导方向上。这些发现表明,当嵌入几何结构被仔细控制时,文档内预测是一种可行的、无需引用的信号。

## 2相关工作

#### 科学文档表征。

科学文档编码器范围广泛,从领域自适应语言模型如SciBERT(Beltagy等人,2019年(https://arxiv.org/html/2608.28625#bib.bib5))到使用跨文档监督训练的文档级检索模型。以SciBERT为基础,SPECTER(Cohan等人,2020年(https://arxiv.org/html/2608.28625#bib.bib9))使用基于引用的三元组学习标题和摘要的嵌入,而SPECTER2(Singh等人,2023年(https://arxiv.org/html/2608.28625#bib.bib21))通过使用适配器的多格式训练扩展了这一方法。这些模型在基于引用的基准测试中表现强劲,因为它们的监督与评估信号紧密对齐。最近的工作如SemCSE(Brinner & Zarriess, 2025年(https://arxiv.org/html/2608.28625#bib.bib6))探索了通过大语言模型生成的摘要和对比正例对进行的非引用语义监督。而SciJEPA则从单个论文的内部话语结构中分离出一种无需引用的、非对比的信号。

#### 文档结构与方面。

先前的工作也利用科学文档结构。分层架构如HDT(He等人,2024年(https://arxiv.org/html/2608.28625#bib.bib14))通过分层注意力改善了长文档建模。CoSAEmb(Singh & Singh, 2024年(https://arxiv.org/html/2608.28625#bib.bib22))使用全文各章节作为特定方面的视图,并使用监督对比三元组损失训练章节感知的嵌入。FLeW(Dou等人,2025年(https://arxiv.org/html/2608.28625#bib.bib10))利用引文意图和引文频率来学习面向背景、方法和结果的表征。这些方法表明章节和方面是有用的,但通常使用结构进行长文档编码、对比匹配或基于引用的方面学习。SciJEPA则以不同方式使用结构:章节角色在同一论文内定义了非对称的预测任务,其中标题–摘要、方法和结论被视为通过方向性依赖相连的话语组件,而非可互换的视图。

#### 预测学习与几何结构。

联合嵌入预测架构(JEPA)被提出作为基于重建和对比的自监督学习的替代方案(LeCun等人,2022年(https://arxiv.org/html/2608.28625#bib.bib17))。JEPA不是重建输入或对比正负样本对,而是从上下文视图预测目标视图的潜在表征。这一范式在图像和视频学习中取得了成功(Assran等人,2023年(https://arxiv.org/html/2608.28625#bib.bib1);Bardes等人,2023年(https://arxiv.org/html/2608.28625#bib.bib4),2024年(https://arxiv.org/html/2608.28625#bib.bib3)),并且最近也被探索用于语言(Huang等人,2025年(https://arxiv.org/html/2608.28625#bib.bib15);Gillin等人,2026年(https://arxiv.org/html/2608.28625#bib.bib11))。由于非对比预测方法缺乏显式的负样本,它们引发了关于坍缩和各向异性的问题。LeJEPA(Balestriero & LeCun, 2025年(https://arxiv.org/html/2608.28625#bib.bib2))研究了可扩展的非对比联合嵌入学习,并引入了切片各向同性高斯正则化(SIGReg)作为一种鼓励非坍缩和更各向同性的表征的方法。我们基于这个正则化思想,研究SIGReg如何影响科学文档嵌入的全局各向同性、主导成分集中度和局部检索对齐。

## 3方法论

xcx\_\{c\}上下文xtx\_\{t\}目标在线编码器fθf\_\{\\theta\}目标编码器fξf\_\{\\xi\}hch\_\{c\}预测器gφg\_\{\\phi\}z^t\\hat\{z\}\_\{t\}ztz\_\{t\}Lpred\\mathcal\{L\}\_\{\\mathrm\{pred\}\}LSIGReg\\mathcal\{L\}\_\{\\mathrm\{SIGReg\}\}EMAl2\\ell\_\{2\}\+ std\.stop\-grad

图1:SciJEPA用于标题+摘要→方法以及方法→结论的概述。在线编码器通过预测器预测目标表征,而目标编码器通过指数移动平均更新并停止梯度。SIGReg在预测器之前对归一化的在线表征进行正则化;预处理细节见附录B(https://arxiv.org/html/2608.28625#A2)。### 3\.1非对称文档内预测

我们将科学文档预训练表述为一个*非对称文档内预测*问题。给定一个上下文章节xcx\_\{c\}和一个目标章节xtx\_\{t\},模型将每个章节编码为一个潜在表征,并学习从上下文表征预测目标表征。对于科学论文,我们使用两个方向性任务来实例化此框架:

标题+摘要→方法,\\displaystyle\\rightarrow\\text\{方法\},\(1\)
方法→结论,\\displaystyle\\rightarrow\\text\{结论\}\.\(2\)

第一个任务从摘要级上下文预测方法内容,第二个任务从方法信息预测结果导向的内容。这些对并非可互换的视图:它们的方向反映了论文内的话语依赖关系。

### 3\.2预测架构与正则化

图1(https://arxiv.org/html/2608.28625#S3.F1)总结了SciJEPA架构。在非对比潜在预测中,损失仅强制已学习表征之间的一致性。由于没有负样本或标记重建,对称的一致性目标可能通过将不同输入映射到相同或几乎相同的嵌入而发生坍缩。因此,SciJEPA遵循非对比自监督学习(Grill等人,2020年(https://arxiv.org/html/2608.28625#bib.bib13);Chen & He, 2021年(https://arxiv.org/html/2608.28625#bib.bib8);LeCun等人,2022年(https://arxiv.org/html/2608.28625#bib.bib17);Assran等人,2023年(https://arxiv.org/html/2608.28625#bib.bib1))中使用的在线-目标设计:在线分支通过反向传播进行优化,而目标分支提供缓慢演变的参考表征。

给定上下文章节xcx\_\{c\}和目标章节xtx\_\{t\},在线编码器fθf\_\{\\theta\}生成一个汇总的上下文表征hc=fθ\(xc\)h\_\{c\}=f\_\{\\theta\}\(x\_\{c\}\),而目标编码器fξf\_\{\\xi\}生成zt=fξ\(xt\)z\_\{t\}=f\_\{\\xi\}\(x\_\{t\}\)。梯度在ztz\_\{t\}处停止,因此目标表征在当前更新中是固定的。目标编码器不直接由预测损失优化;相反,在每次更新后,其参数作为在线编码器参数的指数移动平均(EMA)进行更新:

ξ←mξ\+\(1−m\)θ,\\xi\\leftarrow m\\xi\+\(1\-m\)\\theta,\(3\)

其中m∈\[0,1\)m\\in\[0,1\)是EMA动量,设置接近1,使目标编码器变化缓慢。因此,目标分支以延迟的方式跟随学习到的表征空间,为预测提供稳定的参考,并降低了表征坍缩的风险。

预测器gφg\_\{\\phi\}通过残差变换将上下文表征映射到目标潜在空间:

z^t=hc\+gφ\(hc\)\.\\hat\{z\}\_\{t\}=h\_\{c\}\+g\_\{\\phi\}\(h\_\{c\}\)\.\(4\)

此预测器是必需的,因为上下文和目标章节扮演不同的话语角色。标题–摘要表征应与方法表征相关,但不应被强制与之相同。因此,预测器吸收了章节角色之间的部分变换,同时保留在线编码器输出作为通用的文档表征。

对于每个训练样本ii,预测损失将预测表征z^t,i\\hat\{z\}\_\{t,i\}与停止梯度的目标表征zt,iz\_\{t,i\}进行匹配:

lpred\(i\)=1−cos⁡\(z^t,i,zt,i\)\.\\ell\_\{\\mathrm\{pred\}\}^\{\(i\)\}=1\-\\cos\(\\hat\{z\}\_\{t,i\},z\_\{t,i\}\)\.\(5\)

批量预测损失为Lpred=1B∑ilpred\(i\)\\mathcal\{L\}\_\{\\mathrm\{pred\}\}=\\frac\{1\}\{B\}\\sum\_\{i}\\ell\_\{\\mathrm\{pred\}\}^\{\(i\)\}\。

在线-目标设计稳定了预测目标,但并未控制文档嵌入在全局的分布方式。由于Lpred\\mathcal\{L\}\_\{\\mathrm\{pred\}\}不包含负样本,因此没有明确鼓励不同文档占据空间中的不同区域。我们在预测器之前的归一化在线表示批次上加入SIGReg(Balestriero & LeCun, \([2025\)(https://arxiv.org/html/2608.28625#bib.bib2))。SIGReg将批次分布的随机一维投影正则化到高斯参考分布,从而抑制坍缩和主导方向集中。

最终的训练目标是:

L=1B∑i=1Blpred\(i\)\+λLSIGReg\.\\mathcal\{L\}=\\frac\{1\}\{B\}\\sum\_\{i=1\}^\{B\}\\ell\_\{\\mathrm\{pred\}\}^\{\(i\)\}\+\\lambda\\mathcal\{L\}\_\{\\mathrm\{SIGReg\}\}\.\(6\)

默认情况下,评估使用在线编码器的输出。

相似文章

SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学

arXiv cs.LG

SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。

AeroJEPA:学习用于可扩展3D气动场建模的语义潜在表示

arXiv cs.LG

本文介绍了AeroJEPA,一种用于可扩展3D气动场建模的联合嵌入预测架构。它通过预测流场的语义潜在表示,解决了当前代理模型在可扩展性和设计实用性方面的局限性,从而实现了高效的高保真分析和设计优化。

注解版JEPA

Hacker News Top

联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。

无奖励的表征:JEPA对LLM微调的审计

arXiv cs.LG

本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。