风格还是内容?在受控内容重叠下评估风格分类器
摘要
本文利用平行圣经翻译引入了一种受控内容重叠设置,用于评估风格分类器在多大程度上依赖内容线索而非实际风格特征。结果表明,当移除内容线索时,低重叠模型性能下降,而高重叠模型则迁移得更为稳健。
arXiv:2606.07103v1 公告类型:新
摘要:风格分类器可以利用与自然采集数据中的风格标签相关的内容线索,但我们缺乏系统的方法来衡量这种依赖程度。我们通过基于平行圣经翻译构建的受控内容重叠设置来研究此问题。具体来说,我们将重叠参数 $\alpha$ 定义为内容身份与风格标签之间互信息的归一化残差,从而衡量不同风格类别间共享内容的程度:从无共享内容 ($\alpha=0$) 到完全共享内容 ($\alpha=1$)。对基于RoBERTa的分类器进行交叉重叠评估表明,当移除内容线索时,低重叠模型性能下降,而高重叠模型则迁移得更为稳健。进一步的跨风格内容检索探针显示,随着 $\alpha$ 增加,内容变得更难恢复,训练动态表明这种移除是逐渐发生的。综合这些结果,受控重叠为区分风格学习和内容捷径提供了一种简单的诊断方法。
查看缓存全文
缓存时间: 2026/06/08 09:22
# 风格还是内容?通过受控内容重叠评估风格分类器 来源:https://arxiv.org/html/2606.07103 ###### 摘要 风格分类器可能会利用与自然收集数据中的风格标签相关联的内容线索,但我们缺乏系统的方法来衡量这种依赖程度。我们通过基于平行圣经译本的受控内容重叠设置来研究这个问题。具体来说,我们将重叠参数α定义为内容身份与风格标签之间互信息的归一化残差,从而衡量不同风格类别之间共享内容的程度:从无共享内容(α=0)到完全共享内容(α=1)。对基于RoBERTa的分类器进行交叉重叠评估表明,低重叠模型在移除内容线索时会性能下降,而高重叠模型的迁移更稳健。一项跨风格内容检索探测进一步表明,随着α增加,内容变得较难恢复,并且训练动态显示这种移除是逐步发生的。总之,这些结果表明受控重叠提供了一种简单的诊断方法,用于区分风格学习与内容捷径。 风格还是内容?通过受控内容重叠评估风格分类器 Zhuo Liu Haozheng Du Xiangxiang Xu Hangfeng He 罗切斯特大学 [email protected] ## 1 引言 风格分类旨在识别文本的写作方式,而非其内容。它支持多种自然语言处理(NLP)应用(Stamatatos, 2009(https://arxiv.org/html/2606.07103#bib.bib1);Jin等人, 2022(https://arxiv.org/html/2606.07103#bib.bib9)),包括作者身份分析(Mikros和Argiri, 2007(https://arxiv.org/html/2606.07103#bib.bib14))、体裁分类、风格改写(Briakou等人, 2021(https://arxiv.org/html/2606.07103#bib.bib16))以及可控文本生成。基于预训练语言模型的最新分类器在标准基准测试中取得了显著进展(Carlson等人, 2018(https://arxiv.org/html/2606.07103#bib.bib4)),但仅凭高性能并不意味着它们学习了可迁移的风格模式(Geirhos等人, 2020(https://arxiv.org/html/2606.07103#bib.bib2);Altakrori等人, 2021(https://arxiv.org/html/2606.07103#bib.bib3))。 一个关键挑战在于,自然收集的数据中风格和内容常常纠缠在一起。具有不同风格标签的文本也可能在主题、实体、事件或领域上有所不同,这使得分类器能够利用对标签有预测作用的内容线索(Altakrori等人, 2021(https://arxiv.org/html/2606.07103#bib.bib3))。标准的留出评估可能无法诊断这种行为:当相同的内容-风格关联在训练集和测试集之间保持不变时,基于捷径的模型(Geirhos等人, 2020(https://arxiv.org/html/2606.07103#bib.bib2);Niven和Kao, 2019(https://arxiv.org/html/2606.07103#bib.bib5))可能表现良好,但未能学习到跨内容泛化的风格特征。 先前的工作表明,NLP模型可能依赖数据中意想不到的相关性,包括一般情况下的捷径学习(Geirhos等人, 2020(https://arxiv.org/html/2606.07103#bib.bib2);McCoy等人, 2019(https://arxiv.org/html/2606.07103#bib.bib6);Zhou等人, 2024(https://arxiv.org/html/2606.07103#bib.bib13))以及风格相关任务中基于主题的捷径(Altakrori等人, 2021(https://arxiv.org/html/2606.07103#bib.bib3))。探测研究进一步检验了学习到的表示捕获了哪些信息(Niven和Kao, 2019(https://arxiv.org/html/2606.07103#bib.bib5);Conneau等人, 2018(https://arxiv.org/html/2606.07103#bib.bib10))。现有评估可以揭示捷径行为,但它们通常不控制内容捷径的强度。因此,模型何时从内容线索转向与内容无关的风格表示学习仍不清楚。 为解决这一空白,我们研究受控内容重叠下的风格分类。评估基于平行文本构建,其中相同的内容可以用不同风格表达,同时跨风格标签共享的内容量被系统性地变化。我们使用重叠参数α=1−I(C;S)/H(S)来控制这种变化,其中C是内容身份,S是风格标签。该参数衡量不同风格类别之间共享内容的程度,并且与风格类别的数量无关。当α=0时,每种风格关联不同的内容,因此仅凭内容即可预测风格标签。当α=1时,所有风格共享相同的内容,因此内容不再提供标签信息。英文圣经译本(Carlson等人, 2018(https://arxiv.org/html/2606.07103#bib.bib4);Christodouloupoulos和Steedman, 2015(https://arxiv.org/html/2606.07103#bib.bib15))为此设置提供了一个对齐的测试平台,共享内容以多种风格变体形式呈现。 我们的贡献有三点。首先,我们引入一种基于信息的受控内容重叠度量α,它可以量化内容捷径的强度,且与风格类别数量无关。其次,我们引入交叉重叠评估,并表明匹配的准确率可能隐藏内容捷径:低重叠模型在匹配条件下表现良好,但当内容线索不再具有预测性时性能急剧下降,而高重叠训练导致更稳定的迁移。第三,我们引入跨风格内容检索探测,表明随着α增加,内容身份变得较难恢复,并且这种变化在训练过程中逐步发生。代码可在https://github.com/joeliuz6/content_overlap_eval获取。 ## 2 评估设置 ### 2.1 任务与数据结构 我们考虑一个平行语料库,其中相同的内容(由分块ID c索引)以k种不同的风格版本出现。每个数据点是一个三元组(x, s, c):文本x、风格标签s ∈ {1, ..., k}以及分块ID c。风格分类器以x为输入并预测s。当不同风格在训练时看到不同的分块时,就会出现内容捷径。 ### 2.2 受控重叠采样 我们使用基于信息的参数定义内容重叠: α = 1 − I(C;S) / H(S), (1) 其中C表示分块身份,S表示风格标签。该参数衡量风格信息中无法由内容身份解释的部分。当α=0时,内容身份完全决定风格标签;当α=1时,内容身份不提供关于风格标签的任何信息。 我们使用一种简单的采样方法来构建具有目标α值的数据集。给定k个风格版本和所有版本中均可用的C个分块池,我们设置每个版本的分块数为n = ⌊C/k⌋。每个版本的分块来自两个池: - 共享池(n_p = ⌊nα⌋ 分块):所有版本中都包含的分块。 - 独占池(n_r = n − n_p 分块):仅分配给一个版本的分块。 这种采样策略实现了目标信息量重叠。直观地,共享分块不能预测风格标签,而独占分块完全预测它。在此采样下,条件熵为H(S|C) = α log₂ k,因此I(C;S) = (1−α) log₂ k。将其代入公式1即可恢复目标值α,且与风格类别数量无关。完整推导见附录A(https://arxiv.org/html/2606.07103#A1)。 表1:交叉评估测试准确率(%),k=2。行:α_train;列:α_eval。粗体:匹配条件。结果报告为三个随机种子的均值±标准差。k=3,4,5的结果以表2(https://arxiv.org/html/2606.07103#A1.T2)形式见附录。 参见图注:高重叠优势Δ_HOA ±标准差(公式2,https://arxiv.org/html/2606.07103#S2.E2),针对所有训练和评估重叠对,k ∈ {2,3,4,5}。每个单元格显示高重叠模型相对于低重叠模型的准确率增益。 ### 2.3 交叉重叠评估 我们使用交叉重叠评估来衡量当内容-风格关联发生变化时,学习到的风格特征迁移的效果。我们为每个训练重叠水平α_train训练一个带有MLP分类头的RoBERTa-large(Liu等人, 2019(https://arxiv.org/html/2606.07103#bib.bib7))分类器,微调所有模型参数,然后在每个重叠水平α_eval的数据集上进行评估。 原始交叉重叠准确率在不同α_eval值之间不能直接比较,因为评估重叠水平可能具有不同的难度。因此,我们在相同的重叠偏移下比较模型。对于α_i < α_j,我们比较在α_j训练并在α_i测试的模型,与在α_i训练并在α_j测试的模型。这隔离了训练重叠的影响,我们将其衡量为“高重叠优势”: Δ_HOA(α_i, α_j) = Acc(α_train=α_j, α_eval=α_i) − Acc(α_train=α_i, α_eval=α_j), (2) 对于α_i < α_j。正的Δ_HOA(α_i, α_j)表明,在相同偏移下,使用更高重叠训练的模型迁移得更好。例如,Δ_HOA(0.0, 1.0)比较了在α_eval=0.0评估的α_train=1.0模型与在α_eval=1.0评估的α_train=0.0模型;正值意味着高重叠模型向下泛化优于低重叠模型向上泛化。 ### 2.4 跨风格内容检索探测 为衡量学习到的表示中保留了多少内容信息,我们引入一种“跨风格内容检索探测”。我们的风格分类器使用带有MLP分类头的RoBERTa-large。来自RoBERTa的[CLS]表示被传入MLP头,我们使用来自该MLP头的中间表示h进行探测。对于每个训练好的风格分类器,我们冻结模型并提取中间表示h。然后,我们训练轻量级线性投影器,将来自两种风格的表示映射到共享嵌入空间。投影器使用CLIP风格的对比损失(Radford等人, 2021(https://arxiv.org/html/2606.07103#bib.bib8))进行训练,其中来自相同分块但不同版本的配对表示被拉近,非配对表示被推远。因此,该探测衡量在线性投影后内容是否线性可恢复。 我们使用与论文(Radford等人, 2021(https://arxiv.org/html/2606.07103#bib.bib8))中相同的基于余弦相似度的top-1双向检索准确率来评估内容可恢复性。给定来自一种风格的分块表示,探测从另一种风格中检索其最近邻;如果检索到的文本具有相同分块ID,则预测正确。高检索准确率表明分块身份在表示中仍然可恢复。除了探测完全训练好的模型外,我们还在分类器训练的不同时期应用相同的探测,从而允许我们跟踪内容可恢复性如何变化。探测的完整细节见附录B(https://arxiv.org/html/2606.07103#A2)。 ## 3 实验设置 ### 3.1 数据 我们使用七种英文圣经译本作为平行语料库。每个译本被分割成连续经文的对齐分块。对于分类,我们使用五个译本的子集,得到风格类别设置k ∈ {2,3,4,5}。另外两个译本仅保留用于未见过的跨风格内容检索探测。完整的数据集统计信息和处理细节见附录C(https://arxiv.org/html/2606.07103#A3)。 ### 3.2 实现细节 我们在六个重叠水平上微调所有RoBERTa-large(Liu等人, 2019(https://arxiv.org/html/2606.07103#bib.bib7))参数,从α=0.0到α=1.0,步长为0.2。主要结果在三个随机种子上取平均值。完整细节见附录D(https://arxiv.org/html/2606.07103#A4)。 ## 4 结果 我们呈现三种互补的分析:交叉重叠评估测试当内容-风格关联变化时准确率是否迁移,检索探测衡量内容是否仍然可恢复,训练动态显示这种内容信息何时被移除。 ### 4.1 高重叠训练改善交叉重叠风格迁移 表1(https://arxiv.org/html/2606.07103#S2.T1)展示了k=2的交叉重叠评估矩阵。对于所有训练重叠,对角线项都很高,但仅匹配准确率可能具有误导性。例如,在α_train=0.0训练的模型在匹配评估下达到94.9%,但当在α_eval=1.0评估时下降到55.3%。这表明低重叠训练鼓励内容捷径:当评估时移除内容线索,性能崩溃。相比之下,在α_train=1.0训练的模型在所有α_eval值(85–88%)上保持稳定。由于训练时内容完全共享,内容身份不再预测风格标签,迫使模型更依赖风格特征。该模式在不同类别数量下均成立,如附录中表2(https://arxiv.org/html/2606.07103#A1.T2)所示。 参见图注 (a) 已见过的版本 参见图注 (b) 未见过的新版本 图2:跨风格内容检索探测准确率与训练重叠α的关系,不同k值。阴影区域表示三个随机种子的标准差。 图1(https://arxiv.org/html/2606.07103#S2.F1)可视化了公式2(https://arxiv.org/html/2606.07103#S2.E2)中每个k的高重叠优势。几乎所有项都是正的,表明高重叠训练始终产生迁移性更好的表示。这种优势在统计上是可靠的:对所有非对角线对进行的单侧配对t检验拒绝了无方向优势的原假设(对所有k,p < 0.001),效应量较大(Cohen's d > 1.1),且超过88%的对偏向高重叠模型(附录E(https://arxiv.org/html/2606.07103#A5))。 ### 4.2 内容随重叠增加而减少 内容检索探测衡量学习到的表示中保留了多少内容信息。图2(https://arxiv.org/html/2606.07103#S4.F2)报告了在不同重叠水平α训练的各类器上的top-1检索准确率。对于检索评估,我们使用完全共享设置(α=1.0)。因此,风格分类器的训练重叠从α=0.0到α=1.0变化,而检索探测在共享内容对上进行评估。 对于所有k,检索准确率随着α增加单调下降。在α=0时,检索准确率
相似文章
韩语27B语言模型中响应风格对齐的脱靶效应
本研究探讨了韩语27B语言模型中响应风格对齐的脱靶效应,发现针对风格的后训练显著影响了回答倾向和披露率,而没有针对安全性或能力。
轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。
语料库特征分析与逆向宪法微调用于风格感知放射学报告
本文提出一种方法,利用语料库特征分析和逆向宪法微调来提升AI生成放射学报告与真实放射科医生写作风格的对齐度。该方法在文本对齐指标上取得显著改进,验证了其在风格感知报告生成中的有效性。
FreeStyle:基于社区LoRA挖掘的风格-内容双参考生成的自由控制
FreeStyle提出了一种可扩展的双参考生成框架,利用社区LoRA挖掘构建大规模风格-内容三元组,并采用解耦机制防止内容泄露,同时引入了一个全面的基准用于评估。
STEB:风格文本嵌入基准
介绍风格文本嵌入基准(STEB),这是一个全面的开源基准,用于标准化跨96个数据集和7种语言的风格嵌入评估,研究发现语义嵌入在风格任务中表现不佳。