当写作风格漂移时:基于题材、时间与AI时代分布偏移的作者验证基准评测

arXiv cs.CL 论文

摘要

本文介绍了AVShift,这是首个针对题材、时间和AI时代分布偏移下的作者验证的德语基准测试。它评估了基于特征、基于嵌入和基于LLM的方法,发现时间偏移显著影响性能,而未检测到可衡量的AI时代偏移。

arXiv:2608.17979v1 Announce Type: new 摘要:作者验证(AV)假设作者的写作风格足够稳定,可以与其他作者区分开来。然而在实践中,这一假设受到由题材、时间和AI辅助写作变化引起的分布偏移的挑战。现有的AV基准测试通常孤立地研究这些因素,并主要关注英语,限制了我们对模型在现实条件下鲁棒性的理解。我们引入AVShift,这是首个系统评估多重分布偏移下AV的德语基准测试。AVShift包含超过15万对文本,跨越三个题材和21年,使得在统一框架内对跨题材、时间和AI时代偏移进行受控评估成为可能。我们对代表性的基于特征、基于嵌入和基于LLM的方法进行了基准测试。我们的实验表明,微调的LLM在跨题材上泛化能力最佳,并从风格多样的训练数据中显著受益。我们进一步证明,时间偏移是影响AV的最强因素之一,随着文档间时间间隔的增加,性能显著下降。相反,在AVShift内未发现可衡量的AI时代分布偏移的证据。最后,我们的特征分析揭示了跨题材保持稳定的风格特征,但其相对重要性取决于具体的题材过渡。我们发布了AVShift和我们的代码以供未来研究。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:11

# 当写作风格发生漂移:评估流派、时间与AI时代分布偏移下的作者验证基准
来源:https://arxiv.org/html/2608.17979
作者:Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger
所属机构:lotta\.kiefer@utn\.de, steffen\.eger@utn\.de

###### 摘要
作者验证(AV)的前提是,作者的写作风格应保持足够稳定,从而能够与其他作者的风格区分开来。然而在实践中,这一假设因流派变化、时间推移以及AI辅助写作引起的分布偏移而受到挑战。现有的AV基准测试通常孤立地研究这些因素,且主要集中在英语上,这限制了我们对模型在现实条件下鲁棒性的理解。我们推出了AVShift——首个用于系统性评估多重分布偏移下AV性能的德语基准测试集。AVShift包含超过15万个文本对,涵盖三个流派和21年的时间跨度,使得在统一框架内对跨流派、跨时间以及AI时代的偏移进行可控评估成为可能。我们对代表性的基于特征、基于嵌入以及基于大语言模型的方法进行了基准测试。实验表明,经过微调的大语言模型在跨流派泛化方面表现最佳,并且从风格多样的训练数据中显著获益。我们进一步证明,时间漂移是影响AV的最强因素之一,随着时间间隔的增加,模型性能显著下降。相反,在AVShift中,我们未发现存在可衡量的AI时代分布偏移的证据。最后,我们的特征分析揭示了跨流派保持稳定的风格特征,但其相对重要性因具体的流派转换而异。我们已开源AVShift及我们的代码,以供未来研究。

## 1 引言
> 参见图例 图1:AVShift涵盖的风格性分布偏移概览:跨流派差异、时间演变以及生成式AI普及前后的AI时代变化。

作者分析旨在基于个人语言使用的特征模式(通常称为*个人语域*(9 (https://arxiv.org/html/2608.17979#bib.bib20); 35 (https://arxiv.org/html/2608.17979#bib.bib21)))来识别文本的作者。大量涵盖书籍、博客、新闻、电子邮件、评论、社交媒体和暗网论坛的基准数据集,已将作者分析确立为文学研究、剽窃检测和法庭语言学中的重要工具(51 (https://arxiv.org/html/2608.17979#bib.bib35); 5 (https://arxiv.org/html/2608.17979#bib.bib36); 30 (https://arxiv.org/html/2608.17979#bib.bib22); 32 (https://arxiv.org/html/2608.17979#bib.bib23); 38 (https://arxiv.org/html/2608.17979#bib.bib8); 48 (https://arxiv.org/html/2608.17979#bib.bib14))。

本文重点关注作者验证(AV),即判断两篇文本是否由同一作者撰写。与依赖预定义候选作者集的作者归属不同,AV能自然地泛化到以前未见过的作者,无需重新训练,这使其在涉及新嫌疑人的法证调查中特别具有吸引力。

语言独特性的概念有时被描述为“语言指纹”(27 (https://arxiv.org/html/2608.17979#bib.bib25); 10 (https://arxiv.org/html/2608.17979#bib.bib24))。然而,这种类比可能具有误导性,会错误地让人觉得写作风格像生物指纹一样是固定不变的(9 (https://arxiv.org/html/2608.17979#bib.bib20); 35 (https://arxiv.org/html/2608.17979#bib.bib21))。相反,语言风格受众多情境因素影响,包括目标受众、主题、交际情境、媒介,并且会随时间演变。因此,我们认为AV本质上是一个暴露于分布偏移的学习问题。

在实践中,训练数据和测试数据,以及配对的文本本身,都可能在流派、时间或更广泛的语言使用上存在差异。现有基准测试通常孤立地研究这些挑战,且主要集中在英语上。然而,AV依赖于特定语言的风格线索,这使得在英语上获得的发现是否能推广到其他语言尚不明确。这种缺乏多样化基准的情况,限制了我们对跨语言、现实条件下AV鲁棒性的理解。

为弥补这一空白,我们推出了**AVShift**——首个用于系统性评估关键分布偏移下AV性能的德语基准测试集,包括:(1) 跨论坛帖子、评论和同人小说的**跨流派偏移**,(2) 横跨二十多年写作的**时间偏移**,以及 (3) 生成式AI(genAI)写作助手普及前后的**AI时代偏移**。图1(https://arxiv.org/html/2608.17979#S1.F1)概述了这些评估设置。

我们的主要贡献如下:
- • 我们推出了AVShift,首个包含超过15万个文本对的德语基准测试集,用于评估跨流派、跨时间和AI时代分布偏移下的AV性能。
- • 我们在所有基准设置中,比较了基于特征、基于嵌入和基于大语言模型的方法。
- • 我们表明,验证性能在不同流派间存在显著差异,并且在混合领域数据上训练的大语言模型表现出强大的跨流派性能,F1值最高可达0.77。
- • 我们引入了一个特征稳定性分数,揭示了风格特征的鲁棒性强烈依赖于具体的流派对。
- • 我们表明,时间偏移会使验证性能显著下降,最高降低0.21 F1值;而在我们的基准测试中,未观察到显著的AI时代性能下降。

## 2 相关工作
### 作者分析方法
作者分析方法大致可分为基于特征、基于嵌入和基于大语言模型的方法。**基于特征**的方法使用手工设计的风格特征来表示文档,并通过相似度度量或统计或神经分类器进行比较。尽管由于其竞争力、效率和可解释性(49 (https://arxiv.org/html/2608.17979#bib.bib37); 16 (https://arxiv.org/html/2608.17979#bib.bib38)),这些方法仍具吸引力,但已被证明在性能上不及现代神经网络方法(58 (https://arxiv.org/html/2608.17979#bib.bib39))。

**基于嵌入**的方法通过特定任务的神经架构(17 (https://arxiv.org/html/2608.17979#bib.bib40); 40 (https://arxiv.org/html/2608.17979#bib.bib41); 4 (https://arxiv.org/html/2608.17979#bib.bib42))或从预训练Transformer模型中提取(45 (https://arxiv.org/html/2608.17979#bib.bib43); 31 (https://arxiv.org/html/2608.17979#bib.bib7); 12 (https://arxiv.org/html/2608.17979#bib.bib44)),直接从文本中学习密集的风格表示。

最近,**大语言模型**通过联合学习风格表示和验证任务,已成为作者分析的一种有前景的方法。尽管使用闭源模型(如GPT-3.5(36 (https://arxiv.org/html/2608.17979#bib.bib48))和GPT-4(37 (https://arxiv.org/html/2608.17979#bib.bib47)))进行零样本和少样本提示能达到有竞争力的性能,但它们对在线API的依赖限制了在法证和隐私敏感场景中的部署(23 (https://arxiv.org/html/2608.17979#bib.bib45); 42 (https://arxiv.org/html/2608.17979#bib.bib46))。最近的研究表明,经过微调的开源大语言模型在性能上优于基于提示的方法和先前的AV方法,同时仍可实际部署(22 (https://arxiv.org/html/2608.17979#bib.bib59); 42 (https://arxiv.org/html/2608.17979#bib.bib46); 25 (https://arxiv.org/html/2608.17979#bib.bib5))。

### 分布外评估
**跨领域AV**涵盖了数据来自不同分布的评估设置。这可能指训练和测试数据之间的领域迁移(45 (https://arxiv.org/html/2608.17979#bib.bib43)),或更挑战性的设置,即两篇被比较的文本来自不同的主题、流派或平台(38 (https://arxiv.org/html/2608.17979#bib.bib8); 31 (https://arxiv.org/html/2608.17979#bib.bib7))。虽然**跨主题AV**受到了相当多的关注,许多方法被提出以减少主题偏差(50 (https://arxiv.org/html/2608.17979#bib.bib10); 18 (https://arxiv.org/html/2608.17979#bib.bib3); 21 (https://arxiv.org/html/2608.17979#bib.bib15)),但跨平台和跨流派设置的研究相对不足。现有工作一致报告了在这些偏移下存在显著的性能下降(47 (https://arxiv.org/html/2608.17979#bib.bib13); 48 (https://arxiv.org/html/2608.17979#bib.bib14); 3 (https://arxiv.org/html/2608.17979#bib.bib1); 24 (https://arxiv.org/html/2608.17979#bib.bib4); 31 (https://arxiv.org/html/2608.17979#bib.bib7))。近期工作探讨了领域自适应的风格表示(59 (https://arxiv.org/html/2608.17979#bib.bib16)),以及使用困难负样本和跨领域正样本对进行训练(52 (https://arxiv.org/html/2608.17979#bib.bib11)),这些方法提高了鲁棒性,但并未完全消除某些领域偏移引起的性能下降。

**时间偏移**指的是作者写作风格随时间的变化,这引出了系统能在多大程度上跨越显著时间间隔识别作者的问题。尽管具有实际相关性,时间效应对AV的影响受到的关注有限。一项针对六位法国小说家的研究表明,性能可能随时间距离增加而下降(6 (https://arxiv.org/html/2608.17979#bib.bib2))。然而,作者数量少限制了其普适性,并且尚不清楚从文学文本中获得的发现是否能转移到其他领域(在这些领域,风格选择可能不那么刻意)。解决时间变异性的方法同样稀少。56 (https://arxiv.org/html/2608.17979#bib.bib12)通过主题漂移建模作者兴趣随时间的变化,而2 (https://arxiv.org/html/2608.17979#bib.bib17)估计了词汇风格的时间变化,并展示了对推文和电子邮件作者归属任务的改进。

**AI时代偏移**指的是由生成式AI写作辅助引入的风格变化。初步工作表明,AI辅助写作可能会增加作者之间的风格相似性,从而影响验证性能,特别是通过增加假阳性率(44 (https://arxiv.org/html/2608.17979#bib.bib9))。研究AI偏移仍然具有挑战性,因为人机协作形式多样,包括文本生成、修改和多轮交互(34 (https://arxiv.org/html/2608.17979#bib.bib18); 29 (https://arxiv.org/html/2608.17979#bib.bib19))。许多基准测试忽略了从AI时代采样的文档可能产生的影响。

### 多语言评估
尽管风格特征具有语言依赖性,但作者分析仍然主要集中在英语上。近期工作推出了能够跨语言迁移的多语言嵌入模型(41 (https://arxiv.org/html/2608.17979#bib.bib49); 26 (https://arxiv.org/html/2608.17979#bib.bib6)),以及若干多语言基准测试集(24 (https://arxiv.org/html/2608.17979#bib.bib4); 33 (https://arxiv.org/html/2608.17979#bib.bib50); 19 (https://arxiv.org/html/2608.17979#bib.bib51))。德语特定的基准测试集也已可用(5 (https://arxiv.org/html/2608.17979#bib.bib36); 25 (https://arxiv.org/html/2608.17979#bib.bib5)),但这些主要关注领域内或跨主题评估。据我们所知,尚无基准测试在多语言设置中系统性地结合不同的分布偏移。

总体而言,先前的工作在很大程度上孤立地研究了单个分布偏移,且主要基于英语数据集。AVShift通过提供首个德语基准测试集来弥补这一空白,该测试集在统一的评估框架内,系统性地评估了跨流派、时间和AI时代分布偏移下的AV性能。

## 3 数据策展
数据收集过程的目标是构建一个用于系统评估分布偏移下AV性能的德语语料库。在评估了几个候选来源后,我们选择了www\.fanfiktion\.de (https://www.fanfiktion.de/),该平台在一个站点内提供三种互补的写作环境:同人小说故事、评论和论坛帖子。这使我们能够在最小化平台特定干扰因素的同时,研究分布偏移。我们使用论坛版块,特别是“Allgemeines Geplauder”(“一般闲聊”)作为我们爬虫管道的入口点。使用BeautifulSoup(43 (https://arxiv.org/html/2608.17979#bib.bib26)),我们从论坛主题中提取作者个人资料链接,随后为每位作者收集所有可用的论坛帖子、评论和同人小说故事。这产生了三个对齐的语料库,包含来自相同作者、跨越两到三个流派的文本。

为了捕捉时间变异性,我们追溯了论坛档案中最早可获取的条目,直至2004年。最终的语料库跨越了21年(2004–2025年),既支持长期的时间分析,也支持对2022年11月ChatGPT(36 (https://arxiv.org/html/2608.17979#bib.bib48))公开发布前后撰写的文本进行比较。

### 预处理
我们移除了HTML标签,标准化了空白字符,并将所有URL替换为统一的占位符。德语的消息结束语连同后续内容被移除,通过模糊用户名匹配移除了剩余的自识别信息。为确保足够的风格内容,我们丢弃了少于50个单词的文本;同时,为降低计算成本,我们将超过3,000个单词的文本进行了截断。与之前的工作不同,我们有意保留了主题词汇,而是在配对构建过程中控制主题偏差效应。由于该网站仅托管德语内容,因此无需进行语言过滤。

### AVShift 基准测试集
AVShift 包含三个子基准测试集,用于评估互补的分布偏移:**GenreShift**、**TimeShift**和**AIShift**。我们将在附录A(https://arxiv.org/html/2608.17979#A1)中提供一个示例。

**GenreShift** 使用七个AV数据集评估跨流派泛化能力:三个领域内数据集(论坛、评论、故事),三个跨流派数据集(评论-论坛、故事-论坛、评论-故事),以及一个通过从其余六个数据集中均匀采样获得的混合数据集。作者在所有数据集中被均匀划分为80%的训练集、10%的验证集和10%的测试集,确保没有作者出现在多个划分中,从而允许跨数据集比较。每个故事样本由单个章节组成,每个评论和论坛样本各由一个帖子组成。为减少主题泄露,正样本对在特定流派约束下采样:故事对来自不同的同人小说作品,评论对评论不同的故事,论坛对来自不同的讨论主题。正样本对包含同一作者的文本,负样本对包含不同作者的文本。所有数据集类别平衡,并且我们每位作者最多采样五个正样本对和五个负样本对,以防止高度活跃的用户主导基准测试集。表1(https://arxiv.org/html/2608.17979#S3.T1)总结了最终的GenreShift数据集。

| 数据集 | 样本数 | 唯一帖子数 | 唯一用户数 | 平均样本长度(单词) |
| :--- | :--- | :--- | :--- | :--- |
| 论坛 | 15,272 | 16,516 | 2,104 | 173 |
| 评论 | 22,228 | 23,242 | 2,466 | 184 |
| 故事 | 40,320 | 59,007 | 4,627 | 1,358 |
| 评论-论坛 | 18,490 | 18,274 | 1,849 | 179 |
| 评论-故事 | 26,090 | 35,922 | 2,609 | 786 |
| 故事-论坛 | 32,580 | 37,233 | 3,258 | 787 |
| 混合 | 30,000 | 43,156 | 4,806 | 576 |

**表1**:统计比较:所有GenreShift数据集

**TimeShift** 评估对时间偏移的鲁棒性。我们构建了十个数据集切片,每个切片覆盖12个月的时间间隔,范围从0-12个月到108-120个月。所有文本对的采样使得两篇文本的发布日期之...

相似文章