MultiGhostBench:面向分布偏移的多语言长文本LLM生成文本归因基准

arXiv cs.CL 论文

摘要

MultiGhostBench是一个多语言基准,用于评估分布偏移下长文本LLM生成文本的归因。它包含六种语言的928本书籍,并突出了性能下降以及没有单一方法在所有设置中始终最佳的现象。

arXiv:2609.02379v1 Announce Type: new 摘要: 尽管现有工作在LLM作者归因(AA)方面取得了进展,但可用的基准仍然有限,通常关注英语、受控设置或相对过时的模型,少数多语言研究仅考虑相对较短的文本。我们引入MultiGhostBench,这是一个多语言基准,包含由五个近期LLM生成的928本书籍,覆盖六种语言和三种脚本,平均每本书约59,000词。该基准支持在领域、作者和语言偏移下的评估。对代表性AA方法的评估显示,没有单一方法在所有设置中始终表现最佳,且性能在分布偏移下普遍下降。基于Transformer的检测器可以跨语言保留生成器相关信息,尽管迁移效果因语言对而异,而基于统计和指纹的检测器则更依赖语言。我们设想MultiGhostBench是开发和评估稳健AA方法的重要资源。数据集和代码可在https://github.com/GrecoMT/MultiGhostBench找到。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:53

# MultiGhostBench:面向分布偏移的多语言长文本LLM生成文本归因基准
来源:https://arxiv.org/html/2609.02379  
Matteo Greco、Anudeex Shetty、Andrea Tagarelli  
所属机构:意大利卡拉布里亚大学DIMES系  
Jey Han Lau  
邮箱:[[email protected], {anudeex, laujh}@unimelb.edu.au, [email protected]](mailto:)  
所属机构:澳大利亚墨尔本大学计算与信息系统学院  

###### 摘要  
尽管现有的LLM作者归因(AA)研究已取得进展,但可用的基准数据集仍存在局限——通常聚焦于英语、受控环境或相对过时的模型,少数多语言研究仅考虑较短文本。本文推出MultiGhostBench,一个包含928本书的多语言基准数据集,由五个近期LLM跨六种语言和三种文字系统生成,平均每本书约59k词。该基准支持在领域、作者和语言偏移下的评估。对代表性AA方法的评估表明,没有单一方法在所有设置中始终表现最佳,且性能通常随分布偏移而下降。基于Transformer的检测器能够跨语言保留生成器相关信息,尽管迁移效果因语言对而异,而基于统计和指纹的检测器则更依赖语言。我们期望MultiGhostBench成为开发和评估鲁棒AA方法的重要资源。1 ¹脚注:数据集和代码可在 https://github.com/GrecoMT/MultiGhostBench 获取。  
\*\*脚注:贡献均等。  

## 1 引言  
大型语言模型(LLMs)现在能够跨多种语言生成高质量文本(Qin et al., 2024;Yue et al., 2025),其流畅度和连贯性已达到与人类撰写内容相当的水平(Jakesch et al., 2023)。这些进步为沟通、创作和生产力创造了新的机会(Ahuja et al., 2023;Doddapaneni et al., 2025)。然而,它们也引发了关于透明度、问责制、滥用以及数字内容真实性的担忧(Brundage et al., 2024;Rudolph et al., 2023;Russell et al., 2026)。这些风险促使我们有必要开发鲁棒的方法来检测和归因LLM生成的文本(Huang et al., 2025;Wu et al., 2025)。尽管先前的研究已探索了LLM生成文本的检测,并引入了大量数据集,但仍存在若干局限性,如表1所述。首先,大多数研究将检测建模为人类与AI的二元问题(He et al., 2024;Dugan et al., 2024;Thai et al., 2026),而只有少数研究着手更具挑战性的作者归因(AA)任务(Uchendu et al., 2021;La Cava and Tagarelli, 2025;Shetty et al., 2026),其目标是识别生成特定文本的特定LLM。其次,现有数据集主要关注短文本(Macko et al., 2025;Macko et al., 2023),尽管LLM代笔书籍已开始出现(Australian Society of Authors, 2025)。即使是最近的长文本研究,如Shetty et al.(2026),也仅限于英语或少数几种语言(Dugan et al., 2024;Tao et al., 2024)。第三,方法很少在多种分布偏移下进行评估,特别是跨语言迁移或向未见过的生成器和领域的泛化。本文中,我们推出了MultiGhostBench,一个用于LLM AA的多语言基准,用于评估在领域、生成器和语言偏移下的泛化能力。据我们所知,MultiGhostBench是首个旨在联合评估多语言长文本LLM AA在多种分布偏移下的基准。总结而言,我们的主要贡献如下:  
- • 我们引入MultiGhostBench,包含由五个近期LLM生成的928本书(平均59k词)。它涵盖六种语言和三种文字系统,旨在评估AA在跨语言、领域和生成器偏移下的表现。  
- • 我们对统计、监督和基于指纹的归因检测器进行了全面评估,发现没有一种方法在不同语言、数据制度和分布偏移下始终表现最佳。  
- • 我们的分析表明,基于Transformer的检测器能够跨语言保留生成器相关信息,尽管这种迁移的程度因语言对而异,而基于统计和指纹的方法则更受语言影响。  

## 2 相关工作  
#### 作者归因。关于LLM生成文本的研究主要集中在二元检测(Mitchell et al., 2023;Yang et al., 2024;Thai et al., 2026),只有少数研究(Uchendu et al., 2021;La Cava and Tagarelli, 2025;Shetty et al., 2026)研究AA任务,其目标是识别生成文本的具体LLM。然而,这些研究主要基于监督方法,泛化能力有限。Shetty et al.(2026)研究了长文本及其在领域和未见过的生成器偏移下的鲁棒性,但他们的研究仅限于英语。他们还开发了一种轻量级的基于指纹的方法trace用于AA任务。  
#### 多语言作者归因。类似地,关于多语言LLM生成文本的研究主要集中在二元检测(Wu et al., 2026;Macko and Kopál, 2026;Wang et al., 2024)而非归因。MULTITuDE(Macko et al., 2023)评估了跨语言归因性能,但其评估并不全面,因为它没有涵盖数据集中的所有语言。同样,M4GT-Bench(Wang et al., 2024)中的归因实验侧重于跨领域而非跨语言泛化。最近,La Cava et al.(2026)使用MULTITuDE和MultiSocial对多语言归因进行了系统研究。然而,他们的主要设置基于短新闻文章。这忽略了涉及未见过的生成器以及跨多个维度的联合评估的实际场景,我们将在本文中进行总结,如表1所示。  
表1:现有LLM生成文本归因数据集概览。‘Rec.’表示基准是否包含近期高能力LLM;先前基准包含小规模模型(<<10B参数)。‘D’、‘A’和‘L’分别表示分布外领域、分布外作者和分布外语言。‘Long?’表示文档长度是否超过10k词。  

## 3 数据集  
我们提出的MultiGhostBench是一个由五个近期LLM(gemini-pro、gemini-flash、deepseek-v3.2、qwen3-235b和gpt-oss;更多细节见附录表4)生成的多语言长文本数据集,涵盖六种语言,支持在领域、作者和语言偏移下的AA。我们数据集的一个独特之处是其语言偏移设置,它能够评估在一种语言上训练的AA方法能否泛化到先前未见过的语言文本。  
### 3.1 语言选择  
MultiGhostBench涵盖六种语言:意大利语(IT)、西班牙语(ES)、德语(DE)、英语(EN)、中文(ZH)和俄语(RU)。这些语言代表了四个语系:罗曼语族(IT和ES)、日耳曼语族(DE和EN)、汉藏语系(ZH)和斯拉夫语族(RU)。它们还覆盖了多种文字系统,包括拉丁字母、汉字和西里尔字母,以及语言特定的正字法规范。这种选择使得在紧密相关和更疏远的语言及文字系统偏移下评估AA成为可能。  
### 3.2 多语言书籍生成流程  
人类书籍写作通常是层次化的:作者通常通过多个阶段来创作一本书,如规划、起草和修订(Sun et al., 2022;Lee et al., 2025)。我们遵循Shetty et al.(2026)引入的生成过程,该过程模拟了这一多阶段写作过程以创建LLM生成的书籍。书籍生成流程从定义一组约束开始,例如体裁和时间段。这些约束来源于Project Gutenberg2,这是一个在线免费电子图书馆;体裁列表见附录表3,包含小说和非小说体裁。一本Gutenberg书籍通常是多体裁的(例如LF(文学与小说)+HB(历史与传记)),因此MultiGhostBench中的书籍也是多体裁的。每本书通过迭代生成后续片段来扩展,每个片段的生成都以大纲、前一片段和叙事的滚动摘要(即每次生成后更新)为条件。这种结构使模型能够在生成超过单次生成步长的文本时保持全局连贯性。我们通过将Shetty et al.(2026)的原始提示模板翻译成每种目标语言,以适应多语言设置。翻译由各自的母语志愿者验证;提示可在附录A.1中找到。我们在附录表4和表7中分别提供了五个LLM的模型细节和这些LLM生成书籍的定量统计数据。所有书籍均使用上述相同的流程一致生成,以最大程度减少流程特定的偏差。然而,一些LLM特定的生成偏差不可避免,我们试图通过细致的数据清洗(§3.4)和分析(§3.5)来减少这种偏差。  
表2:MultiGhostBench统计信息:每种语言的训练集、开发集和测试集书籍数量,以及平均书籍长度(以词计)。详细的每LLM分布见附录表5。  
### 3.3 分布外维度  
遵循Shetty et al.(2026),MultiGhostBench支持两个分布外评估维度:OOD-Domain,衡量向未见过体裁的泛化能力;OOD-Author,衡量向未见过的生成器的泛化能力。我们进一步引入了OOD-Language,评估AA方法能否迁移到训练期间未观察到的语言文本。在OOD-Domain中,体裁被划分为每个生成器LLM的ID和OOD子集,确保没有体裁同时出现在两个子集中。请记住,这些体裁来源于Gutenberg语料库,包含小说和非小说体裁。不同LLM的ID和OOD-Domain体裁的完整统计信息见附录表5。在OOD-Author中,我们采用留一生成器法:每次留出一个LLM,方法在其余LLM上训练,并在由留出模型生成的书籍上进行评估。在OOD-Language中,方法在一种源语言上训练,在不同的目标语言上评估。我们不将OOD-Language与OOD-Domain结合,以便评估能够孤立语言偏移的影响,而不是将其与体裁偏移混为一谈。  
### 3.4 数据清洗  
我们清洗生成的文本,以移除生成和编码伪影,同时保留语言特定的特征。无效的控制字符、标记和非文本符号被移除,而格式元素被标准化,同时保留语言特定的标点、变音符号和非拉丁文字。遵循Shetty et al.(2026),我们从每本书的开头和结尾各移除1.5k个标记,以减少来自标识符标记(如作者姓名、书名或出版年份)的捷径线索。作为最终的完整性检查,我们使用GlotLID(Kargaran et al., 2023),一个开源的语言识别模型,来验证每本生成的书籍是否以其预期的目标语言撰写;MultiGhostBench中的所有书籍都与其预期目标语言匹配。  
### 3.5 数据探索  
表2显示了MultiGhostBench的汇总统计信息,包括不同分割中每种语言的书籍数量。为了提供跨语言的文档长度一致估计,我们使用特定语言的分词器(见附录表6)对每本书进行分词,并使用标准的1.5标记/词转换将标记计数转换为近似词数。  
#### 定量分析。生成的书籍使用附录表7中的多种定量文本指标进行分析。我们计算困惑度(PPL)作为文本可预测性的基于模型的度量(Jurafsky and Martin, 2026),以及用于词汇重叠和多样性的n-gram度量(Self-BLEU(S-B)、自重复(Self-R)和n-gram多样性(NGD))(Zhu et al.

相似文章

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。