CHiPS:面向罗马尼亚语文本的基于字符直方图与位置信号的轻量级作者归属方法

arXiv cs.CL 论文

摘要

提出CHiPS,一种轻量级的字符级作者归属方法,适用于罗马尼亚语文本,采用字符直方图和位置信号,无需分词或预训练语言模型,在封闭集基准测试中达到0.9310准确率。

arXiv:2607.22884v1 公告类型:新 摘要:我们提出CHiPS,一种面向罗马尼亚语文本的轻量级字符级作者归属方法。所有报告实验均为封闭集:真实作者为训练数据中的候选作者之一。CHiPS研究写作风格的两个互补指纹:CH-SVM(基于单字符边际分布的字符直方图分类器)和FFT12-LR(位置信号分类器,将选定字符和标点类别表示为脉冲序列(字符位置上的二值指示序列),并提取傅里叶/韦尔奇谱描述符)。我们还报告了CHiPS-F(一种防止泄露的决策级融合变体)以及可选的top-5列表级重排序器(仅在折外预测上训练)。该方法无需分词、句法分析、预训练语言模型或transformer微调,且在直方图组件中避免使用n≥2的字符n-gram特征。在包含10位作者、392个源文本文档组、共400个文件的锁定分组ROST划分上,采用源文本级评估和分组五折模型选择,CHiPS-F达到0.9310准确率和0.9341宏F1。一个匹配但无限制的字符2-5元组TF-IDF SVM比较器在相同的留出分组上达到1.0000准确率和宏F1,因此本文并非声称达到最佳分类准确率。相反,实验旨在探究在严格防泄露控制下,受限且透明的字符证据能走多远。在ROSTories-cleaned(一个与ROST重叠的二级语料库,包含19位作者、1,240个源文本文档组、共1,248个文件)上,相同协议下CHiPS-R获得0.8919准确率和0.8708宏F1。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# CHiPS:面向罗马尼亚文本的轻量级作者身份归因方法:字符直方图与位置信号

来源:https://arxiv.org/html/2607.22884
Sanda\-Maria Avram¹ ¹罗马尼亚克卢日-纳波卡,巴比什-博雅依大学计算机科学学院,数学与计算机科学系 邮箱:sanda\.avram@ubbcluj\.ro & George C\. Ţurcaş² ²罗马尼亚克卢日-纳波卡,巴比什-博雅依大学数学与计算机科学学院,数学系 邮箱:george\.turcas@ubbcluj\.ro

###### 摘要

我们提出 CHiPS,一种针对罗马尼亚文本的轻量级字符级作者身份归因方法。所有报告实验均为封闭集:真实作者是训练数据中的候选作者之一。CHiPS 研究了写作风格的两种互补指纹:CH-SVM,一种基于单字符边际分布的字符直方图分类器;以及 FFT12-LR,一种位置信号分类器,将选定的字符和标点符号类别表示为脉冲序列(字符位置上的二元指示序列)并提取傅里叶/韦尔奇频谱描述符。我们还报告了 CHiPS-F,一种安全的决策级融合变体,以及一个可选的 top-5 列表重排序器,该重排序器仅基于折叠外预测进行训练。该方法不需要分词、句法分析、预训练语言模型或 Transformer 微调,并且在直方图组件中避免了 n≥2 的字符 n 元语法特征。在一个锁定的分组 ROST 划分上(包含来自 392 个源文本组的 400 个文件,由 10 位作者撰写,进行源文本级评估和分组五折模型选择),CHiPS-F 达到了 0.9310 的准确率和 0.9341 的宏 F1。一个匹配但不受限制的字符 2–5 元语法 TF–IDF SVM 比较器在相同的保留组上达到了 1.0000 的准确率和宏 F1,因此本文的贡献并非声称达到最佳分类准确率。相反,实验探究了在严格泄露控制下,受限、透明的字符证据能走多远。在 ROSTories-cleaned(一个次要的与 ROST 重叠的语料库,包含来自 1,240 个源文本组的 1,248 个文件,由 19 位作者撰写)上,相同协议下 CHiPS-R 达到了 0.8919 的准确率和 0.8708 的宏 F1。

*关*键词作者身份归因;罗马尼亚语自然语言处理;文体计量学;字符级建模;低资源语言

## 1 引言

作者身份归因是自然语言处理和计算文体计量学中一个长期存在的问题。给定一篇来源未知或有争议的文本,任务是从候选作者集合中识别出最可能的作者。本文研究封闭集设定,即假定正确作者在候选作者之中。该问题在数字人文学、司法语言学、剽窃调查、文学史以及数字文本集合组织等方面仍然具有实际意义。与英语相比,罗马尼亚语的标准化公共基准和自然语言处理资源较少,而体裁和时期变化可能很大。这促使我们探索那些无需依赖大型语言特定预处理流水线即可训练和检查的归因方法,正如 Stamatatos (2009) ; Koppel 等人 (2009) ; He 等人 (2024) ; Avram 和 Oltean (2022) ; Avram (2025) ; Niţu 和 Dăscalu (2024) 所研究的那样。字符级归因在此有一个有用的先例:早期工作表明字符 n 元语法模型可以支持语言无关的作者身份归因,且几乎不需要特定语言的预处理 (Peng 等人,2003)。

近期关于罗马尼亚语作者身份归因的工作探索了传统机器学习特征和基于 Transformer 的模型 (Avram 和 Oltean, 2022; Avram, 2025; Niţu 和 Dăscalu, 2024)。这些方法很有价值,但也提出了一个方法论问题:

**字符级证据中已经包含了多少作者信号?**

本文介绍了 CHiPS,一个基于全局字符频率指纹和位置字符信号的字符级分类器家族。该方法不依赖于分词、词性标注、句法分析、上下文嵌入、预训练语言模型或神经微调。这种简单性使其透明、可重复,并且可移植到其他低资源语言。

核心假设是,作者可能会在字符的分布和位置上留下稳定的痕迹。这些痕迹包括拼写、标点、变音符号使用、间距、大小写和字符流方面的具体习惯。有些可能还反映了节奏、句子结构、在字符级可见的词汇偏好,或编辑惯例。字符级证据具有吸引力,因为它位于显式主题选择之下,并且不需要语言标注。可以认为,词汇通常是意识层面的,而字符使用模式则大多是无意识的 (Stamatatos, 2009)。与通常更依赖主题且更容易被有意操纵的词汇选择不同,字符分布反映了与正字法、标点、间距、形态学和节奏性文本组织相关的稳定文体习惯 (Sapkota 等人,2015; Stamatatos, 2009)。与字符 n 元语法方法不同,CHiPS 不依赖于连续的字符子序列。其直方图组件仅使用单字符边际频率,而其位置组件将选定的字符和字符类别视为文本位置上的稀疏信号。所有特征均来自归一化后的原始字符。

本文的贡献如下:

1. (i) 一种针对罗马尼亚语作者身份归因的、关注信息泄露的字符级评估协议,在该协议中,来自同一源文本的所有片段在训练、验证和保留测试分区中共同保持;
2. (ii) CH-SVM,一种透明的字符直方图分类器,仅使用单字符边际频率和少量全局字符统计量;
3. (iii) FFT12-LR,一种位置信号分类器,将选定的字符类别映射到脉冲序列,并使用傅里叶/韦尔奇频谱描述符对其进行总结;
4. (iv) CHiPS-F,一种决策级融合策略,结合了分布性和位置性字符证据,在直方图组件中不使用词特征、嵌入或长度 n≥2 的字符 n 元语法;
5. (v) CHiPS-R,一种防泄露的 top-5 列表重排序层,仅使用折叠外训练/验证基础模型预测对合理候选作者进行重排序,并作为消融实验报告,除非其在预设协议下改善了保留集行为;
6. (vi) 一个锁定的 ROST 评估,包含源文本分组、基于训练/验证数据的分组五折模型选择以及保留测试报告,外加一个次要的 ROSTories-cleaned 评估,由于更广泛的语料库包含重叠的 ROST 材料,因此将其分开进行。

## 2 相关工作

### 2.1 作者身份归因与文体计量学

作者身份归因在计算文体计量学中有着悠久的传统,方法从手动选择的风格标记到统计和机器学习分类器不等。Stamatatos (2009) 和 Koppel 等人 (2009) 的综述描述了主要的问题设定、特征家族和评估关注点,包括封闭集和开放集归因的区别。更近期的综述如 He 等人 (2024) 在当代神经模型和日益多样化的数字文本集合背景下重新审视了这些问题。

对于当前工作而言,重要的点是方法论而非历史:强大的归因系统通常依赖于易于提取且作者难以有意识控制的特征。字符分布是一个自然的例子。它们位于词汇选择和句法之下,却能编码标点习惯、拼写惯例、变音符号模式、间距以及反复出现的形态碎片。

### 2.2 字符级方法

字符级方法在作者身份归因中已得到充分确立。Peng 等人 (2003) 表明字符级 n 元语法语言模型可以支持语言无关的作者身份归因,而 Sapkota 等人 (2015) 则证明了不同类别的字符 n 元语法对作者区分有不同的贡献,其中类似词缀和标点的片段携带了大量信号。这些研究激发了低层次风格视角,该视角不需要语言标注,并且比依赖词元或句法的表示更容易跨语言迁移。

罗马尼亚语的研究也回归到字符和标点证据。Lupşa 等人 (2025) 考察了在 ROST 上对罗马尼亚文本使用字符 n 元语法的潜力,而 Lupşa 和 Lupşa (2025) 则研究了同一数据集上的词、词性、标点和封闭类 n 元语法特征。字符 n 元语法方法捕获局部序列模式,并已广泛应用于作者身份归因。CHiPS 使用了不同的限制:直方图组件特意只使用单字符边际分布,而位置结构则通过信号处理摘要而非连续 n 元语法计数来捕获。这将字符证据的贡献隔离在局部序列层次之下。

这个限制对于解释结果很重要。字符双元语法或三元语法特征可以编码短词素、词尾、功能词片段或重复的词汇材料。CH-SVM 故意避免使用这一证据来源,因为其直方图视角止步于 n=1。因此,CHiPS 中的任何序列信息都必须来自位置信号组件,而不是来自连续的字符序列。

### 2.3 罗马尼亚语作者身份归因

罗马尼亚语作者身份归因已使用经典方法和神经方法进行研究。Avram 和 Oltean (2022) 比较了几种针对罗马尼亚文本的 AI 技术,使用了选定的词性和类似功能词的特征家族,并引入了罗马尼亚语数据集资源。Avram (2025) 研究了基于 BERT 的 ROST 归因。Niţu 和 Dăscalu (2024) 提出了一种混合 Transformer 方法用于罗马尼亚语,结合了手工设计的语言特征和上下文嵌入。最近的 ROST 研究也表明,轻量级的字符和标点 n 元语法系统仍然具有竞争力 (Lupşa 等人,2025; Lupşa 和 Lupşa, 2025)。这些文献为评估 CHiPS 提供了直接背景。

这里的目标不是取代基于 Transformer 的系统或特征丰富的流水线。相反,目标是建立一个参数轻量且可解释的基线,该基线可以轻松训练和检查,包括在预训练语言模型、高质量分词器或句法工具不可用或不理想的情况下。

鉴于上述背景,与已发表的罗马尼亚语系统进行比较必须谨慎处理。先前的工作可能使用了不同的 ROST 版本、不同的文本粒度、不同的预处理或非分组划分。除非这些条件匹配,否则相关的比较是**上下文性的**:CHiPS 展示了透明字符级系统在当前防泄露协议下能达到的性能,而不是声称其普遍优于神经或特征丰富的系统。

### 2.4 文本作为信号

另一条独立的研究路线将文本视为信号。先前的工作将文本表示为有序的数字序列,并为作者身份归因提取时间序列或信号处理特征。例如,Tang 等人 (2020) 将词元属性映射到语言时间序列,并在一个比当前工作大得多的自动生成特征清单中包含了傅里叶域特征;Mayor 等人 (2023) 将此想法用于社交媒体分析,并展示了如何使用信号处理工具研究编码后的文本序列。CHiPS 在更狭窄的文体计量场景中使用了这种通用的表示思路:标点、空白、数字和变音符号被表示为字符位置上的稀疏通道。这使得无需句子解析或分词即可测量类似节奏的规律性。本文并非声称先前的文本作为信号的研究解决了作者身份归因问题;而是将信号视角作为一种轻量级描述位置结构的方法。

## 3 语料库与预处理

本研究使用了四个语料库角色:ROST 作为锁定的主要基准,ro-stories 公共发布版作为上下文诊断,ro-stories-AP-cleaned 作为 ro-stories 的清洗版本,以及 ROSTories-cleaned 作为次要的与 ROST 重叠的评估语料库。表 1 总结了它们的规模、分组划分、角色和可用性;以下子节描述了它们的来源和预处理方式。

### 3.1 ROST

在本研究中,ROST 被用作主要的罗马尼亚语作者身份归因基准。它已在罗马尼亚语作者身份归因工作中被使用 (Avram 和 Oltean, 2022; Lupşa 等人,2025; Lupşa 和 Lupşa, 2025),包括基于 Transformer 的实验 (Niţu 和 Dăscalu, 2024; Avram, 2025)。

此处使用的锁定 ROST 导出包含 400 个由 10 位作者撰写的标准化文本文件。这些文件对应 392 个源文本组(根据作者和基本标题对多部分作品进行分组后)。训练/验证/测试划分是在源文本组级别分配的,因此相关片段永远不会跨训练和评估划分。指标在同一源文本级别报告:当一个保留的源文本有多个文件时,它们的模型输出向量在计算最终标签前进行平均。

分组规则遵循发布的文件名解析器。文件名词干在第一个下划线处拆分为作者字段和标题字段。当存在时,形如 '-partDescriptionAsNumber' 或 '-partDescriptionAsString' 的后缀被移除;然后取第一个连字符之前的子串作为基本标题。具有相同作者-基本标题键的文件组成一个源文本组。发布的划分 JSON 记录了由此产生的文件到组的分配,并且一个组中的所有文件都保留在同一分区中。

### 3.2 扩展的罗马尼亚故事语料库

扩展的罗马尼亚故事语料库,由 Niţu 和 Dăscalu (2024) 引入

相似文章

转写德语视频的作者身份验证

arXiv cs.CL

本文研究了基于转写的德语视频的作者身份验证问题,在三个自建语料库上比较了传统的 n-gram 方法与基于 Transformer 的方法。传统的字符级和词元级 n-gram 方法优于现代 Transformer 方法,最高达到了 88% 的准确率和 90% 的 AUC。

面向威胁主体分析的日本网络评论作者归属基础研究

arXiv cs.CL

这是一项将风格学作者归属技术应用于威胁情报的基础研究。我们使用日本Rakuten的评论内容,对比了TF-IDF+LR、BERT嵌入、BERT微调以及度量学习方法。总体而言,BERT-FT的表现最佳;但在将任务扩展至数百位作者的场景时,TF-IDF+LR在稳定性与效率上展现出更大优势。

缓解英语到罗马尼亚语机器翻译中的性别偏见

arXiv cs.CL

本文提出了一种混合流水线,将基于微调LLaMA的性别分类与标签感知的神经机器翻译相结合,以缓解英语到罗马尼亚语机器翻译中的性别偏见,引入了新数据集,并在基准测试上将性别准确率提高了40多个百分点。