越界言论:评估LLM训练数据中极端言论的普遍性与内容
摘要
本文评估了大语言模型训练数据中极端言论的普遍性,重点关注Dolma语料库,并讨论了对数据管理和模型安全的影响。
arXiv:2608.14813v1 Announce Type: new
摘要:尽管研究界对可信和安全AI的主题表现出浓厚兴趣,但大语言模型(LLMs)在预训练和后训练中遇到的文本语料库的组成尚未引起太多关注。在本文中,我们探讨了大语言模型是否暴露于未过滤、未提供上下文的极端言论。利用来自官方文件和研究文献的多种极端言论定义,以及结合自动化文本处理与专家验证的提取流程,我们为Dolma中极端文档的普遍性提供了下限估计,Dolma是支撑OLMo系列模型的开放训练语料库。我们表明,Dolma可能包含数十万份包含多种类型极端内容和仇恨言论的文档,包括直接呼吁暴力,并讨论这对数据管理和模型预训练的影响。
查看缓存全文
缓存时间: 2026/08/18 09:52
# 评估大语言模型训练数据中极端主义言论的普遍性与内容 来源:https://arxiv.org/html/2608.14813 ## 超越界限:评估大语言模型训练数据中极端主义言论的普遍性与内容 ###### 摘要 尽管研究界对可信且安全的AI主题表现出强烈兴趣,但大语言模型(LLMs)在预训练和后训练阶段接触的文本语料库的构成尚未引起足够关注。本研究旨在解决大语言模型是否暴露于未过滤、无语境的极端主义言论这一问题。我们采用源自官方文件和学术研究的多种极端主义言论定义,结合自动文本处理与专家验证的提取流程,对Dolma(一个支撑OLMo系列模型的开放训练语料库)中极端主义文件的普遍性进行了下限估算。研究表明,Dolma很可能包含数十万份涉及多种类型极端主义内容和仇恨言论的文件,包括直接煽动暴力的内容,并探讨了这对数据整理和模型预训练的意义。 ## 1 引言 可信且安全的AI主题已成为人工智能/机器学习领域最大的研究焦点和资助支持方向之一(参考文献15、18、12)。这类研究活动似乎主要集中在架构发展和后训练机制上。相比之下,数据整理与过滤问题虽然得到承认(参考文献19),但受到的关注远未达到同等程度。这种不平衡的一个具体体现是:虽然已有大量研究分析大语言模型的政治偏见与倾向(参见参考文献23、8、2、25等),但仅有少数研究尝试将其与预训练和后训练阶段所用数据的构成联系起来(参考文献31、36、9)。 可信且安全的AI主题与计算社会科学范畴高度重叠的一个领域是极端主义言论的识别与分析。已有观察反复指出,由于数据稀缺,自动识别边缘政治立场对大语言模型而言是一项艰巨任务(参考文献24、5)。同时,即使训练数据中仅存在少量极端主义内容,由于大语言模型具有强大的逐字记忆能力,也可能导致用户(包括未成年人)暴露于危险观点。更糟糕的是,如果模型输出中提及这些观点的支持者及其核心文本而未加适当评论,可能导致这些观点逐渐被正常化。过去几年已有报告揭示了大语言模型与极端主义或偏执意识形态之间令人担忧的趋势(参考文献21、1、17、3)。 图1:本研究实现的分析流程图。 极端主义言论是否应从训练数据中尽可能彻底清除以消除上述风险,还是应在其被适当语境化后保留,这仍是一个开放性问题。然而作为第一步,必须至少估算其在训练语料库中的普遍程度。这正是本研究的目标。通过结合大规模自动分类与过滤以及人工专家分析,并以Dolma(参考文献30)——目前规模最大、最具权威性的开源预训练数据集之一——为目标,我们证实了多种类型的极端主义内容确实存在于大语言模型的训练数据中。 我们的方法论贡献在于提出了一种保守的识别流程,为极端主义文本的普遍性提供了可靠的下限估算。我们进一步讨论了模型提示中使用的具体极端主义定义对结果的影响。我们测试的三种定义分别导致了略有不同的结果,这些结果在不同实际应用中可能各有优势。 论文结构如下:第2节(https://arxiv.org/html/2608.14813#S2)介绍用于识别极端主义和仇恨言论的定义;第3节(https://arxiv.org/html/2608.14813#S3)说明实验设置;第4节(https://arxiv.org/html/2608.14813#S4)报告普遍性估算与稳健性检验结果;第5节(https://arxiv.org/html/2608.14813#S5)深入分析使用不同定义提取的文档样本;第6节(https://arxiv.org/html/2608.14813#S6)基于Dolma中的源领域标注,考察经人工验证的极端主义文档来源;第7节(https://arxiv.org/html/2608.14813#S7)为结论。 ## 2 极端主义定义 极端主义和极端主义言论的地位因国家而异。例如,在美国(受第一修正案强力保护),极端主义言论本身并不被禁止,通常仅在与实际或潜在恐怖活动相关时才被分析(参考文献32)。与此同时,在英国,尽管极端主义观点和言论同样未被直接禁止,但政府主动承担起避免“为试图推进极端主义意识形态的个人、团体或组织提供平台、资金或合法性”的责任(参考文献33),这要求存在关于此类意识形态的官方指导。在本分析中,我们采用英国官方极端主义定义,以及两位极端主义与恐怖主义研究领域学者提供的两个定义。 ### 2.1 英国定义 以下定义基于参考文献33进行了最小程度调整以使其自成体系: > 极端主义是基于暴力、仇恨或不容忍的意识形态的推广或推进,旨在: > 1. 抵制或摧毁他人的基本权利和自由;或 > 2. 破坏、颠覆或取代自由民主制度和民主权利;或 > 3. 故意为他人实现上述第(1)或第(2)项结果创造宽松环境。 该定义聚焦于极端主义者和演讲者对民主秩序以及发达国家普遍存在的权利与自由体系的反对。 ### 2.2 Berger的定义 以下定义改编自参考文献4。该定义聚焦于内群体与外群体之间较为抽象的对立,为使用者带来一定的解释负担: > 极端主义是指认为演讲者或作者所属内群体的成功或生存永远无法与对外群体敌对行动的需求相分离的信念。敌对行动必须成为内群体成功定义的一部分。敌对行为可涵盖从言语攻击与贬低到歧视行为、暴力乃至种族灭绝。 ### 2.3 Schmid的定义 该定义改编自参考文献29。其内容相当详细,列举了极端主义者的典型特征和意识形态立场: > 在民主社会的语境中,极端主义是一种政治表达形式(通常位于政治光谱的极左或极右),不被更温和的主流政治生活所接受。极端主义团体和政党往往反宪法、反民主、反多元主义、狂热、不容忍、不妥协、固执、专制,并信奉“目的证明手段正当”的哲学,希望不择手段(包括对反对者使用政治暴力)实现目标。极左或极右的极端主义者以及宗教原教旨主义者倾向以暴力取代说服,以统一取代多样性,以统一性取代多元主义,以命令取代对话。 ## 3 数据与方法 遵循参考文献9的建议,我们以Dolma语料库(参考文献30)为目标——这是一个完全开放且文档齐全的预训练语料库。该语料库为训练OLMo系列模型(参考文献26)而编制,并未完全代表其他大语言模型(尤其是基于专有语料库的模型)所使用的训练数据。然而,其大部分内容来自常用数据集(如CommonCrawl和C4),因此Dolma中发现的文档极有可能已被当今大多数通用模型吸收。 完整语料库包含约3万亿个英文标记,对其进行整体分析不切实际。因此,再次遵循参考文献9的方法,我们采用蓄水池抽样,使用在整个数据集单次遍历中提取的20万份文档随机样本。随后,我们实现了多阶段分析流程处理该样本。该流程总结如图1(https://arxiv.org/html/2608.14813#S1.F1)。 ##### 自动提取。第一阶段使用多个中型语言模型(参数数量和量化级别经过选择,使得样本文档可在单张80GB A100 GPU或两张40GB A100 GPU上处理)将文档分类为极端主义言论示例或其他类别。我们对比了该“权重类别”中最大的两个模型(Llama 3.3 70B和Qwen 2.5 72B,均采用4位量化)与两个较小但更现代的模型(Qwen 3.5 27B和Gemma 4 31B,均采用8位量化)。任务规范和极端主义定义在系统提示中提供,目标文本在用户提示中提供。模型以零样本方式提示。 ##### 联合检查。为验证模型对任务具有普遍理解,除使用单个定义提示外,我们还采用联合提示——将多个定义一起给出,并要求模型判断输入是否满足其中任何一条。我们期望适合该任务的模型: > 1. 基于联合定义返回的文本数量多于基于每个单独定义的数量; > 2. 基于联合定义提取的样本与基于单个定义提取的样本之间存在合理重叠。 例如,若模型使用英国定义返回10篇文本,使用联合定义返回100篇文本,我们期望两者的交集至少包含7篇文本;否则大语言模型对提示的理解将非常值得怀疑。单个定义提示和联合提示见附录A(https://arxiv.org/html/2608.14813#A1)。 ##### 自动过滤。若模型通过联合检查,可假定其或多或少一致地遵循了提示。然而,仅一致性本身无法防范主要的提取错误类型(即假阳性与假阴性)。遗憾的是,我们缺乏可靠的假阴性筛查方法。由于实际原因,无法重新检查所有丢弃的文档;较小随机样本的估计可能不准确,因为极端主义文件的实际普遍性希望较低。因此我们在此承认局限,并将估算结果视为训练数据中极端主义材料普遍性的下限。 至于假阳性,我们首先通过GPT 4o mini(该模型在开放式分类任务中有良好记录,参考文献28、10、34)重新检查所有提取的文档进行测试,通过OpenAI API访问。此阶段仅使用联合定义。 ##### 专家评估。作为最后一步,我们从其中一个模型(Gemma 4)提取并经GPT 4o mini验证的文档中,按定义各抽取十篇文本。这些文本随后由本文第二作者(极端主义言论领域专家)分析。样本虽小,但提取的文本(见附录C)篇幅较长、连贯性有限,且混杂仇恨言论与编码语言,处理难度极大。分析结果见第5节(https://arxiv.org/html/2608.14813#S5)。 ## 4 普遍性估算 表1:基于不同定义从20万份Dolma样本中提取的文本集合间的重叠情况。括号内数字为经GPT 4o mini验证为极端主义的文本数量。 Dolma中极端主义文本的普遍性估算如表1(https://arxiv.org/html/2608.14813#S4.T1)所示。最明显的结果是:Llama 3 70B存在不一致性,不可靠——其基于单个定义(Berger定义)提取的文本数量多于基于联合定义的数量,联合检查结果(即主对角线值与最后一列值的差异)极差,且GPT 4o mini排除了其大部分结果。 Qwen模型尽管规模差异巨大(72B vs. 27B参数),但表现出相似模式,其中Qwen 3.5更为保守,且与GPT 4o mini估算结果更一致。有趣的是,尽管Qwen 2.5似乎返回了更多假阳性,但其联合检查结果良好,表明其内部一致性较高。最后,Gemma 4被GPT 4o mini否决的提取文本比例最低。然而,这以降低召回率(相比Qwen 3.5平均减少20%文本)为代价,且联合检查结果较差(Qwen 3.5单个定义集合与相应联合重叠集合的大小差异平均仅3%,而Gemma为11%)。 这些结果表明,只要使用Qwen 3.5 27B提取的文本能通过更大模型或人工专家进一步筛选,其在内部一致性与精确度之间提供了最佳平衡。其平均召回率并不明显低于Llama 3 70B(后者似乎具有极高的假阳性率)。同时,Gemma 4结合Schmid定义和英国定义可提供最保守且可靠的结果。 另一个可得出的结论是:Berger定义聚焦于“内群体”与“外群体”的对立,其估算结果具有较高的可预测方差。这使其更适合探索性工作,但可能不太适用于实际筛选应用。至于其他两个定义,Schmid定义返回的文本数量多于英国官方定义;然而,经GPT 4o mini过滤后差异显著缩小。此外,重叠集的大小非常接近……
相似文章
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
大语言模型中的预训练数据暴露:成员推理、数据污染及安全影响综述
统一综述大语言模型中的预训练数据暴露(PDE),涵盖成员推理、数据污染和安全影响,并回顾了攻击与防御方法。
使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。
它们能走多远?利用大型语言模型对在线影响力进行红队测试
本文介绍了一个红队测试框架,用于衡量开源LLM能够表达的政治观点的“奥弗顿窗口”,并评估简单的越狱手段如何扩大该范围,发现30多个模型存在系统性的左倾偏见和漏洞。
超越“AI语言”:论LLM输出的个人言语特征本质
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。