文化漏斗:无法对齐数据中缺失的内容
摘要
本文介绍了'文化漏斗'概念,展示了LLM训练数据中的文化信号在后训练阶段急剧下降。作者发布了一个包含5.6M样本的标记数据集,以帮助在模型对齐中保留文化基础。
arXiv:2606.13808v1 公告类型:新
摘要:当前的文化对齐方法侧重于推理时干预,假设模型已经包含足够的文化知识。我们认为现代LLM流程存在文化数据漏斗问题。通过一个跨预训练、微调、对齐和推理数据集的多维标签框架,我们展示出显式文化信号在后训练阶段急剧下降,而地理集中的任务特定数据占据主导。多语言性增强了文化知识的地理多样性,但并不能确保平衡的代表性。我们的标签改进了下游文化基准性能,表明进步需要将焦点转移到训练数据流程上。为促进未来研究,我们发布了包含5.6M样本的文化标记数据集,地址为 https://huggingface.co/datasets/CohereLabs/CultureMarkers。
查看缓存全文
缓存时间: 2026/06/15 08:56
# 文化漏斗:数据之外无法对齐 来源:https://arxiv.org/html/2606.13808 affiliation=1name=Mehrnaz Mofakhamiaffiliation=1name=Daniel D’Souzaaffiliation=1name=Thomas Euyangaffiliation=1name=Julia Kreutzer\\psaaffiliation=1name=Marzieh Fadaee\\psaaffiliation=1 ###### 摘要 当前的文化对齐方法主要关注推理时的干预,假设模型已包含足够的文化知识。我们认为现代大语言模型管线存在一个文化数据漏斗。通过一个跨预训练、微调、对齐和推理数据集的多维标注框架,我们展示了显式文化信号在后训练阶段急剧下降,而地理上集中的、任务专业化的数据占主导地位。多语言能力增强了文化知识的地理多样性,但并不能确保均衡的代表性。我们的标注提升了下游文化基准的性能,表明进步需要将焦点转移至训练数据管线。为促进未来研究,我们发布了带有文化标注的 560 万个样本的数据集,地址为:https://huggingface.co/datasets/CohereLabs/CultureMarkers ## 1 引言 大语言模型正变得越来越支持多语言,然而这种能力并不能保证文化对齐,因为语言本身不足以作为文化的代理(rystrom2502multilingual)。先前的工作表明,模型在主流语境之外的文化情境行为上存在困难(zhang2025culturescope; agarwal2025fluent; huang2023culturally),但大多数方法将文化视为推理时的问题,通过基准测试、对齐调优或提示策略来处理(masoud2024llm; kashyap2026aligncultura; tao2024cultural),假设知识已经存在,只需激发出来。我们认为这一假设并不完整:尽管预训练语料包含多样化的语言数据,后训练过程往往将行为趋同于主流文化规范(agarwal2024ai; zhang2026mind),且网络规模数据过度代表西方人群(navigli2023biases; rystrom2502multilingual)。这造就了我们所谓的**文化漏斗**——在后训练阶段,文化信号随着优先考虑推理和对齐优化而被压缩。 后训练阶段越来越优先考虑推理、编程、数学和对齐优化,系统性地压缩了文化情境学习的机会。这一转变影响重大,因为现代大语言模型的开发重心在于后训练而非昂贵的预训练,尤其在学术界、开源社区和初创公司中。尽管网络规模语料自然包含文化信号,但它们不成比例地代表西方英语人群(navigli2023biases; rystrom2502multilingual),导致文化同质化向下游生态系统扩散。 表 1:来自标注数据集的英文示例及其预测标签。我们在大语言模型训练数据中明确文化因素以量化这个漏斗,采用了 alkhamissi2026hire 针对 NLP 的文化分类法,该分类法涵盖超越事实或特质的动态维度(zhou-etal-2025-culture)。我们的分析考察了文化内容与领域、任务、语言和地理信息的共现情况,以解答以下问题: 1. 文化相关的内容在大语言模型训练各阶段如何演变? 2. 多语言性、地理位置、领域和任务组成之间的交互如何塑造文化表征? 3. 显式的文化标记能否在后训练期间保留文化根基? 我们对 5.6M 个数据点进行了标注,涵盖预训练、后训练、评估和真实世界对话在内的 10 个多样化数据集,并公开发布以供进一步研究。由于后训练越来越依赖合成推理和对齐数据,理解文化保留对于构建全球代表性的人工智能系统至关重要。我们扩展了 oh-etal-2025-culture 的评估原则至数据层面:*“每一个评估和数据选择都应检查其文化上的考量”*,将文化确立为数据记录、处理和评估的主要因素。 表 2:已标注的训练数据集概览,包括语言覆盖范围和带有文化标签样本的比例。由于子采样、数据集特定过滤和标注器失败,大多数数据集并非 100% 被标注。 ## 2 相关工作 测量数据中的文化 文化对齐正成为自然语言处理中日益重要的话题,因为我们发展的大语言模型不仅要理解不同语言,还要理解不同文化的细微差别。然而,文献中对文化并没有统一的定义,其定义通过代表文化的数据集来传达。先前的工作从不同角度提供了文化分类学。adilazuarda2024towards 通过语义(例如价值观、规范、食物)和人口统计学(例如宗教、种族、地区等)代理来对文化进行分类。hershcovich2022challenges 采用了更宽泛的分类,考虑了语言形式和风格、目标和价值观、共同基础以及主题性等要素。Liu2025CulturallyAware 将其分类学扎根于人类学和社会科学,强调社会互动和沟通风格是不同文化间的关键区分因素。 我们的工作采用了 alkhamissi2026hire 基于人类学的框架,将基准测试分类为将文化视为知识(例如 BLEnD (myung2025blend))、偏好、动态(例如 NormAd (Rao2025Normad))或偏见(例如 BBQ (parrish-etal-2022-bbq)),这些维度并非互斥,许多基准测试跨越多个类别。 跨越多项基准测试研究,一个一致发现是:文化均衡代表性仍有很大提升空间,尤其在非英语语言和非主流文化中(pawar-etal-2025-survey)。 数据剖析与文化数据整理 一条关键研究路线剖析了 NLP 数据的来源、多语言性、质量和地理代表性(dataprovenance; thompson-etal-2024-shocking; briakou-etal-2023-searching; blevins-zettlemoyer-2022-language; kreutzer-etal-2022-quality; faisal-etal-2022-dataset),最近的工作侧重于整理文化丰富且多元化的数据集(naous-xu-2025-origin; zhang2026cultivatingpluralism; shi2024culturebank)。我们延续这条研究路线,通过剖析数据中的文化信息,并将其与语言和地理表征联系起来。 文化干预 为解决基础模型中文化表征不足的问题,越来越多的研究探索了在不同阶段的有针对性模型干预,从测试时提示到后训练适应。在推理时,alkhamissi-etal-2024-investigating 研究了人类学提示,展示了精心设计的零样本提示如何在不需要参数更新的情况下帮助引发文化细致的回答。超越提示,han2025rethinkingcrosslingual; khanuja2026steeringllmsculturallylocalized 提出了推理时引导机制,通过在模型不同层添加特定的文化本地化向量来引发文化行为。然而,这些方法的有效性通常依赖于用于推导引导向量的源数据,这可能限制其泛化到不同架构或目标分布的能力。除了推理时技术,一些方法依赖有针对性的微调来显式注入文化对齐(li2024culturellm; adilazuarda-etal-2025-surveystonarratives)。虽然这些方法有效地调整了模型行为,但它们主要将文化适应视为事后干预,假设文化根基可以在模型开发后附加(更完整的综述见(pawar-etal-2025-survey))。相比之下,我们的工作采用以数据为中心的角度,分析文化数据相关性和组成如何在训练管线中演变。通过用文化元数据丰富训练数据,我们展示了在有机增强文化根基能力的同时,提升了下游基准性能。这种方法无需激进的数据过滤或特定文化的模型权重,即可保留通用任务性能。 ## 3 数据中的文化标注 我们假设大语言模型的文化失败源于训练数据组成:稀疏或过于集中的文化信息会限制模型学习文化情境行为的机会。为了刻画文化分布,我们使用自动标注管线对选定的数据集进行分析,并通过人工标注进行验证。这有助于识别文化在领域、任务、地理位置和语言中出现在哪里以及如何出现。 ### 3.1 数据集 数据集选择 我们标注了在大语言模型训练中使用的流行公开数据集的代表性样本,涵盖大语言模型训练管线的各个阶段,列于表 2 (https://arxiv.org/html/2606.13808#S1.T2)。我们在选择中优先考虑了以下几个因素:(1) 流行度,以代表当今许多模型;(2) 新近度,以代表数据开发的最新阶段;(3) 规模和覆盖范围,以确保我们的分析不过度拟合于小众领域;(4) 质量,以数据经过的整理和过滤程度近似,避免在噪声上浪费分析;(5) 对于多语言覆盖,优先选择原生创建的数据集而非合成数据集,以最大化多样性;(6) 来源和整理者的多样性,以防止我们的分析过度拟合于某个实验室的数据处理策略或优先事项。 子采样与过滤 由于处理成本过高,我们对数据集进行子采样以平衡计算效率与分析表达能力,并过滤掉无信息价值的样本。对于 CulturaX (nguyen-etal-2024-culturax)(源自 mC4 (xue-etal-2021-mt5) 和 OSCAR (OrtizSuarezSagotRomary2019)),我们子采样了 10 万篇英文文档,以及每种其他语言(语言间均匀)1 万篇文档。我们还过滤掉了长度超过 5000 token 的文档。对于 Dolci Instruct-SFT (olmo2025olmo3),我们进行均匀子采样,但排除了缺乏文化内容的代码和工具调用领域。总计我们标注了 560 万个数据点。 用于对比的文化中心数据集 除了流行的训练数据集,我们还标注了为文化对齐或基准测试而整理的数据集,或者本身是多语言(非翻译)的数据集。这些包括 GeoFact-X (hwang2025learn)、CultureBank (shi2024culturebank) 和 MultiNRC (MNRC) (fabbri2025multinrc) 等基准测试,以及 Aya 数据集 (singh-etal-2024-aya)(仅“原始注释”,即新的人工编写的提示)和 PRISM 对齐数据集 (kirk2024the)。请注意,Aya 数据集和 PRISM 的规模比其更流行、更少文化中心的对应数据集要小许多数量级。 我们还标注了 ShareLM (don2025sharelm),以研究文化在用户与当前人工智能模型的真实对话中出现的位置。这里我们移除了少于 10 个字符的任何用户提示,以去除重复的闲聊噪声(例如“嗨”、“你好”)。 ### 3.2 多维数据标注 标注分类法 我们在五个维度上对每个数据点进行标注:文化(使用 alkhamissi2026hire 的分类法,包含四个类别:文化作为知识、动态、偏好、偏见),此外还有领域、任务意图(仅后训练)、地理位置和语言。文化标注还包括一般文化(文化相关的实体如食物、节日、命名实体和翻译上下文 (yao-etal-2024-benchmarking; Doren2026BeMC))和无文化。除语言标签使用 FastText LangID (joulin2016fasttext) 外,所有标注均使用 Command-A 模型。领域和任务意图分类法遵循 (d2025treasure),而地理位置捕捉内容所在位置而非数据来源。标签示例见表 1 (https://arxiv.org/html/2606.13808#S1.T1),完整分类法详情见表 6 (https://arxiv.org/html/2606.13808#A1.T6)(附录 A (https://arxiv.org/html/2606.13808#A1))。 标注范围 对于预训练语料,我们标注整个文本;但对于后训练数据,我们仅标注输入提示和指令,而非模型响应或补全。此外,在对话数据集中,仅标注用户一侧的轮次。这基于一个假设:如果提示包含文化内容,任何适当的响应也将包含。我们的分析衡量的是**文化学习的机会**,而非模型输出的**文化充分性**:我们不关注现有补全的文化充分性(这本身仍是一个开放问题,因为文化基准尚未达成共识),而是将其视为文化可能出现的一个乐观估计,进而作为训练数据创造文化意识学习机会的地方。 标注模型与提示 我们选择了开源权重模型 Command-A (Cohere2025CommandAA) 作为标注器,因其强大的多语言性能。我们采用了 (d2025treasure) 的标注提示并进行了改编。完整的标注提示见附录 A (https://arxiv.org/html/2606.13808#A1)。对于每个标注类别,我们提供了少量示例;对于文化类别,我们特别从文化数据集中选择了示例:GeofactX (Hwang2025LearnGS)(*文化作为知识*)、NormAd (Rao2025Normad)(*文化作为动态*)、BBQ (parrish-etal-2022-bbq)(*文化作为偏见*)和 CIVICS 数据集 (civics)(*文化作为偏好*)。 参见说明 图 1:随着技术领域成为主导,文化根基从预训练到后训练逐渐减弱。 表 3:人工标注者之间一致性(IAA)以及大语言模型与多数人工标注之间一致性(M-H)的对比,按语言和标注标签(括号内数值数量)使用 Krippendorff's α 测量。 标注器评估 对部分标注数据进行了人工审核以与我们的标注器比较(详情见附录 B (https://arxiv.org/html/2606.13808#A2))。鉴于文化的情境性质,并不期望完全一致。相反,我们评估标注是否能提供可靠信号用于大规模趋势分析。表 3 (https://arxiv.org/html/2606.13808#S3.T3) 显示了三位标注者之间(IAA)以及大语言模型预测与多数人工标注之间(M-H)按标签类型计算的 Krippendorff's α。地理位置在多种语言中达到最高一致性,表明地理信息编码较为显式。文化和领域标注显示出更大的变异性:在印地语/韩语中一致性较强,但在英语/繁体中文中较低,反映了文化解释的挑战。任务意图总体上达到中等一致性。人工标注者之间的一致性也表现出类似的变异性,确认了分歧源于文化标注本身的模糊性而非大语言模型的局限。人机一致性趋势相当,表明标注器能为大规模多语言分析提供可靠信号。 ## 4 文化可以在哪里找到? 当结合文化、地理位置和语言标签时,每个数据集都展现出独特的文化特征,显示出哪个地区的文化以哪种语言被描述(如图 6 (https://arxiv.org/html/2606.13808#A3.F6) 所示)。尽管这些标签通常在数据卡 (datacards) 和模式中缺席,但它们提供了关于训练过程中引入文化知识的预期信息,并指示哪种语言使文化最易触及。 接下来,我们将重点强调并深入探讨选定的现象。 参见说明 图 2:多语言性增强的效果...
相似文章
将韩国文化融入LLM对齐:迈向文化一致性
本文提出一种数据集生成管道,通过DPO微调使大语言模型与韩国文化规范对齐,在提升文化安全性的同时不损害通用性能。
AlignCultura:迈向文化对齐的大语言模型?
AlignCultura 推出基于 UNESCO 框架的 CulturaX 数据集与两阶段对齐流程,在 Qwen3-8B 与 DeepSeek-R1-Distill-Qwen-7B 上实现 HHH 指标提升 4–6%,文化失误率降低 18%。
认真考虑文化:使用文化共识理论分析单文化与多文化环境下的大语言模型对齐
本文应用文化共识理论,利用世界价值观调查数据,分析大语言模型在单文化与多文化环境中与文化规范的对齐情况,表明模型要么未能形成连贯的共识,要么过度规范化共识,并为评估真实人类多样性与算法同质化提供了可操作的诊断方法。
C-Mining:通过几何错位无监督发现文化数据合成的种子
C-Mining提出了一个无监督框架,通过利用嵌入空间中的跨语言几何错位来发现LLM训练数据中的文化种子,实现可扩展的合成数据生成以支持文化对齐,无需手动或LLM监督。
通过数据中介迁移视角下的涌现与潜意识失调
本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。