哪种印度传统在翻译中幸存?大型语言模型中印度口头传统的叙事同质化

arXiv cs.CL 论文

摘要

一项计算研究显示,大型语言模型部分同质化了不同的印度口头传统,而使用地区语言提示竟意外降低了对真实叙事的忠实度。

arXiv:2608.26123v1 发布类型:新文章 摘要:大型语言模型主要基于英文互联网文本进行训练,其中对某些文化叙事过度代表性,引发了模型将非西方讲故事传统的多样性扁平化为单一同质化原型的担忧。我们进行了一项试点计算研究,在三种差异最大的印度地区口头和文学传统中考察了这一问题:拉贾斯坦邦的Pabuji史诗、古典泰米尔语桑伽姆诗歌和孟加拉民间故事。我们为每种传统收集了真实的参考语料库(分别为11、21和10个段落),并使用Claude Sonnet和Gemini两个大型语言模型,针对每种传统的三种提示类型(通用、文化特异性和地区语言)生成了54个请求。通过Sentence-BERT嵌入和余弦相似度,我们测量了参考漂移(输出追踪其自身传统真实文本相对于其他两个传统的紧密程度)和跨传统收敛性(不同传统间输出的相似程度)。我们发现,尽管输出仍更接近其自身传统的参考文本而非其他传统,但跨传统相似度(0.52-0.66)相对于这些传统之间的实际距离来说很高,表明存在部分同质化。出乎意料的是,使用地区语言(印地语、泰米尔语或孟加拉语)提示,相对于英文提示,始终降低了对真实传统的忠实度,对于拉贾斯坦邦和孟加拉传统,降低幅度高达27个百分点。我们针对先前关于多语言提示的相互冲突的研究结果对此进行了讨论,并认为这反映了激发一般文化多样性与模拟一种狭窄、文献较少的口头传统之间的差异。我们将这项试点研究定位为近期关于大型语言模型生成的故事中印度文化错误表征的大规模人类标注研究的轻量级、可扩展的补充,作为更广泛博士研究计划的一部分。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:17

# 哪个印度存活于翻译?大型语言模型中印度口述传统的叙事同质化
来源:https://arxiv.org/html/2608.26123
###### 摘要

大型语言模型主要基于英语互联网文本训练,这些文本系统性地过度呈现某些文化叙事,引发了一种担忧:模型会将非西方叙事传统的多样性扁平化为一个单一的同质化原型。我们呈现了一项试点计算研究,考察这一现象如何贯穿于三个最大程度上相异的印度地区性口述与文学传统:拉贾斯坦邦的帕布吉史诗、古典泰米尔桑伽姆诗歌以及孟加拉民间故事。我们为每个传统收集了真实的参考语料库(分别为11、21和10个段落),并使用54个生成请求向两个LLM(Claude Sonnet和Gemini)进行提示,每个传统涵盖三种提示类型——通用型、文化特定型和地区语言型——每种类型都在独立运行中重复多次。使用Sentence-BERT嵌入和余弦相似度,我们测量了参考漂移(模型输出与其自身传统的真实文本相对于其他两个传统的贴合程度)以及跨传统趋同性(不同传统的输出彼此之间的相似度)。我们发现,虽然LLM输出与其自身传统的参考文本保持更近的距离,但跨传统的相似度(余弦相似度0.52-0.66)相对于这些传统真实的语言和结构距离所预测的值仍然很高,表明存在部分同质化。出乎意料的是,使用地区语言(印地语、泰米尔语或孟加拉语)进行提示,与使用英语提示相比,持续*降低*了对真实传统的保真度,对于拉贾斯坦和孟加拉传统,降幅高达27个百分点。我们将这一发现与先前关于多语言提示的矛盾结果进行对比讨论,并认为这反映了激发一般文化多样性与忠实模拟一个狭窄、文献记录较少的口述传统之间的区别。我们将此试点定位为近期关于LLM生成故事中印度文化误解的大规模人类标注研究的轻量级、可扩展的补充,并概述其作为更广泛博士研究计划一部分的延伸方向。

## I 引言

大型语言模型日益影响数百万人遭遇、生成和传播文化叙事的方式,从短期创意写作到AI辅助叙事产品。由于这些模型主要基于英语互联网文本训练,其训练数据中呈现最重的文化叙事并非人类叙事传统的中立样本,而是偏向盎格鲁-美利坚及更广泛的西方来源的扭曲样本\[7,3,4\]。越来越多的研究表明,这种偏斜不仅表现为表面水平的刻板印象——常见的发现是某个职业默认指向特定性别或族裔——还表现为更深层次的偏见:体现在模型被调查时所表达的文化价值观中\[11\],体现在它们与特定文化背景相关联的实体中\[5,6\],以及体现在如印度等特定国家背景的身份-属性关联中所编码的社会刻板印象中\[10\]。

一个更狭窄且较少探讨的问题是,当LLM被要求在特定文化或地区传统内生成虚构作品时,*叙事结构*和*故事内容*具体会发生什么。最近的工作表明,这种影响可能尤为严重:Rettberg和Wigers\[9\]使用单个LLM为236个国家/地区称谓生成了近一万两千个短篇故事,他们发现,尽管存在表面的国别标记,几乎所有故事都收敛于一个共同的基础情节结构——主角通过重新与传统连接来解决一个小的社区冲突——他们称之为*叙事标准化*,这是一种在情节而非用词层面运作的、独特且未被充分认识的AI偏见形式。作为这项大规模生成研究的补充,Bhagat等人\[2\]进行了一项广泛的人工标注研究(71个印度地区、14种语言的108名专家标注者),发现88%的关于印度文化身份的LLM生成故事至少包含一处误解,对于资源较少的印度语言和文献记录较少的地区,错误率显著上升。至关重要的是,他们的结果表明这主要不是知识缺陷——模型回答关于相同文化内容的直接事实问题时,在英语中准确率约为77%(在印度语言中约为60%,最强的模型在英语中达到86%,在印度语言中达到74%)——而是在开放式叙事生成中无法可靠地*应用*这些知识。

这两项研究推动了当前的工作,但留下了一个方法论上的空白。Rettberg和Wigers的方法是生成式的、大规模的,但并未隔离印度内部特定的、有充分文献记载的口述或文学传统,而是将印度视为236个国家/地区称谓中的一个。Bhagat等人的方法实现了细粒度的、基于地区的测量,但需要大量的人工标注基础设施(超过一百名训练有素的母语标注者),使其难以快速扩展或复制。我们用一个轻量级的、完全计算的试点来解决这一空白:我们不依赖人类评判者,而是通过句子嵌入直接测量叙事同质化,将LLM生成的故事与来自三个特定的、有充分文献记载且文化相异的印度口述与文学传统的参考文本进行比较。

我们特意选择了三个最大程度上相互区别的传统:帕布吉史诗,一个来自拉贾斯坦邦农村的活态口述表演传统,以沙漠英雄主义和牛群保护为中心;古典泰米尔桑伽姆诗歌,一部具有独特*akam*/*puram*(内在/外在)情感语法的前现代文学典籍;以及拉尔·贝哈里·代伊所普及的孟加拉民间故事传统,以村庄环境和道德模糊的女性主角为特征。如果LLM对这些传统拥有真实的、差异化的知识,那么针对每个传统生成的输出应更接近该传统的参考文本,而非其他两个传统的文本。相反,如果输出无论指定哪个传统都收敛于一个通用的“印度故事”原型,则构成了Rettberg和Wigers所描述的叙事同质化的直接证据,这里在他们的研究未考察的亚国家、特定传统层面进行了操作化。

我们还测试了使用相关地区语言(根据每个传统,使用印地语、泰米尔语或孟加拉语)进行提示是否比使用英语提示能提高保真度。这个问题处于一场活跃且未决辩论的核心:Wang等人\[12\]报告称,多语言提示与带有等效文化线索的英语提示相比,显著增加了响应多样性,并将幻觉率大致减半;而Naous等人\[5,6\]发现,使用目标语言进行操作并不能可靠地改善文化实体偏好准确性,有时甚至使其恶化。我们的试点为这场辩论贡献了第三个、针对叙事的特定数据点。

本文其余部分组织如下。第二节回顾了关于LLM文化偏见、叙事同质化和多语言提示效应的相关工作。第三节描述了我们的参考语料库、提示协议和基于嵌入的分析方法。第四节介绍了四项分析的结果:参考漂移、跨传统趋同性、提示类型效应和语言提示效应。第五节结合先前工作讨论了这些发现。第六节陈述了局限性,第七节总结了将此试点扩展为完整研究计划的方向。

## II 相关工作

### II-A 大型语言模型中的偏见

LLM中的偏见已被广泛记录和调查。Navigli等人\[7\]、Ferrara\[3\]和Gallegos等人\[4\]各自全面论述了训练数据选择和下游对齐选择如何在性别、年龄、族裔、宗教和文化等方面引入和放大社会偏见,并调查了衡量和缓解这些影响的现有方法。这些综述确立了文化偏见是更广泛、已被充分研究的问题的一个公认方面,而非孤立现象,并为下面将要回顾的更具针对性、文化特定性的测量方法提供了动机。

### II-B 文化偏见与文化对齐

Tao等人\[11\]对五款GPT模型进行了针对世界价值观调查的大规模审计,发现所有模型,无论发布日期如何,在就自我表达、世俗主义和信任等价值观进行调查时,其文化聚类都接近英语国家和新教欧洲国家。他们进一步表明,*文化提示*——在提示中明确赋予模型国籍身份——使后期GPT-4家族模型的文化距离减少了71–81%,尽管这种策略对于模型未提示的默认值已接近该国家真实价值观的国家可能适得其反,并且纠正后的剩余差距仍然相当大。

Naous等人\[5\]引入了CAMeL,这是一个包含超过20,000个文化注释实体和对比阿拉伯文化与西方文化的自然提示的基准,他们表明,包括阿拉伯语单语模型在内的十六个语言模型,即使在明确的阿拉伯语语境提示下,也系统性地偏好与西方相关的实体,文化偏见得分在40-65%之间,而理想值接近零。他们将部分偏见追溯到常用阿拉伯语预训练来源的文化构成,发现阿拉伯语维基百科在他们考察的语料库中矛盾地是西方化最严重的。Naous等人\[6\]将这种以实体为中心的方法扩展到九种亚洲语言和六种亚洲文化(包括四种印度语言:印地语、马拉雅拉姆语、马拉地语和古吉拉特语),在Camellia基准中再次发现,即使在明确的文化定位下,也无法可靠地偏好文化上适当的实体,并且亚洲语言与英语语言实体提取之间的偏见差距远大于在完全使用英语执行相同任务时观察到的差距。

更具体地贴近印度背景,Sahoo等人\[10\]引入了IndiBias,这是一个双语(英语/印地语)基准,涵盖七个个体偏见轴——包括种姓和地区,这些维度在西方中心基准如CrowS-Pairs中基本缺失——加上三个交叉轴。评估十个语言模型后,他们发现偏见既在模型间不统一,也不在一种语言中始终低于另一种语言,并且种姓和宗教相关的刻板印象可被测量到存在,并且在某些情况下相对于通用基准被放大。

### II-C 叙事同质化

与本研究最直接相关的是,Rettberg和Wigers\[9\]使用gpt-4o-mini为236个国家/地区称谓生成了11,800个故事,发现几乎所有故事都收敛于一个共同的基础情节骨架——主角通过解决一个小的、非暴力的冲突与一个小社区重新连接——无论提示中指定了哪个国家/地区。他们称之为*叙事标准化*,将其与更熟悉的词语或图像层面的*表征偏见*区分开来,并认为这是一种未被充分认识的、结构性的AI偏见形式。他们对语料库中少数印度故事的分析仅限于两个例证,留下了我们的试点直接解决的问题:当提示针对特定的、有充分文献记载的亚国家印度口述传统,而不仅仅是“印度”这个称谓时,这种标准化是否持续存在,以及程度如何。

Bhagat等人\[2\]采取了一种互补的、由人工标注驱动的方法,使用TALES进行了一项混合方法研究,该研究结合了社区引出的误解类型分类法与大规模标注研究(540个故事的2,925个标注,来自71个印度地区、14种语言的108名母语专家标注者)。他们发现88%的故事至少包含一处误解,对于资源较少的印度语言和较不突出的地区,错误率急剧上升,并且——对我们的研究框架至关重要——通过衍生的知识问答基准发现,误解在很大程度上*并非*由模型缺乏相关事实来解释,而是由于在开放式生成中无法可靠地应用已知的文化知识。他们发现英语故事生成实际上比印度语言生成包含更高密度的文化特定内容(归因于非英语输出中对文化特异性的整体参与度较低,而非更高的准确性),这一发现与我们关于地区语言提示的发现相呼应,并部分预见了这一点。

Agarwal等人\[1\]为这些生成研究提供了一个控制实验的补充,他们表明,当印度和美国用户在撰写文化根基主题时接收到相同的AI自动补全建议时,印度写作会显著地向美国的风格和词汇规范趋同(跨文化嵌入相似度从0.48上升到0.54),而反向趋同可以忽略不计。他们排除了简单的解释,如语法纠正或省略显性文化名词,表明同质化在更深层的风格层面运作——这一发现与\[9\]中提出的结构同质化论点一致并得到了强化。

### II-D 多语言和地区语言提示效应

使用文化相关语言进行提示是改善还是损害文化保真度,在最近文献中存在争议,我们的地区语言发现直接针对这一分歧。Wang等人\[12\]提出了多语言提示——将文化人格线索与翻译成相应语言的提示相结合——并证明在四个模型族中,它显著增加了响应多样性,超过了仅英语基线以及如高温采样等既有的多样性技术,并且与带有等效文化线索但未翻译的英语提示相比,幻觉率大致减半。相反,Naous等人\[5,6\]的实体偏好研究发现,使用目标语言进行操作并不能可靠地改善文化实体偏好准确性,有时甚至使其恶化。

相似文章

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

Linguistic Monoculture in LLM-Assisted Language Use

arXiv cs.AI

This paper introduces a mathematical framework to study how reliance on shared LLMs for writing may reduce population-level linguistic diversity, analyzing fixed, recursive, and personalized interaction mechanisms and characterizing equilibria and convergence rates.