图卢语法律理解中的跨语言迁移:书写系统依赖性改进与RAG引发的知识冲突
摘要
本研究评估了图卢语在法律理解中的跨语言迁移能力,通过使用转写技术及基于卡纳达语法律文件的RAG系统进行测试,揭示了改进程度依赖于书写系统,并发现了事实替代与幻觉生成等挑战。
arXiv:2608.28645v1 公告类型:新
摘要:缺乏充足训练语料的低资源语言常依赖相关高资源语言作为理解基础。然而仍需开发严谨的评估方法,以识别模型在跨语言低资源环境下的失效情况。本研究以法律领域为背景,测试了三个模型(Llama3、Hex-1、Sarvam)对低资源达罗毗荼语(图卢语)法律诉状的分类能力。通过对达罗毗荼语书写系统进行跨系统转写,模型无需大规模训练即可初步理解用户诉状,但理解程度高度依赖书写系统(其中卡纳达语——另一种相对低资源的语言——呈现出最强的正向趋势)。在RAG框架下从卡纳达语法律文件库检索信息时结果参差不齐。部分模型在特定条件下表现出微弱的理解提升,但其失效通常体现在两个维度:事实替代(过度聚焦于扭曲推理的特定段落摘录)以及幻觉生成(产生在查询和语料库中均无依据的虚构内容)。在低资源领域内,研究发现模型的信息解析与后续推理机制是导致推理失败的根源,而非语料库内容本身。书写系统依赖的理解能力与RAG鲁棒性似乎具有关联性,推理轨迹分析与统计诚实性框架的应用进一步支持了这一结论——这些技术同样适用于低资源多语言RAG评估场景。
查看缓存全文
缓存时间: 2026/09/01 11:59
# 图卢语法律理解中的跨语言迁移:基于文字的改进与RAG引发的知识冲突 来源:https://arxiv.org/html/2608.28645 [ BoldFont = NimbusRoman\-Bold\-renamed\.otf, ItalicFont = NimbusRoman\-Italic\-renamed\.otf, BoldItalicFont = NimbusRoman\-BoldItalic\-renamed\.otf, \] ###### 摘要 缺乏充足训练语料的低资源语言常借助相关高资源语言作为理解基础。然而,亟需开发严谨的评估方法来识别模型在跨语言低资源环境中的失效情况。本研究以法律领域为背景,测试了三个模型(Llama3、Hex-1、Sarvam)对以低资源达罗毗荼语言(图卢语)撰写的法律投诉进行分类的能力。通过达罗毗荼文字间的音译,模型无需大规模训练即可初步理解投诉内容,但理解程度高度依赖文字系统(其中坎纳达语——另一种相对低资源的语言——表现出最强的正向趋势)。通过RAG框架检索坎纳达语法律文献时产生了混合结果:某些模型在特定条件下展现出微弱的理解提升,但模型失效时通常表现为两个维度的问题:事实替代(过度关注导致推理偏差的特定段落)和虚构(在查询和语料中均无依据的幻觉)。在低资源领域内,结果表明推理失败源于模型的信息解析与后续推理过程,而非语料内容本身。基于文字的理解能力与RAG鲁棒性似乎存在关联性,这一结论得到了推理轨迹分析及统计诚实性框架的支持——这些方法对低资源多语言RAG评估具有更广泛的适用性。 ## 1 引言 尽管大语言模型具备多种能力,最紧迫的缺陷之一是模型在低资源领域中评估信息的方式。在世界许多地区,通用语言(通常是极度低资源的语言)与行政语言存在差异。更甚者,行政语言本身也常属于低资源语言,这要求采用新技术帮助模型跨越这种跨语言低资源领域。法律领域正是这一困境的相关应用——此类社区的成员常需使用非母语参与法律程序以获取资源。 本研究选用达罗毗荼语支的图卢语,这是印度卡纳塔克邦沿海地区数百万使用者的小型语言。卡纳塔克邦的官方语言为坎纳达语,意味着所有法律程序均以坎纳达语或英语进行。坎纳达语本身被归类为低资源语言:尽管拥有悠久的文学传统,但对其开展大语言模型训练直至近期才起步。图卢语则是极度低资源语言——它缺乏传统模型训练所依赖的广泛文献资料。 使用低资源语言图卢语,如何在无翻译的情况下将其用户投诉录入不采用该语言(而使用坎纳达语)的管理系统?本研究探索:微小的提示引导与坎纳达语法律文献是否足以让模型准确理解其从未接触过的语言撰写的查询。通常高资源语言是处理低资源语言的起点,但我们的直觉指向相反方向:图卢语传统上使用坎纳达文字而非拉丁字母书写,且图卢语使用者更倾向于借用词汇并参照周边更通用的语言(坎纳达语)组织句子结构。因此我们假设:使用坎纳达语(及其他达罗毗荼文字)能触发模型更强的理解能力。此外,鉴于两种语言间的密切关联,坎纳达语法律文献能为大语言模型提供更坚实的理解基础,使其能解析非正式语体撰写的图卢语投诉。 本文目的并非为低资源语言创建完整可用的大语言模型,而是以法律领域为实证场景,评估模型在跨语言低资源领域中的理解能力。为此,我们要求三个大语言模型使用斯坦福法律设计实验室的《法律问题分类法》(LIST)对图卢语法律投诉进行分类,过程无需翻译或大规模训练。我们探索:微小的提示引导结合高资源相关语言语料的检索增强生成(RAG),能否作为支架帮助模型定位其理解投诉时的缺口。 多数图卢语使用者掌握多语言,能够用坎纳达语、英语、印地语等交流,但使用第二语言表达仍可能导致语义细微差别的流失。 ## 2 相关工作 知识冲突——训练大语言模型时常常出现知识冲突(Longpre等,2021)。当模型被迫在新给定的段落与自身记忆间选择时,即使有相反提示,它们也常依赖自身理解。然而后续研究对此提出了不同见解: Xu等(2024)提出"上下文-记忆冲突"概念,指出模型难以正确权衡与自身内部理解冲突的检索信息,且会不一致地倾向于采用连贯且自信表述的上下文,无论其准确性如何。Wu等(2024)的研究进一步表明,模型持续放弃正确的先验知识以采纳检索上下文——包括本研究使用的模型之一Llama3。Xie等(2024)证实模型倾向于接受自信呈现的外部证据,即使存在知识冲突,但也指出另一种确认偏见:当证据仅部分支持时,模型倾向于维持原有理解。 鉴于低资源法律场景中的模型理解机制尚未得到广泛研究,我们通过比较多语言环境中多个模型的内在能力、检索分析及两者鉴别机制,为探讨这些机制如何进一步发挥作用提供了独特视角。 RAG引入的影响——RAG的引入可能损害知识综合能力。Hsia等(2025)解释了不同模型/检索器组合如何影响下游性能,有时效果甚至差于无检索情况。Zeng等(2025)的研究也观察到类似现象:模型在接收误导性检索证据时表现差于零样本基线,且无法识别何时应丢弃错误信息。我们的研究进一步推进了这一讨论,展示了模型如何利用微小提示提升预测准确性,但RAG的引入导致多数模型难以有效辨别何时应忽略无关段落。 法律NLP中的幻觉——在法律工作中理解此问题尤为重要,因为微小的知识冲突可能演变为重大幻觉。Magesh等(2025)证实基于RAG构建的商业法律AI仍存在显著幻觉,而Reuter等(2025)等研究正致力于缓解该问题。我们的发现补充了现有文献,证明即使是相关法律文献也可能导致模型幻觉,这或许源于跨语言迁移或低资源环境中的不确定性。 检索与低资源语言——此问题在低资源语言中更为突出。Sun等(2026)阐明低资源语言对更依赖检索上下文,且当上下文存在噪声时性能下降比高资源语言对更严重。Hu等(2025)进一步指出,尽管无知识推理在不同语言间易于迁移(受二级资源效应影响),但知识检索却难以实现。这或许解释了当查询非高资源语言撰写时,RAG为何频繁失效——模型无法鉴别无关段落与自身推理。 我们的方法也借鉴了Qi等(2025)的研究,该研究将上下文利用率与检索质量分离分析,但我们的方法保持跨多语言查询的一致检索。Mohan等(2026)的研究也支持我们的发现,该研究解释了失效并非源于检索内容本身,而是模型的使用方式——这解释了为何引入检索段落常失效,问题可能出在模型对段落的吸收过程以及低资源领域内多语言迁移的混淆。 达罗毗荼语法律领域的低资源多语言迁移交叉研究尚属空白。图卢语-坎纳达语关联性——在图卢语-坎纳达语桥梁研究范围内,Narayanan和Aepli(2024)证实由于两种语言的密切接触,以坎纳达语作为图卢语的支架似乎是可行选择。Devadiga和Chopra(2026)的研究进一步表明,经坎纳达语训练的大语言模型难以区分图卢语与坎纳达语。我们的结果与此相符:当图卢语以其他达罗毗荼文字书写时,理解度较坎纳达文字版本显著下降。 ## 3 方法论 ### 3.1 任务构建 为探查模型理解图卢语查询的能力,我们撰写了60个描述常见法律情境的句子,每个句子依据斯坦福法律设计实验室的《法律问题分类法》(LIST)标注主要类别(部分类别经过调整)及可能的相关次要类别。模型需利用给定句子(及任何附加上下文)预测图卢语投诉所属类别,并通过60个句子的综合表现进行评估。目标是构建一个能以最小提示对低资源语言投诉进行分类的流程。 ### 3.2 数据与模型 60个图卢语句子均以非正式通用语体描述需要法律分析的情境。句子分别用拉丁文字及三种印度文字(主要为坎纳达文字,也包括马拉雅拉姆文字和泰米尔文字)书写,并翻译成英语作为对照组。法律语料由18份卡纳塔克邦法院文件组成(取自ecourtsindia.com),均用坎纳达语撰写。文件规模不等,从描述常见程序的单段落表格到详述证人证词的25页听证记录。许多语料文件包含图像或使用传统非Unicode字体,提取时产生乱码(损坏的拉丁文本而非标准坎纳达语),需要自动化文本提取。 为修正提取错误,我们采用了AI辅助校正技术。利用Gemini模型,将原始文件与提取文本同时输入,由模型识别并修正基于文本的错误,确保模型参考原始材料而非开放式推理。清洁后的法律文件至少标注一个主要LIST类别,也可标注次要类别。文件仅用于帮助模型理解与查询相似的问题以辅助诊断。 三个模型用于研究跨语言法律迁移: - Llama3:无官方坎纳达语或图卢语支持,但训练数据中包含5%以上的其他30多种语言(未正式记录)。 - Sarvam和Hex-1:均针对包括坎纳达语在内的印度语言训练(不含图卢语),用于测试坎纳达语基础是否有助于理解。 所有模型温度参数设为0.1以保证可复现性;Llama3和Hex-1的重复惩罚系数为1.1。Hex-1的上下文窗口(num\_ctx)提升至8192以防截断。开启Hex-1的思考模式导致仅输出内部推理而无响应;Sarvam的推理消耗了其"入门套餐"全部4000词元,同样无输出,因此两个模型均禁用了思考/推理功能。 嵌入法律文本时,我们最初使用nomic\-embed\-text,后改用multilingual\-e5\-large\-instruct,因为后者生成的嵌入向量范围更广,而非趋近默认中位数。 ### 3.3 实验条件 每个实验条件包含四部分:(1)查询使用的文字和语言,(2)模型是否接受语言提示,(3)模型是否接收来自坎纳达语法律语料的RAG段落,(4)若接受提示,属于稀疏提示还是扩展提示。 提示分为两种变体:稀疏提示包含一段简短图卢语常用词汇(多数未在测试句中出现)和基本语法结构;扩展提示在稀疏提示基础上增加描述法律情境的词汇(如家庭、土地、许可),部分词汇直接出现在60个测试句中。提示块中的图卢语词汇匹配查询文字(如拉丁化图卢语查询对应拉丁化提示词汇),而指令始终为英语。英语对照组不接受提示。 展示给模型的检索段落包含:源案件名称、检索相似度分数及段落自身的LIST类别标签。基线条件包括:带RAG的英语对照查询(条件A),用于测试RAG对高资源查询语言理解的影响;以及不带提示和RAG的拉丁化/坎纳达文字查询(条件G和H),用于测试模型的潜在理解能力。 表1:实验条件定义,依据查询文字、语言提示存在与否及检索增强生成(RAG)使用情况划分。含提示条件(C、D、E、K、L、M)均分别进行稀疏和扩展两种层级测试。 #### 3.3.1 提示设计 每个模型首先接收查询,如适用则提供检索的RAG段落。若使用RAG,模型被指示不要对段落进行分类,而是利用其理解查询描述的情境。随后模型再次接收查询,第三次接收时明确指示不要对检索段落分类。这种重复指令是必要的,否则模型常倾向于对其解释的段落进行分类。
相似文章
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
突厥语族语言机器翻译的跨语言迁移
本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
LLMs中的多语言去学习:迁移、动力学与可逆性
本文通过将TOFU基准扩展到五种语言,研究了LLMs中的多语言去学习。研究发现,去学习迁移因文字和语言家族而异,主要作用于后几层解码层,并且单个引导方向可以恢复跨语言被抑制的大部分知识。
SPLIT:英乌克兰跨语言同理心与文化根基的LLM响应评估
介绍SPLIT,一个包含500条提示的基准测试,用于评估大型语言模型在英语和乌克兰语中的跨语言同理心和文化根基。研究发现,Gemini-2.5-Flash和LLaMA-3.3-70B-Instruct在处理乌克兰语时性能下降,而DeepSeek-V3保持稳定,且人类与AI评估者在文化维度上的一致性较弱。