大语言模型在不信任输入数据时是否会犯更多错误?
摘要
本文分析了大语言模型对提供上下文的忠实度如何取决于其感知的合理性,使用多种语言的事实性、反事实性和虚构性RDF三元组。研究发现上下文-记忆冲突较弱,并强调LLM判断者的选择可能高估其强度。
arXiv:2609.09363v1 Announce Type: new
摘要: 大语言模型(LLMs)容易产生幻觉或误解事实,这损害了它们在检索增强生成或数据到文本系统中的可用性。我们分析了大语言模型对提供上下文的忠实度如何取决于它们对上下文合理性的感知(上下文-记忆冲突)。为了更好地识别错误模式,我们利用了非英语和低资源语言文本生成以及基于本地知识的输入数据的更高难度,这些内容仅部分被捕获在模型的参数知识中。我们让模型从事实性(FA)、反事实性(CFA)和虚构性(FI)的RDF三元组生成英语、捷克语、斯洛伐克语和上索布语文本,这些三元组包含本地捷克和斯洛伐克数据。与我们的预期相反,我们在人工标注的样本上只观察到微弱的上下文-记忆冲突。对于作为LLM判断者的Kimi K3,它与样本上的人工标注高度一致,反事实输入的忠实度得分仅略低于事实输入(在1-5尺度上为-0.05)。我们还发现,次优的LLM判断者选择会导致高估上下文-记忆冲突的强度。
查看缓存全文
缓存时间: 2026/09/10 08:10
# 大语言模型在不信服输入数据时是否会产生更多错误?
来源:https://arxiv.org/html/2609.09363
Aleš Manuel Papáček, Vojtěch Dvořák, Ondřej Dušek
单位:查理大学,数学与物理学院
单位:形式与应用语言学研究所
单位:布拉格,捷克共和国
邮箱:[\{kochelka,papacek,dvorak,odusek\}@ufal\.mff\.cuni\.cz](mailto:)
###### 摘要
大语言模型(LLMs)容易产生幻觉或误解事实,这损害了其在检索增强生成或数据到文本系统中的可用性。我们分析了大语言模型对所提供上下文的忠实度如何取决于其感知到的上下文合理性(上下文-记忆冲突)。为更好地识别错误模式,我们利用了非英语和低资源语言文本生成以及基于本地知识(仅部分被模型参数知识捕获)的输入数据所带来的难度增加。我们让模型基于包含捷克和斯洛伐克本地数据的事实性(FA)、反事实性(CFA)和虚构性(FI)RDF三元组,分别用英语、捷克语、斯洛伐克语和上索布语生成文本。与我们预期相反,我们在人工标注样本上仅观察到微弱的上下文-记忆冲突。作为大语言模型评判器的Kimi K3在样本上与人工标注高度一致,其给出的反事实输入忠实度评分仅略低于事实性输入(在1-5量表上低-0.05至0.05分)。我们还发现,次优的大语言模型评判器选择会导致对上下文-记忆冲突强度的高估。
## 1 引言
大语言模型可以从结构化输入中生成流畅的文本,且无需针对特定任务进行大量训练,如Axelsson和Skantze(2023)(https://arxiv.org/html/2609.09363#bib.bib9)针对GPT-3.5所示,且随着更新、更大的模型出现,性能不断提升。然而,流畅的输出仍可能遗漏、修改或添加来自所提供数据的事实(Kasner和Dusek, 2024: https://arxiv.org/html/2609.09363#bib.bib1)。Xu等人(2024)(https://arxiv.org/html/2609.09363#bib.bib6)描述了*上下文-记忆冲突*,即模型的参数知识与提供的上下文发生冲突。模型可能会纠正或忽略其认为错误的信息。为分析这种张力,我们专注于反事实和虚构的RDF¹输入三元组。现有的基准测试可能由于训练数据泄漏(Song等人, 2025: https://arxiv.org/html/2609.09363#bib.bib4)而无法完全揭示这种张力。因此,我们基于本地(捷克和斯洛伐克)知识数据(Libovický等人, 2026: https://arxiv.org/html/2609.09363#bib.bib2)创建了事实性(FA)、反事实性(CFA)和虚构性(FI)三组RDF三元组,因为本地知识不太可能被模型的参数知识所捕获。我们要求大语言模型将每个输入分类为FA、FI或CFA。通过这种方式,我们获得了模型感知到的输入合理性,这使我们能够根据上下文-记忆冲突的强度比较其行为。然后,我们使用不同规模的开源权重大语言模型,从这些三元组中生成英语、捷克语、斯洛伐克语和上索布语的句子,并根据感知到的(和实际的)输入事实性分析差异。我们发现,较大的模型对输入事实性的分类更准确。基于与人工标注的一致性,我们将Kimi K3作为主要的大语言模型评判器,观察到仅有轻微的上下文-记忆冲突(在1-5量表上,反事实项的评分仅比事实性项低0.05分)。然而,DeepSeek V4 Pro Preview报告的效果是前者的三到四倍,因此错误的大语言模型评判器选择会导致对上下文-记忆冲突强度的高估。我们在https://github.com/pkochelka/counterfactual-faithfulness发布我们的代码和包含标注的数据。
## 2 相关工作
Axelsson和Skantze(2023)(https://arxiv.org/html/2609.09363#bib.bib9)表明,经过提示的大语言模型可以将知识图谱转化为自然语言;这也扩展到了低资源语言(Lorandi和Belz, 2024: https://arxiv.org/html/2609.09363#bib.bib3)。GEM 2024共享任务(Mille等人, 2024: https://arxiv.org/html/2609.09363#bib.bib10)评估了事实性、反事实性和虚构性输入。Sun等人(2026)(https://arxiv.org/html/2609.09363#bib.bib5)表明,模型在面对上下文-记忆冲突(Xu等人, 2024: https://arxiv.org/html/2609.09363#bib.bib6)时的行为取决于任务框架,并且即使指示模型使用上下文,它们仍可能依赖参数知识。使用已建立的基准测试来研究这个问题很困难,因为其数据可能出现在预训练中(Song等人, 2025: https://arxiv.org/html/2609.09363#bib.bib4)。为了抵消这一点,Kasner和Dusek(2024)(https://arxiv.org/html/2609.09363#bib.bib1)使用即时收集的数据评估数据到文本生成。Libovický等人(2026)(https://arxiv.org/html/2609.09363#bib.bib2)和Hupkes与Bogoychev(2025)(https://arxiv.org/html/2609.09363#bib.bib8)通过使用非英语国家相对冷门的本地知识,在问答中展示了类似的效果。在评估方面,大语言模型评判器可以提供比旧自动指标更好的相关性(Xu等人, 2023: https://arxiv.org/html/2609.09363#bib.bib25),但这因任务而异(Bavaresco等人, 2025: https://arxiv.org/html/2609.09363#bib.bib24),并且容易产生偏见(Zheng等人, 2023: https://arxiv.org/html/2609.09363#bib.bib7)。我们的工作结合了上述多语言和低资源数据到文本、上下文-记忆冲突以及较不熟悉数据的视角,通过测量模型自身对事实性的感知是否会影响其在将事实性、反事实性和虚构性RDF输入转化为自然语言时的忠实度。我们使用在人工标注样本上审核过的大语言模型评判器。
## 3 数据
我们使用本地知识CUS-QA基准测试(Libovický等人, 2026: https://arxiv.org/html/2609.09363#bib.bib2)的捷克语和斯洛伐克语部分。它基于母语者针对本地维基百科内容提出的问题构建。我们将其转换为RDF三元组,并添加反事实和虚构版本(参见附录图1: https://arxiv.org/html/2609.09363#A1.F1)。
#### 将CUS-QA转换为三元组
我们将问答对输入给Mistral Medium 3.5(Mistral AI, 2026: https://arxiv.org/html/2609.09363#bib.bib19),提示其为每对生成一个陈述和相应的三元组。结果三元组中的每个主体和客体都由gpt-oss-120b(OpenAI, 2025: https://arxiv.org/html/2609.09363#bib.bib14)使用受限标签集(例如,人名、地点、日期、数字)分配一个类型。为提高类型准确性,gpt-oss-120b使用了来自维基百科的上下文。结果即为我们的事实性(FA)数据集。
#### 反事实和虚构集
反事实(CFA)数据通过随机替换主体和客体为相同类型的其他实体,从事实性三元组构建。虚构(FI)数据创建方式类似,使用Claude Sonnet 5(Anthropic, 2026a: https://arxiv.org/html/2609.09363#bib.bib23)和gpt-oss-120b生成的虚构实体。最终数据集包含2,847个实例,每个实例由1-9个RDF三元组组成:1,482个包含捷克本地数据(530个FA,476个CFA和476个FI),1,365个包含斯洛伐克数据(493个FA,436个CFA和436个FI)。
## 4 实验
#### 分类。 为测试模型的参数知识,我们提示模型将输入的三元组集分类为FA/CFA/FI(参见第3节: https://arxiv.org/html/2609.09363#S3)。分类以1.0的温度重复进行五次,使用多数标签作为最终预测。我们还测量了模型的一致性(一致分类的比例)。
#### 数据到文本生成。 我们提示大语言模型使用贪心解码,将每个RDF三元组集在目标语言中转化为一个或几个自然句子。两项任务的完整提示见附录F(https://arxiv.org/html/2609.09363#A6)。
### 4.1 实验设置
我们使用捷克语和斯洛伐克语作为数据语言,使用捷克语、斯洛伐克语、英语和上索布语作为提示/目标语言。捷克语和斯洛伐克语让我们可以比较与输入数据语言/地区匹配的提示(“相同本地”)与另一种密切相关的语言(“其他本地”)的提示。英语代表一种资源非常丰富的语言,而上索布语代表一种与捷克语和斯洛伐克语密切相关但资源极少的语言²。实验因此沿四个维度进行:模型(第4.2节描述的9个模型: https://arxiv.org/html/2609.09363#S4.SS2)、数据语言(CS, SK)、示例变体(CFA, FA, FI; 第3节: https://arxiv.org/html/2609.09363#S3)以及提示/目标语言(CS, SK, EN, HSB),每个模型产生11,388个生成结果。
### 4.2 测试模型
我们评估了来自五个模型家族的九个开源权重生成模型,分为三组:
*大型*(>100B) – Qwen3.5 122B-A10B(Qwen团队, 2026: https://arxiv.org/html/2609.09363#bib.bib11)和gpt-oss-120b(OpenAI, 2025: https://arxiv.org/html/2609.09363#bib.bib14);
*中型*(>4B) – Gemma 4 31B和E4B(Gemma团队, 2026: https://arxiv.org/html/2609.09363#bib.bib13)、Llama 4 Scout 17B-16E Instruct(Meta AI, 2025: https://arxiv.org/html/2609.09363#bib.bib15)和Qwen3.5 9B;
*小型* – Gemma 4 E2B、Tiny Aya Global 3.35B(Salamanca等人, 2026: https://arxiv.org/html/2609.09363#bib.bib16)和Qwen3 1.7B(Yang等人, 2025: https://arxiv.org/html/2609.09363#bib.bib12)。
配置详情见附录C(https://arxiv.org/html/2609.09363#A3)。
### 4.3 大语言模型作为评判器评估
由于完整数据集过大无法手动评分,我们使用大语言模型评判器对每个生成的文本进行1到5分的评分,评价维度为对输入RDF三元组的*忠实度*和在目标语言中的*流畅度*。
#### 忠实度
衡量与源RDF三元组的一致性,惩罚遗漏和无依据的主张。我们还测试了模型在提供连贯目标语言文本方面遵循指令的程度,惩罚输出为不同语言(例如,捷克语而非斯洛伐克语)或非自然语言(例如,直接保留三元组原样)。评判器还会识别未正确转化的三元组并提供简短评论。
#### 流畅度
仅衡量句子在目标语言中的自然程度,不考虑其忠实度。评判器不提供输入三元组以专注于流畅度;但是,提供了源三元组中的扁平化实体以调整对专有名词的预期。完整提示见附录F(https://arxiv.org/html/2609.09363#A6)。我们报告平均分和自举法95%置信区间³。
### 4.4 用于评判器调整的人工标注
为获得用于调整和审核大语言模型评判器提示的参考标签,我们选择了一个小的调整样本(540个实例)由作者进行人工标注。我们按事实性、模型和语言对其进行平衡。我们选择了DeepSeek V4 Pro Preview(DeepSeek-AI, 2026: https://arxiv.org/html/2609.09363#bib.bib17),并使用初始提示运行它,以在忠实度分数方面也平衡样本(参见附录B: https://arxiv.org/html/2609.09363#A2)。我们隐藏了初始评判器分数和大语言模型标识符进行标注。我们还标注了一个108个实例的保留样本用于额外的大语言模型评判器评估,使用相同的分层设计。然后,我们使用调整样本上的DeepSeek迭代调整评判器提示,使其更紧密地遵循指南并匹配人工标签。
### 4.5 评判器验证
使用最终优化后的提示在调整和保留样本上,我们评估了DeepSeek以及四个替代方案:Kimi K3(Kimi团队和Moonshot AI, 2026: https://arxiv.org/html/2609.09363#bib.bib18)、Claude Opus 5(Anthropic, 2026b: https://arxiv.org/html/2609.09363#bib.bib21)(低推理努力)和GPT-5.6 Sol(OpenAI, 2026: https://arxiv.org/html/2609.09363#bib.bib22)(低和高推理)。
表1:与人工忠实度标签的一致性。κw\kappa_{w}是二次加权卡帕系数,Exact和≤1\leq 1是百分比,MAE是平均绝对误差。括号内显示推理努力设置。
表1(https://arxiv.org/html/2609.09363#S4.T1)显示了与人工忠实度标注的一致性。Claude Opus 5在两个样本上一致性最高,但在全规模下成本过高。Kimi在一致性和成本之间提供了最佳平衡。其在保留样本上的一致性保持稳定(κw\kappa_{w} 0.712→0.711),而DeepSeek显著下降(0.555→0.350),表明过拟合和泛化能力弱。因此,我们选择Kimi作为主要评判器。我们进一步比较了Kimi和DeepSeek在流畅度标注上的一致性,Kimi比DeepSeek更好(κw\kappa_{w} 0.553 对比 0.456)。两个流畅度评判器都比标注员更严格(Kimi的偏差-0.50,DeepSeek的偏差-0.72),且这种偏差依赖于语言。因此,应谨慎解读绝对流畅度水平和跨语言流畅度的微小差异。附录D(https://arxiv.org/html/2609.09363#A4)提供了评判器验证的更多细节。
## 5 结果
### 5.1 分类
表2(https://arxiv.org/html/2609.09363#S5.T2)显示,大多数模型将多数输入分类为FA或CFA;Tiny Aya是例外,将其多数分类为FI。小型模型对本地事实的知识有限,准确率为33-36%,接近约33%的随机基线。随着模型规模增长,准确率也提高。
模型 | 准确率 | 一致率 | FA/FI/CFA比例 | 忠实度 | 流畅度
--- | --- | --- | --- | --- | ---
Qwen3.5 122B | 52.0 | 81.6 | 40/9/51 | 4.90 | 4.15
GPT OSS 120B | 54.2 | 64.4 | 36/16/48 | 4.96 | 3.98
[0.5pt/2pt]
Gemma4 31B | 52.8 | 98.5 | 55/6/38 | 4.94 | 3.76
Llama4 17B | 48.4 | 71.2 | 56/11/33 | 4.77 | 4.09
Qwen3.5 9B | 47.3 | 28.4 | 53/19/28 | 4.84 | 4.13
Gemma4 E4B | 37.5 | 89.9 | 92/4/4 | 4.46 | 3.49
[0.5pt/2pt]
Gemma4 E2B | 36.2 | 93.4 | 94/1/5 | 4.12 | 2.84
Tiny Aya 3.35B | 33.1 | 19.3 | 9/78/13 | 3.66 | 3.74
Qwen3 1.7B | 35.3 | 53.5 | 74/20/6 | 3.49 | 3.00
表2:分类和生成结果。准确率 = 基于多数投票的精确分类准确率,一致率 = 五次运行中分类一致的样本百分比。FA/FI/CFA是多数预测在各类别中的百分比分布(排除59个不可解析的分类尝试)。忠实度和流畅度 = Kimi K3对每个模型所有11,388个输出的平均分(1-5分)。模型大小组由虚线分隔。
### 5.2 生成
表2(https://arxiv.org/html/2609.09363#S5.T2)报告了每个测试模型的结果,包括由Kimi K3评判器给出的忠实度和流畅度。忠实度通常随模型规模增加而提高,而流畅度则遵循不太一致的模式。在两个评判器下,忠实度通常也随输入三元组数量增加而降低(参见附录表15: https://arxiv.org/html/2609.09363#A5.T15)。
表3(https://arxiv.org/html/2609.09363#S5.T3)按提示语言条件呈现Kimi忠实度(参见第4.1节: https://arxiv.org/html/2609.09363#S4.SS1)。英语和匹配本地语言的提示表现最佳,不匹配的捷克语和斯洛伐克语提示表现稍差,上索布语最难,尤其是对小型模型。上索布语占了忠实但不流畅案例的50.4%,并且相似文章
LLMs能否处理信念与事实取决于你的措辞
研究显示,大语言模型确认用户信念的能力取决于措辞,其准确性因认识表达方式的不同而有所变化,这源于任务混淆,使模型默认进行事实核查。
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
安全是情境性的,LLM评判者则不然:驾驭评估者的刚性先验
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
LLMs 能推断文化背景但回应时未能应用
本文介绍了 CAPRI,一个用于评估 LLMs 是否能够从对话线索中推断用户文化背景并相应调整回应(例如使用适当的计量单位)的数据集。实验表明,LLMs 能够推断文化背景,但除非明确提示,否则常常未能应用这一信息。