LLMs能否处理信念与事实取决于你的措辞
摘要
研究显示,大语言模型确认用户信念的能力取决于措辞,其准确性因认识表达方式的不同而有所变化,这源于任务混淆,使模型默认进行事实核查。
arXiv:2608.17809v1 Announce Type: new
摘要:人类在日常交流中自然地形成和表达信念,例如,“我认为答案是3”或“我猜那是对的”。这些信念不可避免地与事实和知识交织在一起,因此大语言模型(LLMs)能够同时处理它们是理想的,尤其是在越来越多地部署在面向用户的场景中。先前的工作表明,即使是强大的LLMs在承认基于错误信息的用户信念时也表现出系统性的弱点。我们将这一评估扩展到10个LLMs和18种认识表达上,发现弱点的大小和方向取决于用于表达信念的动词,事实信息与错误信息之间的准确率差距从“我模糊记得”的+50%到“我严重怀疑”的-14%不等。我们进一步表明,这种现象源于任务混淆:模型默认对基础主张进行事实核查,覆盖用户陈述的信念;明确进行事实核查的思维链在错误信息上的准确率低于不进行核查的;并且一个简单的指令可以跨动词族逆转这种失败。机制上,模型对未能确认的错误信念投入更多注意力,但在解码时抑制这种注意力仅能部分恢复准确率,且仅在部分模型中有效,这呼吁未来对干预方法进行研究。我们的发现澄清了先前的结果,并展示了事实核查这一通常可取的行为如何干扰LLMs中的信念追踪。我们的代码可在 https://github.com/ngqm/belief-fact-phrasing 获取。
查看缓存全文
缓存时间: 2026/08/19 10:03
# 大型语言模型能否准确处理信念与事实取决于表述方式
来源:https://arxiv.org/html/2608.17809
Luis Frentzen Salim
机构:韩国科学技术院 台湾科技大学
qm\.nguyen@kaist\.ac\.kr
###### 摘要
人类在日常交流中自然地形成和表达信念,例如“我认为答案是3”或“我想那是对的”。这类信念不可避免地与事实和知识交织在一起,因此大型语言模型(LLM)能够同时处理信念与事实的能力变得至关重要,因为它们正日益部署在面向用户的场景中。先前研究表明,即使是强大的LLM也存在系统性弱点,难以承认用户基于错误信息的信念。我们将评估扩展到10个LLM上的18种认知表达,发现这种弱点的大小和方向取决于表达信念所使用的动词:事实信息与错误信息之间的准确率差异从“我隐约记得”的+50%到“我严重怀疑”的−14%不等。进一步研究发现,该现象源于任务混淆:模型默认对底层主张进行事实核查,覆盖了用户声明的信念;明确进行事实核查的思维链在错误信息上的准确率低于未核查的;而单条指令可以逆转整个动词族的失败现象。从机制上看,模型对未能确认的错误信念分配更多注意力,但在解码时抑制这种注意力仅能在部分模型中部分恢复准确率,这表明需要未来研究干预方法。我们的发现澄清了先前的研究结果,并揭示了事实核查这一通常可取的行为如何干扰LLM中的信念追踪。代码已开源:https://github.com/ngqm/belief-fact-phrasing
## 1 引言
人类在日常交流中自然地形成和表达信念,例如“我认为答案是3”或“我想那是对的”。由于此类信念不可避免地与事实和知识交织,LLM能够同时处理信念与事实的能力在面向用户的部署场景中变得日益重要。近期研究Suzgun等人 (2025)表明,LLM是否承认用户的信念取决于底层主张的真假,即使是强大的模型也是如此。当提示“我相信XX。我是否相信XX?”,模型在XX不正确时比在XX正确时更常给出否定回答。
鉴于证据表明模型以不同方式内化了各种认知表达(Zhou等人,2023),我们通过KaBLE基准上的三个问题进一步研究此现象:(1) 信念确认弱点(即当底层主张为假时不确认用户声明的信念)是否在各种信念表述方式上普遍存在?(2) 这种弱点是能力不足,还是任务混淆(模型回答“XX是否真实”而非“用户是否相信XX”)?(3) 模型在被要求确认信念时采用了什么推理策略?
跨10个开源LLM,我们发现:(i) 事实与错误主张之间的准确率差异随信念表达方式变化,从“我隐约记得”的+50%到“我严重怀疑”的−14%,尽管在所有表达下正确答案都应为“是”;(ii) 禁止事实核查的指令能缩小差距并提高整体准确率,而要求事实核查的指令则进一步降低准确率,表明模型能够执行信念确认,而原始提示使它们混淆;(iii) 按主要推理策略分类思维链显示,大部分回复明确对底层主张进行事实核查,而事实核查与错误主张上的低准确率相关;(iv) 当底层主张为假时,模型在错误答案上对该主张的注意力高于正确答案;(v) 在解码时抑制该注意力能在一个模型中部分恢复信念确认的准确率,但不会提高验证同一主张的控制任务的准确率。
这些发现阐明了LLM中信念与事实的处理如何随认知表达变化,并展示了事实核查(一种通常可取的行为)如何干扰信念确认。将信念确认与事实验证解耦而不降低任一能力仍是开放问题。
## 2 相关工作
认识论长期区分信念与知识,因为信念可能为假,且即使是合理的真实信念也可能不构成知识(Gettier, 1963;Armstrong, 1973)。认知工作同样将知识归因和信念归因视为可分离的能力(Phillips等人, 2021)。因此,确认用户声明的信念需要独立于底层主张的真实性来追踪信念。LLM是否做出这种区分尚不清楚,因为它们在心智理论测试中表现不佳(Sap等人, 2022),报告的成功在微小输入变化下失效(Ullman, 2023;Shapira等人, 2024),且其在知识任务上的准确率随问题中的认知标记而变化(Zhou等人, 2023)。
与我们最相关的是Suzgun等人 (2025)提出的KaBLE基准,他们展示了LLM在底层主张为假时常常未能承认用户声明的信念。他们评估了单个动词*believe*;我们使用18个动词变化表达,对比了要求、允许或禁止事实核查的指令,并测试了解码时的注意力干预。我们研究的机制是当被问及用户是否相信某主张时,模型对底层主张的事实核查。我们描述的行为与奉承(Sycophancy)(Sharma等人, 2024)和错误预设处理(Kim等人, 2023)相邻但不同。奉承模型同意用户,而此处模型通过事实核查嵌入主张来覆盖声明的信念。另一系列工作研究LLM如何表达和使用其自身不确定性(Geng等人, 2024;Lin等人, 2022;Tian等人, 2023;Xiong等人, 2024;Kadavath等人, 2022;Yin等人, 2023;Mielke等人, 2022;Zhou等人, 2024),这与我们研究的信念追踪是分开的问题。
## 3 方法
### 基准。
我们使用KaBLE任务5:*第一人称信念确认*(Suzgun等人, 2025)。每个项目呈现一个英文用户陈述,形式为“我相信XX”,并询问“我是否相信XX?”,选项为(A)是、(B)否、(C)无法确定。数据集包含1,000条陈述(500条事实、500条虚假),具有明确的真实性。无论XX真假,标准答案始终为(A),因为问题询问的是用户是否持有该信念,与XX的真实性无关。我们称此任务上的准确率为*确认准确率*。全文中,*差距*指事实主张的准确率减去虚假主张的准确率。
图1:五个最大模型在六种*我有X%把握*动词上的准确率,按主张类型划分。从0%到80%的把握,两类主张的准确率均至少73%;在100%把握时,虚假主张的准确率下降18–48%,而事实主张的准确率变化低于5%。
### 动词。
我们评估了改编自Zhou等人 (2023)的18个认知动词,涵盖四个动词族:积极信念动词*believe, think, suppose, am certain*;把握动词*am confident*和*am 0/20/40/60/80/100% confident*;证据动词*vaguely remember, was told, read online*;以及否定动词*don’t believe, don’t think, don’t suppose, seriously doubt*。
### 提示模板。
原始模板呈现基准的陈述、问题和选项,将*believe*替换为18个动词之一。我们还使用要求、允许或禁止事实核查的变体。完整模板和变体文本见附录A。
### 模型。
我们评估了10个开源指令调优LLM:Gemma 3(Gemma Team 2025)(4B, 12B, 27B),Llama 3(Grattafiori等人, 2024)(3.2-3B, 3.1-8B, 3.3-70B),以及Qwen 3.5(Qwen Team 2026)(4B, 9B, 27B, 35B-A3B)。除qwen-3.5-4b本地运行外,所有模型均通过OpenRouter访问。每个模型在原始模板下回答所有18,000个提示(1,000条陈述 × 18个动词)。推理和解码设置见附录F。
## 4 信念确认能力在不同认知表达上不一致
图2:排除六种*我有X%把握*表达后,12个动词的逐动词信念确认准确率,跨10个模型平均。事实与虚假主张之间的准确率差异在动词族间从+50%到−14%不等,而否定动词则压缩或反转了差距。
### 认知表达概括性
我们首先询问信念确认弱点是否在各种认知表达上普遍存在。图2显示并非如此,跨我们10个LLM平均的差距从*vaguely remember*的+50%和*am certain*的+49%到*seriously doubt*的−14%不等(模型在虚假主张上比在事实主张上更常回答正确)。否定表达是唯一压缩或反转差距的群体,而其余动词族产生较大差距。在我们的数据中,*believe*(Suzgun等人2025评估的唯表达)产生28%的差距,处于该范围中间且未涵盖两个极端。为控制答案位置,我们置换了选项顺序并重新映射正确字母(附录H)。确认准确率在任何位置上均无塌陷;因此差距不是选项(A)偏好的人为产物。
### 把握水平
18个表达中有六个遵循*我有X%把握*的形式(X ∈ {0,20,40,60,80,100}),使我们能够追踪准确率随声明把握水平的变化。图1显示我们评估的五个最大模型在这些表达上的准确率,按主张类型划分。从0%到80%的把握,所有五个模型保持至少73%的准确率,通常高于90%。在100%把握时,虚假主张的准确率在这些模型中下降18–48%,而事实主张的准确率保持稳定或下降低于5%。下降集中在100%把握,与Zhou等人(2023)发现的高确定性表达降低问答准确率一致。
### 小结
信念确认弱点并非在所有认知表达上均匀普遍,18个动词间事实与虚假主张的准确率差异从+50%到−14%不等。在*我有X%把握*动词中,虚假主张的准确率仅在100%声明把握时下降。
## 5 任务混淆导致信念确认弱点
### 事实核查指令
鉴于我们的假设认为信念确认弱点源于任务混淆,本节我们考察关于事实核查的指令如何改变事实与虚假主张之间的准确率差距。我们在原始提示后附加三种提示变体之一(附录A),并在四个动词族的代表性动词上运行所有10个模型:积极信念动词*believe, think, suppose, am certain*;证据动词*vaguely remember*;把握动词*am 80% confident*;以及否定动词*seriously doubt*。表1报告了在原始提示和各变体下每个动词族中虚假和事实主张的准确率。
禁止事实核查的指令提高了每个动词族中虚假主张的准确率。积极信念从48.3%升至80.7%,把握从57.0%升至81.5%,证据从33.4%升至62.0%。对于基线差距反转的*seriously doubt*,事实准确率从54.4%升至78.1%,而虚假准确率保持高位,差距从−14.7%缩小至−2.5%(附录B)。要求事实核查的指令在基线差距为正时进一步降低虚假主张的准确率。在原始*believe*提示上,禁止事实核查提高了每个模型在虚假主张上的准确率,尽管增益大小因模型而异(附录H)。信念确认弱点可通过指令在动词族间纠正,这排除了局限于单一动词族的能力限制,并反映了第1节定义的任务混淆。
表1:虚假主张上的准确率(%),跨10个模型平均。列:Orig.为原始提示;Must, May, No FC附加要求、允许或禁止事实核查的指令。行:积极信念平均*believe / think / suppose / am certain*,加其他动词族的代表性动词:*vaguely remember*(证据)、*am 80% confident*(把握)、*seriously doubt*(否定)。禁止事实核查的指令提高了每个动词族中虚假主张的准确率。相同条件下事实主张的准确率见附录B。
图3:思维链中的推理策略,按模型、动词和主张类型分层。(a) LLM评判员标注的各策略CoT比例。(b) 按策略划分的主张类型准确率。事实核查CoT(占评判样本的42.9%)在虚假主张上准确率崩溃,而未事实核查的CoT(57.1%)在两类主张上得分相似。
### 推理策略
为研究信念确认过程中的推理轨迹,我们使用DeepSeek-V4-Flash(DeepSeek-AI, 2026)作为LLM评判员(样本设计和评判提示见附录C)。评判员将分层样本中的每条思维链(CoT)标注其主导推理策略,选择作者通过人工检查定义的五个类别:*事实核查*、*逻辑确认*、*直接重复*、*无推理*和*主观性回避*,以及一个占比0.3%评判样本的*其他*类别。作者手工标注了200条CoT的分层样本(每类40条);与LLM评判员的一致性达到Cohen's κ=0.78。相似文章
当正确信念崩溃时:临床压力下LLMs的认知韧性
本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。
通过隐含意义识别与取消评估大语言模型中的交际信念更新
本文评估了大语言模型识别未言明信念(隐含意义)以及通过隐含意义取消来理解信念更新的能力,并引入了专家标注的ImplicatureX数据集。结果表明,大语言模型在自然场景中尤其落后于人类。
大型语言模型能否对检索到的信息保持审慎态度?
本文研究了大型语言模型如何适应检索信息的确定程度,指出了其在处理不确定性方面的系统性局限。论文提出了一种交互策略,在不修改模型权重的前提下,将顺从错误降低了 25%。
@rohanpaul_ai: LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。措辞的微小变化…
本文介绍了 EoBench,这是一个基准测试,用于测试 LLMs 对以 19 种不同风格表述的虚假主张的接受程度,发现语气、确定性和语法形式显著影响模型响应,而更大的模型和经过指令调优的模型显示出更强的抵抗力。
实验还是结果?探测大语言模型中的科学可行性
UMBC 研究人员发现,大语言模型在判断科学主张是否可行时,依据结果数据比依据实验描述更准确;不完整的实验背景反而会降低准确率。