信念与现实分离存在于语言模型中对共享值槽的路由中

arXiv cs.CL 论文

摘要

本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。

arXiv:2607.11945v1 Announce Type: new 摘要:强大的语言模型能够区分角色所相信的内容与实际情况:当被告知“安娜相信杯子是蓝色的;实际上它是红色的”时,它们会回答蓝色(关于安娜)和红色(关于现实)。这种分离存在于计算的哪个环节?我们表明它依赖于两个位置上的两个可分离机制。一个通用值槽绑定属性值。查询位置上的路由器选择查询读取的框架(角色的信念或现实)。两条路径填充该值槽:断言信念,其值由文本提供,直接绑定;衍生信念,其值必须从角色能看到的内容推断,通过可见性门控的回溯到达。基于任一路径训练的子空间可以引导另一路径,只有衍生路径依赖于描述的可见性。值槽本身不携带信念-现实标签:对其干预会同样强烈地影响现实读取和信念读取。相反,分离存在于一对解耦的路由子空间中,这些子空间在不注入捐赠者值的情况下在框架之间切换查询。这些结果在三种架构上成立,并且刺激因素消解了心理理论基准的捷径;该行为本身在五个模型家族中的3B到7B参数规模之间出现。本文深入发展了单一的信念-现实轴;姊妹篇论文表明相同的槽与路由器格式也共享于句子可以打开的其他非实际语境(反事实、虚构、时间性)。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# Belief-reality separation lives in routing over a shared value slot in language models
Source: https://arxiv.org/abs/2607.11945
View PDF (https://arxiv.org/pdf/2607.11945)

> 摘要:有能力的语言模型能够区分角色所相信的内容与事实:当听到“Anna认为杯子是蓝色的;而实际上它是红色的”,模型会回答蓝色(关于Anna)和红色(关于世界)。这种分离在计算中存在于何处?我们表明它依赖于两个位置上的两个可分离机制。一个通用的值槽绑定被归因的值。查询位置上的一个路由器选择查询读取的是哪个框架——角色的信念还是现实。两种路由方式填充该值槽:断言信念,其值由文本直接提供并直接绑定;推导信念,其值必须从角色能看到的内容推断而来,通过可见性门控的回看机制到达。在任一路由上训练的子空间都能控制另一条路由,且仅推导路由依赖于所描述的可见性。该值槽本身不携带信念-现实标签:对其干预移动现实读出的效果与移动信念读出的效果一样强。实际上,分离存在于一对解耦的路由子空间中,它们在不注入捐赠者值的情况下将查询在框架间切换。这些结果在三种架构上成立,使用了针对心理理论基准捷径进行去混淆的刺激;该行为本身在五个模型家族中于3B到7B参数规模之间涌现。本文深入发展了单一的信念-现实轴;一篇配套论文表明,相同的槽-路由器格式也共享于句子可以开启的其他非实际语境(反事实、虚构、时间)中。

## 提交历史

来自:Oliver Steele \[查看邮件 (https://arxiv.org/show-email/9b724ba1/2607.11945)\] **\[v1\]** 2026年7月11日星期六 10:39:03 UTC (440 KB)

相似文章

信念记忆:部分可观测性下的智能体记忆

arXiv cs.AI

本文介绍了 BeliefMem,一种专为大语言模型(LLM)智能体设计的新型记忆范式。该范式通过存储带有概率的多个候选结论来处理部分可观测性问题,并减少自我强化错误。在 LoCoMo 和 ALFWorld 基准测试中的实证评估显示,该方法优于确定性基线模型。

语言模型中基于单元的关系绑定表示

arXiv cs.CL

研究表明,大型语言模型通过“基于单元的绑定表示”(CBR)对篇章级关系绑定进行编码:一种低维线性子空间,每个“单元”对应实体-关系索引对,为模型如何追踪实体与关系提供了因果证据。

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。