人类与推理模型在溯因推理中的思维努力对齐

arXiv cs.CL 论文

摘要

本文探讨人类与大型推理模型在溯因推理中思维努力的对齐性,发现两者在努力和错误上存在相似之处,并证明解码方法能增强这种对齐。

arXiv:2609.01867v1 公告类型:新 摘要:认知建模中的一个主要问题涉及大型语言模型与人类在语言和非语言任务中的行为对齐。与标准LLM不同,大型推理模型(LRMs)通过可验证奖励的强化学习进行优化,鼓励推理任务的正确解决方案而非偏好对齐的响应。最近的研究(de Varda et al., 2025)通过比较人类反应时间与模型推理轨迹在一系列推理任务中,研究了人类和LRMs中的思维成本。我们通过转向溯因推理来隔离这种对齐:与演绎任务不同,其难度无法从形式结构中推断,且不提供模型可以利用的捷径来模仿努力而无需真正搜索,为共享努力的经验主张提供了更坚实的基础。我们进一步发现LRM与人类推理努力对齐的证据,以及模型和人类倾向于犯相似错误的证据。最后,我们表明,允许模型探索多个推理路径的解码方法增加了人类与LRMs在测试的三个模型中推理成本的对齐。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:48

# 溯因推理中人类与推理模型的思维努力对齐研究  
来源:https://arxiv.org/html/2609.01867  

###### 摘要  
认知建模领域的一个核心问题在于:大语言模型与人类在语言及非语言任务中的行为一致性。与常规大语言模型不同,**大型推理模型**通过基于可验证奖励的强化学习进行优化,侧重于生成推理任务的正确解,而非追求偏好对齐的回应。近期研究(de Varda 等人,2025)通过对比人类反应时与模型推理轨迹,考察了人类与大型推理模型在思考过程中的成本差异。我们聚焦于溯因推理来剖析这种对齐性:与演绎任务不同,溯因推理的难度无法从形式结构推断,且不存在可供模型模仿努力过程的捷径,这为“共享思维努力”的经验性主张提供了更坚实的基础。研究进一步发现了大型推理模型与人类思维努力对齐的证据,同时也表明模型与人类倾向于产生相似的错误。最终,我们证明允许模型探索多条推理路径的解码方法,能够在测试的三个模型中提升人类与大型推理模型在推理成本上的对齐程度。  

## 1 引言  
越来越多的研究致力于探索大语言模型作为人类语言处理与认知模型的可能性。总体而言,对于人工神经网络模型在多大程度上可作为通用问题求解器仍存在争议,尤其在面对分布外问题时。评估人类与模型在语言及通用推理方面的一致性存在明显张力,部分源于“语言能力是思维基础”这一假设。功能性磁共振成像证据表明**语言网络**与**多重需求网络**存在分离。语言网络是一组特异于左半球额颞叶的脑区,对语言具有高度选择性,并在语言解码与编码中起因果作用。多重需求网络则广泛活跃于多种功能,包括归纳推理、数学与新问题解决。一项关于训练过程中大语言模型与大脑对齐的研究显示,语言网络主要与形式语言规则相关,而与世界知识和推理的相关性较弱。此外,失语症患者的经验证据表明逻辑推理并不依赖于自然语言。这些发现可能解释了为何大语言模型学习句法表征快于世界知识,却在逻辑问题上表现不佳。  

**大型推理模型**通过采用**基于可验证奖励的强化学习**这一微调阶段的奖励机制,规避了传统大语言模型训练中常见的缺陷,该机制优化了推理任务的正确答案生成。大型推理模型产生的“思维链”作为推理过程的语言化轨迹,可作为计算成本的代理指标。此外,大型推理模型能在推理时为更难的问题分配更多令牌,这是人类认知的重要特征。虽然大型推理模型和大语言模型在思维链中均输出令牌序列,但底层计算是否具有语言性仍不明确。退化或语言混合的轨迹仍可带来效益,且无意义的填充令牌可在某些任务中替代思维链。更进一步,推理可在潜在空间中完全进行而不生成语言令牌,表明语言表层与计算过程可分离。正如de Varda等人(2025)指出,思维链输出的语言轨迹可能未忠实反映底层计算过程,原因可能在于真正的“思维”机制如人类一样是非语言的。  

### 1.1 相关工作  
近期,de Varda等人(2025)研究了大型推理模型推理轨迹(以令牌计数衡量)与人类反应时在七类推理任务中的对齐性。在测试DeepSeek-R1时,他们发现模型能可靠地追踪人类思维努力,无论是在任务内部还是跨任务。该研究还对五个额外的开放权重推理模型进行了复现。这项工作短期内引发了广泛讨论。部分研究者对大脑与大型推理模型之间的算法对应关系持怀疑态度。重要的是,对此类对齐性的研究并非机制性论断,而是可能解释不同基质间相似约束的经验现象。其他批评则聚焦于思维链作为思维努力度量的效度,我们通过测试多种解码策略与推理努力水平部分回应了这一质疑。理论上,此类观察与符号处理能否从亚符号架构中涌现的争议性辩论密切相关。  

### 1.2 溯因推理  
我们考察人类与模型在溯因推理中的思维努力对齐性。溯因推理由皮尔斯提出,通常被理解为一种有根据的猜测或最佳解释。更正式地说,它是形成一个假设以解释欠确定性前提的过程。溯因推理是日常不确定性环境中普遍存在的自然推理形式。例如,早晨看到湿润的草坪,可提出多种溯因解释:邻居昨晚浇灌了草坪、附近水井开始溢出、喷淋系统产生意识并反叛,或可能下过雨。它区别于归纳与演绎,且被认为是对科学解释对象生成假设的核心工具,也是语篇中推弦外之音的关键。在人类-模型对齐研究中,溯因推理是独特的富有成果的推理类型。在三段论与演绎任务中,问题的难度可部分从形式结构推断;学习了相关推理图式的模型可能在看似更难的题目上生成更多令牌,而非进行真正的搜索。溯因推理缺乏此特性:由于证据对结论具有设计上的欠确定性,此类捷径不可用,为共享努力提供了更强证据。例如,考虑两个表面长度相似的三段论:  
- (1) 所有A都是B;所有B都是C;因此所有A都是C。(简单格)  
- (2) 有些A不是B;所有C都是B;因此有些A不是C。(较难格)  
学习了哪些形式较难的模型可能为(2)分配更多令牌,这反映的是记忆的结构性难度线索而非共享努力。在我们的溯因任务中,没有形式标记能暗示哪个答案正确或区分难度如何。难度仅源于搜索每个假设所能解释的内容。  

### 1.3 大语言模型中的溯因推理  
大语言模型溯因能力的研究近期引起关注(综述见Salimi等人,2026)。相关研究覆盖了三段论形式、常识假设选择/生成以及医疗诊断。多数先前研究发现大语言模型在溯因推理上表现不佳,且始终逊色于人类。明确推断最佳解释的标准也已被证明能改善基于模型的常识解释评估。  

### 1.4 溯因推理数据集  
我们将溯因操作化为一项强制选择任务:呈现两个候选假设作为对两个观察现象的可能解释,采用最佳解释推断范式。通过在线实验,我们收集了120名参与者的数据,记录准确率与反应时。实验材料取自Bhagavatula等人(2020)基于ROCStories改编的常识数据集(该数据集源自叙事短篇故事语料)。Bhagavatula等人(2020)使用故事的开头与结尾作为观察现象,招募参与者生成解释状态从O1到O2变化的假设。另一组参与者以最小修改方式调整假设以使其中一个错误。最终使用BERT作为对抗性过滤器,选择最难辨别正确答案的假设对。  

### 1.5 解码策略  
大语言模型的解码方法已被广泛观察到会影响推理模式与准确性。温度是语言模型中的超参数,调整最终softmax层产生的目标分布;较高温度使候选令牌分布更平滑。优化高概率输出的解码策略可能导致退化。因此,以较低温度运行推理模型会增加思维循环风险(模型产生重复或近乎相同的推理轨迹),而较高温度可避免循环。模型提供方建议以足够高的温度运行模型,以鼓励探索替代推理路径并避免循环;这些温度通常在0.6至1之间。  

论文结构如下:首先介绍数据集与实验设置,包括我们将de Varda的方法调整为最佳解释推断范式下的溯因推理,随后呈现主要结果。接着考察非贪婪解码,证明基于温度的多次采样聚合能增强人类-模型相关性。最后将这些发现置于先前思维成本对齐研究的背景下,探讨解码策略为何对测量推理努力重要。由于人类反应时受题目长度影响显著,所有报告的令牌-反应时相关性均为控制题目长度的偏相关。  

## 2 方法  
我们在160道题(来自AI2的溯因自然语言推理数据集)上对参与者(N=120)进行在线强制选择实验。参与者需阅读描述常识场景的两个观察现象,并选择最能解释两者的两个假设之一。要求尽可能快速且准确作答。  
**观察现象1**:亚历克在文艺复兴市集工作。  
**观察现象2**:他们必须让这看起来像是表演的一部分。  
**假设A**:亚历克突然在众人面前跳起。  
**假设B**:表演期间亚历克的手机响起。  
**正确答案**:假设B  
图1:溯因强制选择任务示例  

### 2.1 参与者  
通过Prolific招募参与者(N=127)。所有参与者均为居住在美国、视力正常或矫正正常的英语母语者。7名参与者因反应时间异常快或异常长(表明已离开电脑)被移除。最终样本包括120名参与者(平均年龄33.0岁,标准差6.6;60%女性,38%男性,2%其他)。  

### 2.2 实验设计  
参与者分为4组,每组包含40个独特的溯因情景,共160道题。分析中,第1组(N=28)、第2组(N=31)、第3组(N=32)、第4组(N=29),各组题目无重叠。  

### 2.3 实验流程  
调查以英语进行。参与者使用键盘上的Q和P键在屏幕假设间选择。任务开始前,通过两道选择题测试参与者对指令的理解。提供两道练习题帮助熟悉界面,并要求实验全程将手指放在P和Q键上。每道题答案在P和Q键间随机分配以避免按键偏好。添加两道注意力测试以捕捉分心参与者。试次间短暂呈现注视点(200毫秒),计时开始。

相似文章

通过纠正少数决策令牌即可恢复推理能力

arXiv cs.AI

本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。