人类放弃,推理模型坚持:分离难度登记与思考分配

arXiv cs.AI 论文

摘要

本文分离了大型推理模型(LRMs)和人类中的难度登记与思考分配,发现LRMs在答错的问题上花费更多token,而人类在失败上花费更少时间,揭示了尽管跨项目难度相关性相似但项目内模式相反。

arXiv:2606.26502v1 公告类型:新 摘要:大型推理模型(LRMs)在难题上花费更长时间,正如人类一样。这种表面相似性隐藏了项目内的相反模式。当LRM答错一个问题时,它比答对同一个问题时花费更多token;人类则相反,在答错的试验上花费更少时间。我们将思考的两个层面分开:响应时间如何跨项目跟踪难度(登记),以及在保持项目身份不变的情况下,智能体在其失败或成功上花费更多(分配)。在一个公开的匹配人类-LRM语料库上,人类和所有五个思考型LRM再现了已知的跨项目对齐(登记),但在项目内出现分歧(分配):每个LRM都表现出较大的错误vs正确效应(在H-ARC上Cohen's d = 1.47-3.13),而人类则表现出相反的符号。比较始终在每个智能体自身的尺度内进行;我们从未将秒和token放在一个轴上。这种分离在项目固定效应下成立,跨数据集重复出现,并且在非思考型基线中不存在。我们将人类模式解读为参与与放弃:人们在期望能解决的问题上投入,而放弃其余问题。我们将LRM模式解读为长度由不确定性驱动:当模型不确定时,链变长,而这正是它容易出错的时候。两种策略都产生了与难度相同的跨项目相关性,因此在先前工作使用的度量上看起来对齐;只有当项目身份固定时,分歧才会显现。在资源理性的元推理下,这种分裂发生在两种停止策略之间,它们共享一个难度信号但实施相反的控制;轨迹长度捕获了信号但忽略了控制。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:13

# 分離困難註冊與思考配置

來源:https://arxiv.org/html/2606.26502

## 人類會脫離,推理模型會堅持:分離困難註冊與思考配置

###### 摘要

大型推理模型(LRM)在更難的問題上花費更長時間,這與人類的行為模式表面上相似。然而,這種表面相似性掩蓋了題目內部的相反模式。當一個LRM答錯某道題時,它花費的標記(token)數量會多於它答對同一道題時;而人類則相反,在答錯的嘗試上花費的時間更少。我們將思考的兩個層次分離:反應時間如何跨題目追蹤難度(註冊),以及在固定題目標識的情況下,個體在其自身失敗與成功上花費的資源是否更多(配置)。在一個公開的配對人類-LRM語料庫上,人類和所有五種思考型LRM都再現了已知的跨題目一致性(註冊),但在題目內部出現分歧(配置):每個LRM都顯示出顯著的答錯vs答對效應(H-ARC上Cohen's d=1.47–3.13),而人類則顯示出相反的符號。這種比較是在每個個體自身的尺度內進行的;我們從未將秒數和標記數放在同一軸上。這種分離在題目固定效應下依然成立,能夠跨資料集複現,並且在非思考型基線模型中不存在。我們將人類模式解讀為投入與放棄:人們在他們預期能解決的題目上持續投入,而在其餘題目上選擇放棄。我們將LRM模式解讀為由不確定性驅動的長度:當模型不確定時,思考鏈會增長,而這恰好是它往往會失敗的時候。這兩種策略都產生了相同的跨題目與難度的相關性,因此它們在先前研究使用的指標上看起來是一致的;分歧只有在固定題目標識後才會顯現。在資源理性後設推理(resource-rational metareasoning)框架下,這種分裂存在於兩種共享難度信號但實施相反控制的停止策略之間;軌跡長度捕捉到了信號,卻遺漏了控制。

關鍵詞:大型推理模型、思考、反應時間、思維鏈、資源理性分析

## 1 引言

思考的認知科學中的一個核心問題是,思考者如何決定一個項目何時值得更多思考,何時不值得。資源理性分析將此決策視為預期收益與機會成本的比較 (Simon, 1956 (https://arxiv.org/html/2606.26502#bib.bib29); Russell and Wefald, 1991 (https://arxiv.org/html/2606.26502#bib.bib2); Lieder and Griffiths, 2020 (https://arxiv.org/html/2606.26502#bib.bib1); Gershman et al., 2015 (https://arxiv.org/html/2606.26502#bib.bib30); Callaway et al., 2022 (https://arxiv.org/html/2606.26502#bib.bib33))。後設認知理論將其定位於基於信心的監控和脫離機制 (Nelson and Narens, 1990 (https://arxiv.org/html/2606.26502#bib.bib27); Yeung and Summerfield, 2012 (https://arxiv.org/html/2606.26502#bib.bib28); Nelson and Leonesio, 1988 (https://arxiv.org/html/2606.26502#bib.bib35))。序列取樣模型將其定位於終止證據累積的邊界 (Ratcliff and McKoon, 2008 (https://arxiv.org/html/2606.26502#bib.bib21); Bogacz et al., 2006 (https://arxiv.org/html/2606.26502#bib.bib3); Heitz, 2014 (https://arxiv.org/html/2606.26502#bib.bib22))。這三個傳統都匯聚到一個兩步驟的圖景。個體首先註冊(register)一個項目是困難的——這是一種感知或評估性的困難信號。然後,個體圍繞這個註冊的困難來配置(allocate)計算:一個決定是否在當前項目上繼續思考的停止或調度規則。困難註冊與思考配置是可分離的:一個個體可以按照與另一個個體相同的順序對項目進行難度分級,但卻以不同的策略來調度自身的計算。

大型推理模型(LRM)使得這種分解在經驗上易於處理。它們擴展了思維鏈(chain-of-thought)範式,即在給出最終答案之前產生中間推理 (Wei et al., 2022 (https://arxiv.org/html/2606.26502#bib.bib23); Kojima et al., 2022 (https://arxiv.org/html/2606.26502#bib.bib24); Snell et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib25)),而對語言模型進行的認知心理學風格分析已開始描繪其行為特徵與人類行為特徵的對應關係 (Binz and Schulz, 2023 (https://arxiv.org/html/2606.26502#bib.bib34))。就像人類的反應時間一樣,LRM的推理軌跡長度是一個行為讀數,反映了個體在一個問題上停留的時間;這兩個度量是類比性的,而不是可互換的。de Varda 等人 (2025 (https://arxiv.org/html/2606.26502#bib.bib4)) 在這個度量上報告了一個顯著的一致性:在七個推理任務中,LRM的推理標記長度既在範式內也在範式間追蹤人類的反應時間。人類花費更長時間的項目,也引發LRM產生更長的軌跡。這個結果是對困難註冊的一個清晰展示。但它對配置問題保持沉默:跨題目相關性描述的是兩個系統如何相對彼此對項目進行分級,而不是任何一個系統如何圍繞其自身的成功與失敗來調度計算。

關於de Varda等人 (2025 (https://arxiv.org/html/2606.26502#bib.bib4)) 的已發表評論恰恰指出了這個缺口。Vankov 等人 (2026 (https://arxiv.org/html/2606.26502#bib.bib7)) 通過推理努力的操作性實驗測試了因果解釋,發現在六個任務中的五個裡,其對準確率的影響微乎其微,認為僅憑相關性不足以支持一致性主張。Dujmović (2026 (https://arxiv.org/html/2606.26502#bib.bib8)) 強調相關性不能建立機制相似性,並呼籲提出關於共享機制的可檢驗假設。Hu (2026 (https://arxiv.org/html/2606.26502#bib.bib9)) 提出了另一種可能性,即中間標記可能作為表演性支架(performative scaffolding)而非遞增的內部計算,並提議將推理時截斷(inference-time truncation)作為一種區分性的診斷方法。作者對 Dujmović 的回覆 (de Varda et al., 2026a (https://arxiv.org/html/2606.26502#bib.bib6)) 明確否認了算法層面的機制主張,將該發現描述為「一個穩健的經驗現象」,其潛在解釋仍有待探索;他們對 Vankov 的回覆 (de Varda et al., 2026b (https://arxiv.org/html/2606.26502#bib.bib5)) 則用額外33個任務的證據為一致性主張辯護,並指出 H-ARC(本研究的首要範式)是其中唯一一個操縱推理努力會顯著改變準確率的任務,但該回覆並未解決題目內部的配置問題。

因此,文獻已經在三個方面達成共識:跨題目一致性是真實存在的,它本身並非機制主張,並且需要一個單獨的診斷來測試思考是如何被配置的。我們提供了這個診斷。這個基於結果條件的問題很簡單:個體在它正確回答的嘗試上花費的思考時間,是否多於它在錯誤回答的嘗試上花費的時間?我們為每個個體在每個範式上提出這個問題,在每個個體自身的尺度內對思考進行歸一化,使得秒數和標記數從不直接比較,然後我們使用題目固定效應來測試人類與LRM之間的交互作用。每個個體都作為自身的基線,而題目固定效應則吸收了de Varda等人 (2025 (https://arxiv.org/html/2606.26502#bib.bib4)) 的發現所依賴的跨題目難度梯度。由此產生的斜率是對思考配置(deliberation allocation)的一個診斷,它與跨題目難度註冊(difficulty registration)診斷是正交的,並對其形成補充(圖1 (https://arxiv.org/html/2606.26502#S3.F1))。我們在行為比較的意義上使用「個體內部(within-agent)」這個術語;由於公開數據集中每個 (項目 × 模型) 配對只有一個觀測值,LRM的項目固定斜率是通過不同模型嘗試同一項目來識別的,而不是通過單一模型的重複樣本,因此這種對比在嚴格的意義上是項目控制的(我們將在侷限性部分回到這一點)。這兩個診斷共同構成了一個人類與LRM在思考方面一致性的最小兩層次測試。

研究的範圍是有限的。LRM樣本是六個開放權重的思考型模型,並以DeepSeek-V3作為非思考型基線;未測試封閉前沿推理系統。人類比較是針對源數據發布中報告的樣本,而非一般人類群體。分析了三個推理範式:H-ARC(視覺抽象)作為主要範式,INTUIT作為結構上不同的跨範式複現,以及Cortes(二元關係推理)作為一個依賴於範式的邊界案例。後續的方法、結果和討論部分將發展這個診斷,報告其結果,並從結果中推導出對兩個系統在思考時所做不同事情的一種候選解讀。

#### 貢獻。
本文做出三項貢獻。首先,它分離了在人類-模型比較中通常被混淆的兩個行為層次:跨題目困難註冊(思考持續時間是否追蹤哪些項目是困難的?)和題目內部思考配置(給定被識別為困難的項目,個體在哪裡花費更多思考?)。其次,它引入了一個基於結果條件、經過項目控制的診斷方法,該方法詢問個體是將更多思考配置給自身的成功還是失敗,使用每個個體自身的思考尺度,並精確固定題目標識。第三,它使用這個診斷表明,表面上的跨題目人類-LRM一致性,在題目內部隱藏了相反的配置策略。關鍵點不在於秒數和推理標記是等價的,也不在於推理軌跡直接揭示了潛在的計算。相反,關鍵點在於,這兩者都是可觀察的行為讀數,其基於結果條件的結構——當在每個個體自身的尺度內解讀時——能夠以跨題目相關性本身無法做到的方式,約束關於後設認知控制、停止和資源分配的理論。

## 2 方法

#### 數據集與模型。
本研究重新分析了公開發布的、去識別化的人類和LRM數據;未收集新的人類受試者數據,也無需機構審查委員會(IRB)審查。我們使用了de Varda等人 (2025 (https://arxiv.org/html/2606.26502#bib.bib4)) 發布的公開數據以及底層的行為語料庫 (LeGris et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib10); Prunty et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib11); Cortés et al., 2021 (https://arxiv.org/html/2606.26502#bib.bib12))。表1 (https://arxiv.org/html/2606.26502#S2.T1) 總結了三個推理範式。H-ARC (LeGris et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib10); Chollet, 2019 (https://arxiv.org/html/2606.26502#bib.bib26)) 是主要範式。INTUIT是乾淨的跨範式複現;Cortes是一個邊界情況(泛化與Cortes邊界);算術被排除,因為所有思考型LRM都達到了天花板效應。

思考型LRM樣本(DeepSeek-R1 (Guo et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib14)), Qwen-QwQ-32B and Qwen3-235B-Thinking (Qwen Team, 2025 (https://arxiv.org/html/2606.26502#bib.bib16)), GLM-4.5-Air-FP8 (Z.ai, 2025 (https://arxiv.org/html/2606.26502#bib.bib17)), gpt-oss-20b and gpt-oss-120b (OpenAI, 2025 (https://arxiv.org/html/2606.26502#bib.bib15)))僅限於開放權重。DeepSeek-V3 (DeepSeek-AI, 2024 (https://arxiv.org/html/2606.26502#bib.bib13)) 是一個非思考型控制組。在H-ARC中,四個LRM具有良好的統計效力(DeepSeek-R1, GLM-4.5-Air-FP8, gpt-oss-120b, Qwen-QwQ-32B;所有 n_LRM ≥ 298);gpt-oss-20b(n=119,受解析器限制)和Qwen3-235B-Thinking(n=43,其中有4個錯誤嘗試)以描述性方式報告。所有六個思考型LRM都進入了INTUIT和Cortes的分析。

#### 思考度量。
對於思考型LRM,思考時間 t 是發布數據框中的 `reasoning_token_length` 字段:即在最終答案之前生成的中間軌跡標記數量,按照每個模型自身的原生標記化器計數。對於非思考型的DeepSeek-V3控制組,我們使用 `total_output_tokens`。我們將 t 視為模型在名義上貪婪解碼下的生成策略的行為讀數,而不是潛在計算的度量:軌跡標記並不能保證反映底層推理 (Valmeekam et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib19); Samineni et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib18); Kambhampati et al., 2025 (https://arxiv.org/html/2606.26502#bib.bib20))。每個個體都作為自身的個體內部基線,因此秒數和標記數從不直接比較。

遵循de Varda等人 (2025 (https://arxiv.org/html/2606.26502#bib.bib4)) 的分析腳本,我們將發布的數據框去重複,每個 (項目, 模型) 保留第一次嘗試。INTUIT的軌跡在公開發布中受到限制,因此「內部」的分析部分僅限於H-ARC和Cortes。完整的來源、去重和每個模型的可解析/正確/錯誤計數見補充材料(S6)。

**表 1:分析的數據集。** a Qwen3-235B-Thinking(n=43個匹配的H-ARC項目)和gpt-oss-20b(n=119,受解析器限制)在H-ARC上被標記為低統計效力,並單獨報告。完整的數據集和評分細節見OSF存儲庫。

#### 個體內部 d-比率。
對於個體 A、範式 P、嘗試 i(思考時間 t_i > 0,正確與否 c_i ∈ {0,1}),d-比率是對數思考時間的匯合標準差 Cohen's d。這裡 t_i 對人類是反應時間秒數,對思考型LRM是 `reasoning_token_length`,對V3是總輸出長度:
d_錯誤-正確(A,P) = (ℓ̄_錯誤 - ℓ̄_正確) / s_匯合
其中 ℓ_i = log t_i。正值表示個體在其失敗上思考時間更長。

#### 難度控制。
正的 d-比率原則上可能反映一個對數值不敏感的停止規則,或者一個與錯誤相關的難度效應。為了打破這種同義反覆,我們使用了兩種個體內部控制方法。(a) 留一法集成難度回歸:
log t_i = α + β_正確 c_i + β_難度 D_i^(-A) + ε_i
其中 D_i^(-A) = 1 - c̄_(i,-A),而 c̄_(i,-A) 是項目 i 上所有非焦點個體(可用於該範式)的平均正確率。當焦點個體 A 是人類群體時,非焦點個體是所有嘗試了項目 i 的思考型LRM。當 A 是某個思考型LRM時,非焦點個體是人類群體加上所有其他嘗試了項目 i 的思考型LRM。(b) 項目固定效應回歸,通過項目虛擬變量吸收項目身份,從而完全從項目內部的變異中識別正確率係數。

主要的聯合分離規範是:
log t_i = α + β c_i + β_LRM c_i × LRM_i + δ_個體 + γ_項目 + ε_i
此規範將人類和LRM匯合;交互項 β_LRM 即是項目內部的分離。我們還分別擬合了僅人類和僅LRM的項目固定效應規範、聯合回歸的每個LRM版本(一次一個LRM加上人類)、在INTUIT和Cortes上的相同三個回歸,以及一個用項目層級平均正確率取代項目虛擬變量的Mundlak (Mundlak, 1978 (https://arxiv.org/html/2606.26502#bib.bib32)) 重新參數化。全程使用按項目聚類的穩健標準誤。完整的規範和分析腳本見OSF存儲庫。

#### 識別範圍。
發布的LRM數據中,每個 (項目 × 模型) 配對恰好有一個觀測結果,因此項目內部的LRM正確率斜率是通過比較不同模型(而

相似文章

通过纠正少数决策令牌即可恢复推理能力

arXiv cs.AI

本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。