搭建战略家:霍特林空间市场中架构依赖的推理干预
摘要
本文研究了结构化推理干预如何影响大型语言模型的战略经济推理,以霍特林线性城市模型为工具,发现干预效果取决于模型架构(GPT-4.1-mini 对比 GPT-5-mini),并存在统计显著的交叉交互作用。
arXiv:2607.09743v1 公告类型:新
摘要:本文研究了结构化推理干预是否提升大型语言模型的战略经济推理能力,以及其效果是否依赖于模型架构。以霍特林线性城市模型为诊断工具,我们评估了GPT-4.1-mini(标准指令跟随模型)和GPT-5-mini(推理优化模型)在五种条件下的表现——无脚手架的基线和四种推理干预——跨越覆盖演绎和溯因推理的八个问题、三种提示框架以及每种条件三次重复,共产生720个独立评分的响应。我们发现了脚手架类型与模型架构之间统计显著的交叉交互作用($t(7) = 4.79$, $p = 0.002$, $d = 1.69$):承诺脚手架提升了标准模型($+0.21$),但降低了推理模型($-0.63$),而原则分离呈现相反模式($-0.40$ 对比 $+0.31$)。两个交叉效应均单独显著(承诺:$p = 0.040$;分离:$p = 0.002$),并在所有八个问题中保持一致,7/8的方向一致性。对抗性压力测试对两个模型均有害,推理模型退化幅度大$2.6\times$($-1.47$ 对比 $-0.57$;$p = 0.038$),且伤害与基线难度负相关($R^2 = 0.36$, $p = 0.014$)。我们进一步记录了一个持久的陈述-程序鸿沟:两个模型识别正确策略的比率远超其执行能力;分离完全弥合了推理模型的这一鸿沟,而没有任何干预能帮助标准模型。
查看缓存全文
缓存时间: 2026/07/14 04:17
# 为战略家搭建思维支架:霍特林空间市场中的架构依赖型推理干预 来源:https://arxiv.org/html/2607.09743 Pratyush Singh 计算与数学科学系 加州理工学院 美国加州帕萨迪纳市 91125 [email protected] ###### 摘要 我们研究结构化的推理干预措施是否能提升大语言模型的战略性经济推理能力,以及其效果是否依赖于模型架构。以霍特林线性城市模型作为诊断工具,我们评估了GPT-4.1-mini(一种标准的指令遵循模型)和GPT-5-mini(一种推理优化模型)在五种条件下的表现——一个无支架的基线条件和四种推理干预措施——覆盖了涵盖演绎推理和溯因推理的八个问题、三种提示框架以及每种条件下的三次重复,共产生720个独立评判的回复。我们发现支架类型与模型架构之间存在统计上显著的交叉交互作用(t(7)=4.79,p=0.002,d=1.69):承诺式支架提升了标准模型的表现(+0.21),但降低了推理模型的表现(-0.63);而原则分离式支架则呈现出相反的模式(-0.40 vs. +0.31)。两种交叉效应均单独显著(承诺式:p=0.040;分离式:p=0.002),且在所有八个问题上保持一致,其中7/8个问题的方向一致。对抗性压力测试对两个模型均有损害,对推理模型的损害是标准模型的2.6倍(-1.47 vs. -0.57;p=0.038),且损害程度与基线难度呈负相关(R²=0.36,p=0.014)。我们进一步记录了一个持续的陈述性-程序性差距:两个模型识别正确策略的比率远高于其执行策略的能力;原则分离式支架完全弥合了推理模型的这一差距,而没有任何干预措施能帮助标准模型。 ## 1 引言 大语言模型在数学和逻辑基准测试中取得了显著成就(OpenAI,2023 (https://arxiv.org/html/2607.09743#bib.bib9)),然而它们在战略性经济推理方面的能力——即智能体需要整合领域知识、预判竞争对手并将理解转化为具体行动——仍然知之甚少。现实世界中的决策需要多步骤的战略推理:从结果逆向推理、在多个选择之间保持一致性,以及区分均衡预测与直觉判断。 已有越来越多的研究开始通过将LLM评估嵌入博弈论框架来填补这一空白。使用古诺竞争(Lin等人,2024 (https://arxiv.org/html/2607.09743#bib.bib8))、重复行为博弈(Akata等人,2025 (https://arxiv.org/html/2607.09743#bib.bib1))和分解式战略推理(Gandhi等人,2023 (https://arxiv.org/html/2607.09743#bib.bib4))的研究一致发现,LLM表现出标准基准测试无法察觉的系统性偏差。GTBench(Duan等人,2024 (https://arxiv.org/html/2607.09743#bib.bib2))提供了迄今为止最全面的博弈论LLM基准测试,涵盖十个完全信息和部分信息博弈;而EconArena(Guo等人,2024 (https://arxiv.org/html/2607.09743#bib.bib5))则使用均衡偏差作为主要指标来对经济推理进行基准测试。然而,这些评估主要依赖于离散动作空间和同时行动博弈,忽视了连续策略空间、多阶段逆向归纳和反直觉均衡。 一个关键维度也仍未得到解决:推理干预如何与模型架构相互作用。推理优化模型(内置思维链)的部署引发了关于外部支架是否仍有价值的疑问。Sprague等人(2025 (https://arxiv.org/html/2607.09743#bib.bib13))发现,对于已经进行内部推理的模型,使用思维链提示的收益递减;GTBench同样报告说,思维链在博弈论环境中并不总是有帮助。同时,Zhang(2025 (https://arxiv.org/html/2607.09743#bib.bib16))提出了*计算性裂脑综合征*这一概念,用来描述那些能够解释原理却无法遵循原理的模型;Gandhi等人(2023 (https://arxiv.org/html/2607.09743#bib.bib4))表明,这种陈述性-程序性差距在不同推理亚型之间存在系统性差异。如果一个模型已经进行内部思考,外部支架是有益、无所作为还是产生干扰?我们使用霍特林线性城市模型(Hotelling,1929 (https://arxiv.org/html/2607.09743#bib.bib7))作为诊断工具来解决这些问题。 我们评估GPT-4.1-mini(一种标准的指令遵循模型)和GPT-5-mini(一种推理优化模型)在五种条件下的表现:一个无支架的基线条件和四种推理干预措施。每个条件在三种提示框架和三次重复下进行测试,共产生720个独立评判的回复,由GPT-5.2作为自动评估器进行评分,并经过人工验证校准(κ=0.97)。我们的贡献有四方面。首先,我们记录了支架类型与架构之间存在统计上显著的交叉交互作用(p=0.002,d=1.69)。其次,我们证明对抗性压力测试普遍会降低性能,对推理模型的损害更大(p=0.038),且这种损害随基线能力的增强而增加(R²=0.36)。第三,我们量化了经济推理中的陈述性-程序性差距,表明原则分离式支架完全弥合了推理模型的这一差距,而没有任何干预措施能帮助标准模型。第四,我们验证了霍特林空间竞争作为一个抗污染的诊断框架,具有渐进的难度梯度。 ## 2 相关工作 对LLM在博弈论背景下行为的研究增长迅速。Horton(2024 (https://arxiv.org/html/2607.09743#bib.bib6))将LLM框架化为“Homo Silicus”,展示了可识别的经济偏好;随后的研究记录了涌现的战略行为:无需合谋指令即可出现超竞争定价(Fish等人,2024 (https://arxiv.org/html/2607.09743#bib.bib3))、古诺竞争中的市场划分(Lin等人,2024 (https://arxiv.org/html/2607.09743#bib.bib8))以及重复博弈中偏离纳什均衡的行为(Akata等人,2025 (https://arxiv.org/html/2607.09743#bib.bib1))。GTBench(Duan等人,2024 (https://arxiv.org/html/2607.09743#bib.bib2))系统化了跨十个博弈的评估,发现思维链的收益不一致;EconArena(Guo等人,2024 (https://arxiv.org/html/2607.09743#bib.bib5))将这种方法扩展到多智能体市场模拟。我们的工作不同之处在于使用连续策略空间、测试推理干预而非比较模型,以及采用能够揭示交互效应的因子设计。 如何为LLM推理搭建支架这一问题与思维链文献相关。自从Wei等人(2022 (https://arxiv.org/html/2607.09743#bib.bib14))确立了思维链提示以来,Sprague等人(2025 (https://arxiv.org/html/2607.09743#bib.bib13))已经证明其益处集中在数学和符号任务中,在其他方面收益递减。我们的干预措施超越了简单的思维链,通过施加结构约束——承诺于前提或将原则识别与应用分离——我们所记录的交叉效应表明,这些措施与内置推理的交互作用方式是一般提示无法捕捉的。 另一条平行的工作线考察了LLM所知与所能之间的差距。Zhang(2025 (https://arxiv.org/html/2607.09743#bib.bib16))识别出“计算性裂脑综合征”,即模型能够阐述正确的原则但无法应用它们;Gandhi等人(2023 (https://arxiv.org/html/2607.09743#bib.bib4))表明这种差距在不同推理亚型之间有所不同,溯因任务比演绎任务表现出更大的差距。在人类认知中,知其然与知其所以然的区别由来已久(Ryle,1949 (https://arxiv.org/html/2607.09743#bib.bib11)),而语言遮蔽效应(Schooler & Engstler-Schooler,1990 (https://arxiv.org/html/2607.09743#bib.bib12))表明,明确的表述会降低受益于内隐处理的任务的表现。我们的陈述性-程序性分析连接了这些线索:我们表明,这种差距在不同架构中具有质的不同起源,并且对干预措施的反应也不同。 ## 3 为何选择霍特林模型 评估领域的选择是经过深思熟虑的。我们需要一个领域,它要求具有可验证地面真相的多步骤战略推理,在统一框架内分离推理亚型,抵抗训练数据污染,并暴露陈述性-程序性差距。霍特林空间竞争模型(Hotelling,1929 (https://arxiv.org/html/2607.09743#bib.bib7))满足所有四个要求。 与一次性同时博弈不同,霍特林竞争需要解决一个两阶段序贯博弈:企业首先选择位置,然后在价格上竞争。求解子博弈完美均衡需要逆向归纳——先推导作为位置函数的价格均衡,然后优化位置选择。通过改变信息结构,我们构建了演绎任务(从公理推导均衡结果)和溯因任务(从观察到的结果推断隐藏参数)。标准的逻辑基准测试将这些任务孤立地测试;霍特林模型在共享的概念词汇和可验证地面真相下将它们统一起来。 该模型还具备连续的位置和价格空间,而非离散动作集。它产生反直觉的均衡——例如,在二次运输成本下的最大差异化——这与企业应该集中在客户附近的天真直觉相矛盾,从而将真正的理解与模式匹配区分开来。我们的非标准参数化(非对称成本、部分信息、多段市场)不太可能出现在任何训练语料库中(Lin等人,2024 (https://arxiv.org/html/2607.09743#bib.bib8))。最后,霍特林模型自然地分离了“知道要做什么”和“去做它”。一个模型可能正确地识别出企业应该最大化差异化,却无法计算出均衡位置或价格。我们的组件B溯因任务通过要求应用已识别的原则从观察数据中提取隐藏信息来暴露这一差距。 ## 4 实验 ### 4.1 任务设计 我们设计了八个问题,分为两个组件,反映了演绎推理与溯因推理之间的区别。组件A包含五个演绎推理问题,要求从给定前提进行正向推导。A1测试参数敏感性(运输成本缩放时的均衡价格和利润)。A2测试位置变化后果(企业间距离减半的影响)。A3测试成本结构识别(从市场份额数据中分类运输成本类型)。A4测试非对称成本分析(成本冲击下的均衡预测)。A5测试进入遏制(通过逆向归纳计算进入盈利性并设计遏制策略)。组件B包含三个溯因推理问题,要求从观察到最佳解释的推理。B1测试竞争对手推断(从观察到的定价推断竞争对手的成本结构)。B2测试策略转移检测(从市场结果数据中识别发生了什么变化)。B3测试隐藏信息提取(从部分数据推断未观察到的参数)。 每个问题都包含一个封闭形式或定性确定的预期答案、一个指定关键字段的评分标准以及明确的评分准则。问题根据经验观察到的难度排序(第5.1节 (https://arxiv.org/html/2607.09743#S5.SS1)),几乎覆盖了0-10的完整范围。 ### 4.2 干预设计 我们对每个问题测试五种条件。基线条件直接呈现问题,没有支架。承诺条件要求模型在求解之前先陈述并承诺其分析框架,强制显式锁定前提。矛盾检测条件提示模型识别并解决其推理链中的内部矛盾。原则分离条件要求分三个显式阶段求解:陈述原则、生成预测、然后决定,强制执行一个先声明后执行的流程。对抗性压力测试条件提示模型反驳自己的结论,然后为其辩护或进行修正。 ### 4.3 提示框架、重复与评估 每个问题以三种框架呈现:正式框架(数学符号和博弈论术语)、叙述框架(用自然语言描述的具体场景)和最小框架(仅提供参数和直接问题)。每种模型、干预和框架的组合在温度参数1.0下运行3次,产生2×5×3×3×8 = 720个回复。选择温度1.0是为了最大化重复之间的回复多样性,相比近乎确定性的采样,这为干预的稳健性提供了更强的测试。所有回复均通过OpenAI API收集,设置了32,768个完成令牌的预算,以避免截断推理模型的思维链。 每个回复由GPT-5.2在两个独立的0-10评分尺度上进行评分:结论评分(衡量最终输出的事实准确性)和推理评分(衡量推导链质量)。我们报告它们的算术平均值作为组合得分。对于组件B,评判员还会额外评估陈述性正确性(模型是否识别了正确的原则?)、程序性正确性(模型是否正确执行?)以及两者之间的差距。 为了校准自动评判员,一位作者独立地对180个分层随机样本(占720个总数的25%)进行了评分,这些样本按模型、干预和问题成比例抽取。在这180个样本中,176个从人工和自动评判员获得了相同的分数;其余4个在0-10评分尺度上表现出±1分的微小差异。这产生了二次加权的Cohen's κ = 0.97,表明近乎完美的一致性。 我们报告平均值及样本标准差;每单元格样本量为n=9(3种框架 × 3次重复)。统计检验使用跨8个每问题差异值的配对t检验(df=7),辅以置换检验和Wilcoxon符号秩检验以增强稳健性。 ## 5 结果 ### 5.1 基线表现 表1 (https://arxiv.org/html/2607.09743#S5.T1) 按问题报告了基线表现。两个模型对一个一致的难度层级结构达成了共识,该层级几乎覆盖了0-10的完整范围。 表1:按问题划分的基线组合得分(均值±标准差,n=9)。 GPT-5-mini在8个问题中的6个上优于GPT-4.1-mini,在最困难的问题上优势最大:A5(+2.08)、A2(+1.72)和B3(+1.34)。两个模型的难度排序非常一致:都将A1评为最容易,A5评为最难,共享难度排名的Spearman's ρ = 0.62。GPT-4.1-mini唯一显著的优势是A3,它得分为8.61,而GPT-5-mini为4.22——这是一个在第5.3节 (https://arxiv.org/html/2607.09743#S5.SS3) 中分析的4.39分逆转。 ### 5.2 交叉交互作用 表2 (https://arxiv.org/html/2607.09743#S5.T2) 展示了核心发现。干预效应不仅幅度不同,而且在两个模型之间方向也不同,产生了统计上显著的交叉。
相似文章
GENSTRAT:迈向大型语言模型战略推理科学
本文介绍了GENSTRAT,一个利用程序生成的战略环境来评估LLMs在多维度上的战略推理能力的基准,解决了固定游戏套件的局限性。
Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。
算法判断的地理学:大语言模型中介、地点身份与住房搜索中的种族引导
本文对四个美国城市的七种开放权重和闭源大语言模型进行了行为审计,发现住房推荐中的种族引导是模型解释权的涌现行为,随用户身份和城市背景而变化。
LLMs为何在结构化知识上产生幻觉:对线性化表示推理的机制分析
本文对LLMs在推理线性化结构化知识时产生幻觉的原因进行了机制分析,发现幻觉源于系统的内部动态,例如对捷径线索的关注以及前馈层中语义基础的失败,而非随机噪声。
大型语言模型中用于结构推理的视觉图支架
本文探讨了将视觉图思维导图用作LLMs的推理支架,发现即使没有直接答案提示,视觉引导仍然有效,而将图扁平化为文本则会失去优势。