LLM推理的周期表:推理范式、方法与失败模式的系统综述

arXiv cs.CL 论文

摘要

一项综合分析超过300篇关于LLM推理的论文,提出了推理范式的分类体系,包括Chain-of-Thought、Multi-Hop、Mathematical、Commonsense等,并总结了常见的失败模式和研究空白。

arXiv:2606.11470v1 Announce Type: new 摘要:大型语言模型(LLMs)在自然语言处理任务中表现出色,但可靠的推理仍然是一个开放挑战。尽管现代LLMs在结构化推理、多步问题求解和上下文理解方面取得了进展,但其推理行为往往不一致,且对提示策略、任务设计和模型规模敏感。本综述系统分析了来自arXiv、Semantic Scholar、Google Scholar、Papers with Code和ACL Anthology的300多篇近期论文,探讨LLMs中推理能力的涌现及其失败原因。我们做出三项主要贡献:首先,我们引入了一个结构化的LLM推理研究分类体系,涵盖Chain-of-Thought推理、多跳推理、数学推理、常识推理、视觉与时间推理、代码与算法推理、检索增强推理、工具增强与智能体推理以及基于强化学习的推理。其次,我们分析了这些范式的方法论趋势,包括提示方法、模型架构、训练目标、奖励建模和评估基准。第三,我们综合了反复出现的局限性和失败模式,如推理幻觉、脆弱的多步推理、弱因果抽象和跨领域泛化能力差。通过对快速扩展的文献进行梳理,本综述提供了对LLMs当前推理能力和局限性的统一视角。我们还指出了新兴的研究方向,包括元推理、自演化推理框架、多模态推理和基于社会情境的推理。总体而言,这项工作旨在为未来语言模型开发更鲁棒、可解释和泛化能力更强的推理系统提供参考。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:37

# LLM推理元素周期表:推理范式、方法与失败模式的结构化综述  
来源:https://arxiv.org/html/2606.11470  
Avinash AnandAvinash\.Anand@singaporetech\.edu\.sg 新加坡理工大学SIT×\\timesNvidia AI中心(SNAIC)  
Mahisha Rameshmahisha23121@iiitd\.ac\.in IIIT德里MIDAS实验室  
Avni Mittalavni\.mittal2002@gmail\.com IIT曼迪MIDAS实验室  
Ashutosh Kumarak1825@rit\.edu Owl Autonomous Imaging, Inc.  
Erik Cambriacambria@ntu\.edu\.sg 教授,南洋理工大学计算机与数据科学学院  
Zhengkui Wangzhengkui\.wang@singaporetech\.edu\.sg 副教授,主任,新加坡理工大学SIT×\\timesNvidia AI中心(SNAIC)  
Timothy Liutimothyl@nvidia\.com NVIDIA AI技术中心,新加坡  
Aik Beng Ngaikbengn@nvidia\.com NVIDIA AI技术中心,新加坡  
Simon Seessee@nvidia\.com NVIDIA AI技术中心,新加坡  
Rajiv Ratn Shahrajivratn@iiitd\.ac\.in 副教授,IIT坎普尔计算机科学与工程系  

###### 摘要  

大型语言模型(LLMs)在广泛自然语言处理任务中取得了强劲表现。然而,它们进行可靠推理的能力仍然是一个开放的研究挑战。现代LLM在结构化推理、多步问题求解和上下文理解方面展现出有前景的能力,但这些能力往往不一致,且高度依赖于提示策略、任务结构和模型规模。因此,理解LLM中推理如何涌现、又在何处失败,是一个核心研究问题。本综述对从arXiv、Semantic Scholar、Google Scholar、Papers with Code和ACL Anthology等主要学术数据库收集的300多篇近期研究论文进行了系统分析。我们做出了几项贡献。首先,我们引入了一个结构化分类法,将现有文献组织成主要推理范式:思维链推理、多跳推理、数学推理、常识推理、视觉与时间推理、代码与算法推理、检索增强推理、工具增强或智能体推理,以及基于强化学习的推理。其次,我们分析了这些类别中的方法论模式,包括提示策略、模型架构、训练范式、奖励建模方法和评估基准。第三,我们综合了在推理任务中观察到的常见局限性和反复出现的失败模式,包括推理幻觉、脆弱的多步推理和跨领域泛化能力差。这些贡献为LLM推理能力的当前能力和局限性提供了统一视角。此外,我们的分析识别了研究空白和新兴方向,包括元推理、自演化推理框架、多模态推理和社会性推理。我们期望将这项工作定位为未来语言模型中开发更稳健、可解释和可泛化推理系统的参考。  

## 1 引言  

LLM在多样化的推理任务中展现出强劲的实证表现[White et al. (2025 (https://arxiv.org/html/2606.11470#bib.bib259))];然而,其推理能力的深度、通用性和可靠性仍存在争议。本综述综合现有工作,考察LLM的推理能力、其局限性,以及评估和改进推理能力方面的开放挑战(图1 (https://arxiv.org/html/2606.11470#S1.F1))。本工作的核心问题是:推理能力能否在没有任务特定推理监督的情况下在LLM中涌现?  

虽然早期的神经语言模型主要依赖表层模式匹配和统计规律[Geirhos et al. (2020 (https://arxiv.org/html/2606.11470#bib.bib72));McCoy et al. (2019 (https://arxiv.org/html/2606.11470#bib.bib171));Tenney et al. (2019 (https://arxiv.org/html/2606.11470#bib.bib231))],但近期的大规模transformer LLM已展现出日益复杂的推理行为,包括多步推理、组合推理、时间一致性以及有限的因果或反事实推理[Wei et al. (2022a (https://arxiv.org/html/2606.11470#bib.bib254));(b (https://arxiv.org/html/2606.11470#bib.bib255));Chowdhery et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib39))]。然而,这些能力仍然脆弱,极易受到提示策略、任务形式、分布偏移和评估方法的影响[Gendron et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib73));Berglund et al. (2024 (https://arxiv.org/html/2606.11470#bib.bib13))]。  

提示在激发LLM能力中起着核心作用。零样本提示[Xian et al. (2018 (https://arxiv.org/html/2606.11470#bib.bib269));Kojima et al. (2022 (https://arxiv.org/html/2606.11470#bib.bib119))]、少样本提示[Brown et al. (2020 (https://arxiv.org/html/2606.11470#bib.bib15))]和思维链(CoT)提示[Wei et al. (2022b (https://arxiv.org/html/2606.11470#bib.bib255))]等技术表明,同一模型根据任务框架的不同可以表现出性质不同的行为。这种敏感性激发了对模型架构、规模和提示策略作为推理机制之间相互作用的广泛研究。尽管更大的模型通常能实现更强的推理性能,但规模本身并不能保证鲁棒的推理能力。许多推理行为只有在足够的规模与适当的指令调优、提示结构和上下文引导相结合时才会涌现。  

透明性和可解释性为LLM的推理带来了额外挑战。尽管思维链提示[Wang et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib238))]等技术暴露了中间推理轨迹[Wei et al. (2022b (https://arxiv.org/html/2606.11470#bib.bib255))],但这些轨迹是否真实反映了底层的计算过程[Lyu et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib166))]还是仅仅作为合理的事后合理化,仍存疑虑。这引发了更广泛的问题:LLM推理是否与人类可解释的逻辑结构一致,还是转而从训练期间学到的统计模式中涌现[Kadavath et al. (2022 (https://arxiv.org/html/2606.11470#bib.bib111))]。随着LLM越来越多地部署在高风险和真实世界环境中,理解模型如何得出结论与评估其输出的正确性同等重要。  

尽管近期取得了进展,LLM仍表现出重要局限性,尤其是在处理歧义和矛盾、区分相关性与因果性、跨领域迁移推理、以及将知识植根于物理或经验现实方面[Teo et al. (2025 (https://arxiv.org/html/2606.11470#bib.bib232))]。这些缺陷推动了检索增强[Lewis et al. (2020 (https://arxiv.org/html/2606.11470#bib.bib131))]、工具增强[Schick et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib203))]和模块化推理系统的发展,这些系统将语言模型与外部记忆、搜索、符号工具或执行环境相结合[Yao et al. (2022 (https://arxiv.org/html/2606.11470#bib.bib288))]。虽然这种混合方法通常能提高可靠性和事实一致性,但也引发了关于推理是否应被理解为单一能力还是可分离认知子过程组合的基础性问题[Budagam et al. (2024 (https://arxiv.org/html/2606.11470#bib.bib16))]。  

本综述还考察了多语言和多模态设置中的LLM推理[Achiam et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib2));Zhang et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib331))]、数学和符号问题求解[Hendrycks et al. (2021 (https://arxiv.org/html/2606.11470#bib.bib91))],以及社会和常识认知的各个方面。我们将这些行为与人类推理模式进行比较,同时考虑当前架构在多大程度上真正执行了结构化推理,而不仅仅是模拟其可观测输出。最后,我们讨论元推理和自我反思推理(模型评估并修正自身中间推理过程)作为未来系统提高鲁棒性、校准和泛化能力的一个潜在重要方向[Shinn et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib212));Madaan et al. (2023 (https://arxiv.org/html/2606.11470#bib.bib168))]。  

参见图注  
图1:基础机制图。展示一次前向传播:上下文流→\\rightarrow层→\\rightarrow分布→\\rightarrow采样token。标注显示上下文信息、参数知识和注意力机制的位置,以便学生理解“推理”是重复的下一个token预测。  

本综述的主要贡献如下:  

- • 我们开发了一个结构化的LLM推理范式分类法(图2 (https://arxiv.org/html/2606.11470#S2.F2)),涵盖思维链、多跳、数学、常识、多模态、检索增强、工具增强和基于强化学习的推理等方法。  
- • 我们考察了文献中的方法论趋势,包括提示策略、架构设计选择、训练范式和评估基准,以评估推理能力。  
- • 我们分析了LLM推理中反复出现的局限性和失败模式,包括幻觉推理轨迹、脆弱的多步推理、因果泛化能力差,以及对提示和任务形式的敏感性。  
- • 我们综合了新兴研究方向,包括元推理、自我反思和自我改进推理框架、多模态推理以及社会性推理系统。  
- • 我们讨论了开放的研究挑战,并指出了迈向更鲁棒、可解释和可泛化推理系统的方向。  

## 2 方法论  

我们采用受既定系统综述实践启发的结构化文献综述方法[Moher et al. (2009 (https://arxiv.org/html/2606.11470#bib.bib174));Keele et al. (2007 (https://arxiv.org/html/2606.11470#bib.bib113));Jesson et al. (2011 (https://arxiv.org/html/2606.11470#bib.bib102))]。该过程包括定义搜索标准、选择数据库、应用纳入和排除过滤器,以及根据方法清晰度、实证严谨性、相关性、可重复性和研究影响来评估论文质量。  

参见图注  
图2:LLM推理范式分类法。36个方法族排列在6×\\times6网格中:列按推理组合方式分组(逐步分解、领域特定、上下文与&实、增强、学习与&反思、跨边界),行则定位于从训练基础到高层认知的认知谱系。  

### 2.1 搜索过程  

我们首先确定代表本综述所涵盖推理类型的关键词。宽泛术语包括“大型语言模型”、“推理”、“思维链推理”、“多跳推理”和“常识推理”。根据推理类型添加更具体的关键词。数学推理:“数学推理”、“LLM方程求解”和“符号推理”。视觉推理:“图像-文本推理”和“视觉常识推理”。基于RAG的推理:“RAG模型”和“用于推理的信息检索”。代码推理:“算法推理”和“基于LLM的程序合成”。工具增强推理:“智能体推理”和“外部工具”。使用布尔运算符和关键词变体的组合进行搜索,以最大化覆盖不同推理范式和会议间的术语差异。这种关键词驱动方法涵盖了LLM推理的理论和实际工作。手动删除跨数据库的重复条目,并根据标题、摘要以及必要时全文的相关性筛选论文。  

### 2.2 使用的数据库  

我们搜索了以下数据库以获取AI和NLP领域的同行评审和预印本文献:  

- •IEEE Xplore,获取计算机科学和AI的会议论文、期刊和标准。  
- •Google Scholar,广泛覆盖会议论文集、期刊文章和基于引用的重要工作发现。  
- •ACM Digital Library,获取计算和AI领域的期刊和会议论文集。  
- •ArXiv,获取在正式同行评审前立即访问最新工作的预印本。  
- •SpringerLink,获取具有更广泛理论覆盖的书籍和期刊文章。  
- •Papers with Code,获取附有开源实现的论文,支持可重复性。  

### 2.3 纳入和排除标准  

由于搜索范围刻意宽泛,它返回了与本综述重点不一致的论文以及跨数据库的重复条目。我们应用以下纳入和排除标准来过滤结果。  

表1:应用于候选论文的纳入和排除标准。  

### 2.4 质量评估  

我们定义了八个质量评估标准(QAC)来评估每篇候选论文。每个标准在四等级表(差、一般、良好、优秀)上进行定性评估,以支持论文间的一致性比较。这些标准在审稿过程中指导论文选择和优先级排序:  

- •QAC1:论文是否在其推理类型上推进了理解或能力?  
- •QAC2:观点是否足够清晰地阐述,使非专家也能理解?  
- •QAC3:是否同时涉及理论和实践维度?  
- •QAC4:实验是否严谨,具有足够的样本、基准和对照?  
- •QAC5:论文的影响力如何,按相对于其发表时间的引用次数衡量?  
- •QAC6:是否解决了推理领域中一个未被充分探索的方面?  
- •QAC7:与现有工作相比,它定位得如何?  
- •QAC8:实验设置和数据可用性是否描述得足够详细以实现可重复性?  

### 2.5 数据收集与分析  

收集的论文被组织成一个带有元数据(标题、作者、年份、主要关注点、推理类型)的数据库,并按照推理类型进行分类。图3 (https://arxiv.org/html/2606.11470#S2.F3)显示了各推理类型之间的分布,图4 (https://arxiv.org/html/2606.11470#S2.F4)按类别跟踪了随时间的论文发表量。我们分析了集合以识别重复出现的主题、方法论趋势和覆盖空白。  

代码/算法33  
元推理/自演进31  
基于RAG的28  
用于推理的RL28  
思维链27  
数学27  
工具增强/智能体27  
视觉/多模态25  
多语言22  
社会/认知16  
多跳16  
时间10  
常识10  
0 10 20 30 40  
论文数量  

图3:按推理范式划分的研究论文分布。  

≤\\leq2022 2023 2024 2025  
思维链  
多跳  
数学  
常识  
视觉/多模态  
时间  
代码/算法  
基于RAG的  
工具增强  
用于推理的RL  
多语言  
元推理  
社会/认知  
0 0 1 1 1 6  
0 0 1 5 1 0  
0 8 1 9 1 4  
3 2 1 0 6 1  
8 6 2 9 5 1  
1 5 1 1 6 0  
5 1 1 2 0 2  
1 1 1 4 0 0  
8 2 0 6 2 9  
5 0 1 1 5 1  
5 2 3 4 7  

按推理范式和年份的出版趋势图  

图4:按推理范式和年份的出版物分布。较暗的单元格表示较高的出版量。  

基于收集的文献,我们将现有工作组织成一个层次化的推理范式和子问题分类法,如图5 (https://arxiv.org/html/2606.11470#S2.F5)所示。这种方法论实现了对跨提示策略、架构范式、训练目标和评估框架的推理研究的大规模综合。

相似文章

ReasoningFlow: 用于理解LLM推理轨迹的篇章结构

arXiv cs.CL

介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。