@pallavishekhar_: 大型推理模型 (LRMs) 阅读链接:https://outcomeschool.com/blog/large-reasoning-models…
摘要
这篇博客文章介绍了大型推理模型 (LRMs),它们与标准LLM的区别、训练方式以及使用时机。文中涵盖了DeepSeek R1和GPT-5.5 Thinking等例子。
查看缓存全文
缓存时间: 2026/06/06 01:22
大型推理模型(LRM)
来源:https://outcomeschool.com/blog/large-reasoning-models
大型推理模型(LRM)
在这篇博客中,我们将学习大型推理模型(LRM),了解它们与标准大型语言模型的不同之处,它们如何在回答之前进行思考,它们是如何训练的,以及我们何时应该使用它们。我们将涵盖以下内容:
- 大局观
- 什么是大型推理模型(LRM)?
- LLM 与 LRM 对比
- LRM 实际上是如何思考的?
- 测试时计算:思考得越久越聪明
- LRM 是如何训练的?
- 输入与输出:训练阶段与预测阶段
- 何时使用 LRM,何时使用普通 LLM
- 我们应该知道的流行 LRM
- 使用 LRM 时的常见错误
- 快速总结
我是Amit Shekhar,@Outcome School (https://outcomeschool.com/) 的创始人。我教导和指导过许多开发者,他们的努力使他们获得了高薪技术工作,帮助许多科技公司解决了他们独特的问题,并创建了许多被顶级公司使用的开源库。我热衷于通过开源、博客和视频分享知识。我在 Outcome School 教授人工智能与机器学习 (https://outcomeschool.com/program/ai-and-machine-learning)。
让我们开始吧。
大局观
在我们进一步深入之前,先快速说明一下token(词元)。一个 token 是一小段文本,大致相当于一个单词或单词的一部分。模型一次读取和生成一个 token。当我们说“下一个 token“时,指的是模型产生的下一个文本片段。
一个标准的大型语言模型在我们提问后会立即回答。它逐个预测下一个 token,然后我们得到回复。
大型推理模型的做法则不同。在给出最终答案之前,它首先会进行思考。它会写下长长的内部思考过程(scratchpad),检查自己,有时还会改变想法,然后才说出答案。
简单来说:
大型推理模型 = 一个经过训练先思考后回答的大型语言模型。
什么是大型推理模型(LRM)?
我们来分解一下这个名字:
LRM = Large(大型)+ Reasoning(推理)+ Model(模型)
- 大型——它拥有数十亿个参数,通常在
7B到700B+的范围内,就像普通的大型语言模型一样。 - 推理——它不会直接给出答案,而是先生成一系列中间步骤。
- 模型——它仍然是一个预测下一个 token 的神经网络。
因此,大型推理模型是一个经过特殊训练的大型语言模型,它会在给出最终答案之前花费额外的 token 进行思考。这些模型也被称为推理模型或思考模型,它们指的是同一回事。我们可能听说过的一些例子:OpenAI 的 GPT-5.5 Thinking、DeepSeek R1、Qwen3、Google 的 Gemini 3 的 Deep Think、Anthropic 在 Claude 中的 extended thinking 模式,以及 xAI 的 Grok 4.1 的 Think 模式。
LLM 与 LRM 对比
理解 LRM 的最佳方法是将其与普通的 LLM 进行比较。假设我们同时向两者提问一个简单的文字题。为了保持对比的清晰,我们将在整篇博客中重复使用这个同样的问题。
一家商店以 5 卢比 2 支的价格出售笔,以 12 卢比 3 本的价格出售笔记本。我们买了 6 支笔和 9 本笔记本。我们总共需要支付多少卢比?
普通的 LLM 可能在 1 秒内回答,只生成几个 token,比如 “51 卢比”,有时会因为试图一次性猜测而答错。
大型推理模型则采取不同的路径。它首先进行思考——计算单位成本、相乘、相加、验证总数——然后才写下最终答案。对于这样一个小问题,思考过程可能使用几百个推理 token。对于更困难的问题,它可以延伸到数千甚至数万个 token。推理 token 通常对最终用户隐藏,我们只看到最终答案。但模型付出了思考的代价,这就是答案更准确的原因。
下面是它们各自做法的快速可视化:
LLM:[问题] ---> [简短答案] (快速, 有时错误)
LRM:[问题] ---> [长思考过程] ---> [简短答案] (慢, 但通常更正确)
在这里,我们可以看到 LRM 在中间添加了一个思考步骤,而 LLM 完全跳过了这个步骤。
让我将 LLM 和 LRM 之间的差异用表格列出,以便您更好地理解,从而根据您的使用场景决定使用哪一种。
| 方面 | 标准 LLM | 大型推理模型 (LRM) |
|---|---|---|
| 回答风格 | 直接,一次性 | 先思考,后回答 |
| 使用的 token 数 | 少 (100 到 500) | 多 (5,000 到 50,000) |
| 延迟 | 1 到 3 秒 | 10 到 120 秒 |
| 每次查询成本 | 低 | 高 10x 到 30x |
| 优势 | 简单聊天、摘要、起草 | 数学、代码、逻辑、规划 |
| 劣势 | 困难的多步骤问题 | 对于简单任务,速度慢且昂贵 |
两者都很有用,只是适用于不同的工作。
LRM 实际上是如何思考的?
以上是 LLM 和 LRM 之间的区别。现在,让我们了解当 LRM 思考时内部究竟发生了什么。
LRM 内部的思考只是更多的文本。没有神奇的新组件。模型以 token 的形式写出其思维过程,就像它写出任何其他 token 一样。这长串的内部文本通常被称为推理轨迹或思考过程。
对于我们上面关于笔和笔记本的问题,它看起来大致如下:
Pens: 2 pens cost 5 rupees, so 1 pen costs 2.5 rupees.
6 pens cost 6 * 2.5 = 15 rupees.
Notebooks: 3 notebooks cost 12 rupees, so 1 notebook costs 4 rupees.
9 notebooks cost 9 * 4 = 36 rupees.
Total = 15 + 36 = 51 rupees.
Let me verify.
6 pens means 3 packs of 2 pens, each pack 5 rupees, so 3 * 5 = 15. Correct.
9 notebooks means 3 packs of 3 notebooks, each pack 12 rupees, so 3 * 12 = 36. Correct.
Total 15 + 36 = 51. Correct.
We pay 51 rupees in total.
在这里,我们可以看到三件事:
- 模型将问题分解成更小的步骤。
- 它尝试一种方法,计算中间值,并将它们写下来。
- 在给出最终回复之前,它会在最后检查自己的答案。
这与一个细心的学生在考试中在草稿纸上遵循的模式相同。草稿纸就是推理轨迹,最终答案就是学生在答题纸上写的内容。
一个简单的流程图:
用户问题
|
v
+-------------------+
| LRM 思考 | <-- 长内部草稿
| (推理轨迹) | (通常对用户隐藏)
+-------------------+
|
v
最终简短答案
在许多产品中(如 GPT-5.5 Thinking,我们只看到一个简短摘要),推理轨迹是隐藏的;而在其他一些产品中(如 DeepSeek R1),它是可见的。
我们有一个关于推理模型、LLM 内部原理和思维链(CoT)提示的完整课程——请查看 Outcome School 的人工智能与机器学习课程 (https://outcomeschool.com/program/ai-and-machine-learning)。
测试时计算:思考得越久越聪明
这是 LRM 背后最重要的思想之一。在普通的 LLM 中,我们通过训练更大的模型、在更多数据上训练来使模型更聪明。这就是训练时计算。我们在训练期间一次性付出代价,然后每次回答都很快。
LRM 增加了第二个旋钮,称为测试时计算。这意味着模型在回答的那一刻变得更聪明,通过更长时间的思考。
让我们用 OpenAI 在 AIME 2024 数学竞赛(一项困难的高中竞赛)上的实际公布数据来理解这一点:
- GPT-4o(一个普通的 LLM,没有扩展推理):正确率大约
12%。 - o1(一个 LRM,进行一次完整的推理尝试):正确率大约
74%。 - o1 经过
64次并行尝试的多数投票:正确率大约83%。 - o1 在
1,000次尝试中重新排序:正确率大约93%。
第一行是作为基准的普通 LLM。接下来的三行是同一个 o1 模型——行与行之间变化的纯粹是我们在回答时允许它花费的测试时计算量。这就是为什么我们说 LRM 随测试时计算而扩展。
用我们的学生类比来说,这就像在考试中给同一个学生更多的草稿纸。同一个学生,同一个大脑,但更长的草稿纸往往能带来更好的最终答案。
但是,这里有一个问题。思考更多并不是免费的。更多的 token 意味着更多的时间和更高的成本。将思考 token 数量加倍大致会使该查询的输出成本加倍,而输出成本通常是 LRM 账单的大部分。
这种权衡——更慢的速度,更高的准确性——是 LRM 作为独立模型类别存在的核心原因。
注意: 许多 LRM 的 API 允许我们控制模型被允许思考的程度。例如,我们可以设置一个思考预算,如 1,024、8,192 或 32,768 个 token。小预算给出快速且廉价的答案,大预算给出缓慢但更准确的答案。我们可以根据我们的使用场景来调整这个旋钮。较新的 API 正在朝着自适应思考发展,其中模型根据查询的复杂度自行决定思考多少,而不是由我们设置固定预算。
LRM 是如何训练的?
现在我们了解了 LRM 在回答时如何思考,接下来让我们了解它最初是如何学会思考的。
普通的 LLM 分两个主要阶段进行训练:在大量的互联网文本上进行预训练,以及指令调优使其学会遵循我们的提示。
LRM 在此基础上增加了一个阶段:针对推理任务的强化学习 (https://outcomeschool.com/blog/reinforcement-learning)。
思路很简单:
- 向模型提出一个已知正确答案的难题。
- 让它并行生成许多长的推理轨迹(对于同一个问题,生成
16、32或64条轨迹)。 - 检查哪些轨迹得出了正确的最终答案。数学问题有明确的正确答案,因此这种检查简单且自动。
- 相对于组内其他轨迹对每条轨迹进行评分。比组平均值表现更好的轨迹被强化,表现较差的被惩罚。
- 更新模型,使其下次更有可能遵循好的推理模式。
注意: 这种组内相对评分是用于训练 DeepSeek R1 的算法 GRPO(组相对策略优化)(https://outcomeschool.com/blog/group-relative-policy-optimization-grpo) 的核心。这种“与组比较,而非与绝对目标比较“的技巧使得 RLVR 在这个规模下稳定。
这被称为具有可验证奖励的强化学习(RLVR)。可验证这个词很重要,意味着奖励来自一个简单的自动检查器,而不是人为意见。检查器可以是:
- 数学:最终数字是否与正确答案匹配?
- 代码:生成的代码是否通过了所有单元测试?
- 逻辑:答案是否与谜题的已知方案匹配?
因为奖励是自动的,我们可以在没有人类介入的情况下运行这个训练循环数百万次。
用我们的学生类比,我们在教学生哪种草稿纸模式能得出正确的最终答案。我们让他们尝试多次,对每次尝试进行评分,并奖励胜出者。随着时间的推移,模型学会了有用的习惯,例如:
- 在解决问题之前先分解问题。
- 尝试一步,检查单元,然后继续。
- 发现错误,回溯,并尝试不同的方法。
这正是我们在长的推理轨迹中看到的。
要动手学习强化学习、RLHF 以及推理模型背后的训练,请查看 Outcome School 的人工智能与机器学习课程 (https://outcomeschool.com/program/ai-and-machine-learning)。
输入与输出:训练阶段与预测阶段
现在,让我们通过查看在训练阶段和预测阶段输入模型和从模型输出的确切示例,将一切整合起来,包括 LLM 和 LRM。
训练阶段:标准 LLM
在 LLM 训练中,模型看到一段文本,下一个 token 被隐藏,它必须预测那个 token。
输入给模型:
The capital of France is
模型输出(预测的下一个 token):
Paris
数据中实际的下一个 token 也是 “Paris”。模型答对了,所以损失很小。如果模型预测了 “London”,损失会很大,权重会被调整以修正。
训练阶段:大型推理模型
在 LRM 训练中,模型看到一个已知正确答案的难题。它生成多个完整的求解尝试。
输入给模型:
A shop sells pens at 2 for 5 rupees, and notebooks at 3 for 12 rupees. We buy 6 pens and 9 notebooks. How much do we pay in total?
模型输出(16 次尝试轨迹之一):
Pens: 2 pens cost 5 rupees, so 1 pen costs 2.5 rupees.
6 pens cost 6 * 2.5 = 15 rupees.
Notebooks: 3 notebooks cost 12 rupees, so 1 notebook costs 4 rupees.
9 notebooks cost 9 * 4 = 36 rupees.
Total = 15 + 36 = 51 rupees.
Let me verify.
6 pens means 3 packs of 2 pens, each pack 5 rupees, so 3 * 5 = 15. Correct.
9 notebooks means 3 packs of 3 notebooks, each pack 12 rupees, so 3 * 12 = 36. Correct.
Total 15 + 36 = 51. Correct.
We pay 51 rupees in total.
在训练期间,模型被要求为同一个问题生成许多这样的尝试——比如同时生成 16 条轨迹。一个简单的检查器将每条轨迹的最终答案与已知正确答案 “51 rupees” 进行比较。可能有 6 条轨迹得到了 51,而 10 条得到了错误的答案,如 48 或 54。这 6 条好的轨迹得分高于组平均值,被强化;10 条错误的轨迹得分低于组平均值,被惩罚。然后模型被更新,以产生更多有益的轨迹。
预测阶段:标准 LLM
模型已经训练完成。我们给它一个提示,它产生一个答案。
输入给模型:
Write a haiku about rain.
模型输出:
Soft drops on the leaves,
A grey sky weeps to the earth,
Spring whispers goodbye.
模型直接从提示到答案,没有内部思考步骤。用户看到完整的输出。
预测阶段:大型推理模型
模型已经训练完成。我们给它一个提示,它先产生一个思考轨迹,然后产生最终答案。
输入给模型:
A shop sells pens at 2 for 5 rupees, and notebooks at 3 for 12 rupees. We buy 6 pens and 9 notebooks. How much do we pay in total?
模型输出:
...
We pay 51 rupees in total.
... 内的文本是长的推理轨迹。其后的行是最终答案。在许多产品中,用户只看到 “We pay 51 rupees in total.” —— 轨迹被隐藏。
注意,这正是我们在上述训练示例中使用的同一个问题。在训练期间,这是 16 条尝试轨迹之一,根据已知答案 “51” 进行评分。在预测期间,模型现在产生相同类型的轨迹,因为训练恰好奖励它这样做。
四种情况的快速回顾
- 在 LLM 训练中,输入是一段文本,输出是下一个 token。损失衡量预测的 token 与实际下一个 token 的接近程度。
- 在 LRM 训练中,输入是一个已知答案的难题,输出是一个完整的推理轨迹,以最终答案结束。奖励检查最终答案是否正确。
- 在 LLM 预测中,输入是用户提示,输出是直接答案。
- 在 LRM 预测中,输入是用户提示,输出是一个长的内部思考轨迹,后跟一个短的最终答案。
何时使用 LRM,何时使用普通 LLM
现在我们已经确切地看到了两种模型的输入和输出,最
相似文章
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
学习如何让大语言模型进行推理
OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。
@jiqizhixin:太棒了!关于推理型LLM的强化学习现状 https://aweers.de/blog/2026/rl-for-llms/…
一篇全面回顾推理型LLM强化学习现状的博文,涵盖从REINFORCE、PPO到GRPO乃至更多方法,并与InstructGPT、DeepSeek-R1等关键模型相联系。
@pallavishekhar_: https://x.com/pallavishekhar_/status/2058460434035060758
解释大型语言模型实际所做的工作(下一个Token预测),以及为什么即使出错时它们听起来也很有信心。提供了一种心智模型和验证检查清单,用于安全使用LLM。
强化学习能否教会大型语言模型进行长程推理?表达力是关键
本文介绍了 ScaleLogic 框架,该框架证明了强化学习的训练计算资源消耗遵循与大型语言模型推理深度相关的幂律分布。文章强调,逻辑表达力对于提升下游迁移能力和训练效率至关重要。