@karminski3:为什么DS圈子里有这么多“键盘侠”专家?我刚测完deepseek-v4.1-flash,把思考强度拉到最大…
摘要
一位用户在测试deepseek-v4.1-flash模型后,对DeepSeek社区中脱离实际的“键盘侠”专家表示不满,主张思考强度设置影响模型表现,并引用DeepSeek-R1论文作为依据。
查看缓存全文
缓存时间: 2026/09/15 15:46
为什么DS圈子里总有这么多“键盘侠”?我刚测试完deepseek-v4.1-flash,明明把参数调到最高,结果评论区有人非说应该选“高”而不是“最高”。就好比我买了辆法拉利,你告诉我一档比二档更快,这不搞笑吗?然后他们还来一句“这不过是思考强度开关,跟性能无关”。扯淡,怎么可能没关系……大家都忘了DeepSeek去年发的DeepSeek-R1-Zero论文吗:http://arxiv.org/abs/2501.12948 那篇论文明明白白证明了思考强度越强,模型能力就越强。他们在里面做了轮Zero-SFT强化学习,没添加任何新知识,结果随着思考长度增加,AIME24分数居然从15%飙到71%。接着“大力出奇迹”的惊雷就像春笋一样席卷了整个行业……
给DS新手们的建议:吵之前先读论文——你们这简直是在自毁长城啊。
DeepSeek-R1:通过强化学习激发大语言模型的推理能力
来源:https://arxiv.org/html/2501.12948
摘要
通用推理一直是人工智能领域长期存在且艰巨的挑战。最近的突破——以大语言模型(LLMs)(Brown et al., 2020 (https://arxiv.org/html/2501.12948#bib.bib29);OpenAI, 2023 (https://arxiv.org/html/2501.12948#bib.bib17))和思维链提示(Wei et al., 2022b (https://arxiv.org/html/2501.12948#bib.bib35))为代表——在基础推理任务上取得了相当大的成功。然而,这种成功严重依赖于大量人工标注的演示,并且模型在处理更复杂问题时能力仍显不足。本文表明,大语言模型的推理能力可以通过纯强化学习(RL)来激发,无需人工标注的推理轨迹。所提出的强化学习框架促进了高级推理模式的涌现发展,例如自我反思、验证和动态策略调整。因此,训练后的模型在可验证任务(如数学、编程竞赛和STEM领域)上取得了优异的性能,超越了通过传统监督学习(基于人类演示)训练的同类模型。此外,这些大规模模型展现出的涌现推理模式可以被系统性地利用,以指导和增强较小模型的推理能力。
关键词
大语言模型、推理、强化学习
1 引言
推理能力是人类智能的基石,它使从数学解题到逻辑演绎和编程等复杂认知任务成为可能。人工智能的最新进展表明,当大语言模型(LLMs)扩展到足够规模时,可以展现出包括推理能力在内的涌现行为(Wei et al., 2022a (https://arxiv.org/html/2501.12948#bib.bib13);Kaplan et al., 2020 (https://arxiv.org/html/2501.12948#bib.bib1))。然而,在预训练阶段获得此类能力通常需要巨大的计算资源。与此同时,另一条互补的研究路线表明,通过思维链(CoT)提示可以有效地增强大语言模型。这种技术——涉及提供精心设计的少量示例或使用“让我们一步一步思考”这样的最小提示(Wei et al., 2022b (https://arxiv.org/html/2501.12948#bib.bib35);Kojima et al., 2022 (https://arxiv.org/html/2501.12948#bib.bib82))——使模型能够产生中间推理步骤,从而显著提高其在复杂任务上的性能。类似地,当模型在后训练阶段学习高质量的多步推理轨迹时,也观察到了进一步的性能提升(OpenAI, 2023 (https://arxiv.org/html/2501.12948#bib.bib17);Chung et al., 2024 (https://arxiv.org/html/2501.12948#bib.bib92))。
尽管这些方法很有效,但它们也表现出明显的局限性。它们对人工标注推理轨迹的依赖阻碍了可扩展性,并引入了认知偏差。此外,通过限制模型复制人类的思维过程,其性能天生就被人类提供的范例所限制,这阻碍了对更优的、非人类推理路径的探索。
为了解决这些问题,我们旨在探索大语言模型在强化学习框架下通过自我进化发展推理能力的潜力,同时尽量减少对人工标注努力的依赖。具体来说,我们基于DeepSeek-V3-Base(DeepSeek-AI, 2024b (https://arxiv.org/html/2501.12948#bib.bib33))构建模型,并采用群体相对策略优化(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2501.12948#bib.bib12))作为我们的强化学习框架。奖励信号仅基于最终预测与真实答案的正确性,而不对推理过程本身施加约束。值得注意的是,我们跳过了强化学习训练之前的传统监督微调(SFT)阶段。这一设计选择源于我们的假设:人类定义的推理模式可能限制模型的探索,而无约束的强化学习训练则能更好地激发大语言模型涌现新的推理能力。
通过这一过程(详见第2节(https://arxiv.org/html/2501.12948#S2)),我们的模型(称为DeepSeek-R1-Zero)自然发展出多样化且复杂的推理行为。在解决推理问题时,该模型倾向于生成更长的回答,在每个回答中包含验证、反思以及探索替代方法。虽然我们没有明确教导模型如何推理,但它通过强化学习成功地学习到了改进的推理策略。
尽管DeepSeek-R1-Zero展现了出色的推理能力,但它也面临着可读性差和语言混合等问题,偶尔会在单个思维链回答中混合使用英文和中文。此外,DeepSeek-R1-Zero基于规则的强化学习训练阶段仅局限于推理任务,导致其在写作和开放域问答等更广泛领域的表现有限。
为了应对这些挑战,我们引入了DeepSeek-R1,这是一个通过多阶段学习框架训练的模型,融合了拒绝采样、强化学习和监督微调,详见第3节(https://arxiv.org/html/2501.12948#S3)。这一训练流程使DeepSeek-R1能够继承其前身DeepSeek-R1-Zero的推理能力,同时通过额外的非推理数据使模型行为与人类偏好对齐。
为了在更低能耗下提供更广泛的强大AI访问,我们蒸馏了几个较小模型并公开发布。这些蒸馏后的模型展现出强大的推理能力,超越了其原始指令微调对应模型的性能。我们相信,这些指令微调版本也将通过提供有价值的资源来帮助理解长思维链(CoT)推理模型背后的机制,并促进更强大推理模型的发展,从而对研究社区做出重大贡献。我们在https://huggingface.co/deepseek-ai公开发布了DeepSeek-R1系列模型。
2 DeepSeek-R1-Zero
我们将详细阐述DeepSeek-R1-Zero的训练,该训练完全依赖强化学习,无需监督微调。为提高大规模强化学习的效率,我们采用了群体相对策略优化(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2501.12948#bib.bib12))。
2.1 群体相对策略优化
GRPO(Shao et al., 2024 (https://arxiv.org/html/2501.12948#bib.bib12))是我们用来训练DeepSeek-R1-Zero和DeepSeek-R1的强化学习算法。它最初被提出是为了简化训练过程并减少近端策略优化(PPO)(Schulman et al., 2017 (https://arxiv.org/html/2501.12948#bib.bib72))的资源消耗,而PPO被广泛用于大语言模型的强化学习阶段(Ouyang et al., 2022 (https://arxiv.org/html/2501.12948#bib.bib36))。对于每个问题q,GRPO从旧策略πθold中采样一组输出{o1,o2,⋯,oG},然后通过最大化以下目标函数来优化策略模型πθ:
JGRPO(θ)=E[q∼P(Q),{oi}i=1G∼πθold(O|q)]1G∑i=1G(min(πθ(oi|q)πθold(oi|q)Ai,clip(πθ(oi|q)πθold(oi|q),1−ε,1+ε)Ai)−βDKL(πθ||πref)), DKL(πθ||πref)=πref(oi|q)πθ(oi|q)−logπref(oi|q)πθ(oi|q)−1, 其中πref是参考策略,ε和β是超参数,Ai是优势值,使用每组输出对应的奖励{r1,r2,…,rG}计算:Ai=ri−mean({r1,r2,⋯,rG})std({r1,r2,⋯,rG}).
我们在补充材料A.3(https://arxiv.org/html/2501.12948#A1.SS3)中对GRPO和PPO进行了比较。
为了训练DeepSeek-R1-Zero,我们将学习率设置为3e-6,KL系数设置为0.001,采样温度设置为1。对于每个问题,我们在8.2k步之前采样16个输出,最大长度为32,768个令牌,之后为65,536个令牌。结果,DeepSeek-R1-Zero的性能和响应长度在8.2k步时均出现显著跃升,训练总共持续了10,400步,对应1.6个训练周期。每个训练步骤包含32个不同的问题,训练批次大小为512。每400步,我们用最新的策略模型替换参考模型。为了加速训练,每次展开生成8,192个输出,随机分成16个迷你批次,仅训练一个内部周期。
表1:DeepSeek-R1-Zero的模板。提示将在训练期间被替换为具体的推理问题。 User和Assistant之间的对话。用户提出问题,助手解决它。助手首先在脑海中思考推理过程,然后为用户提供答案。推理过程和答案分别包含在…和…标签中,即:推理过程在这里答案在这里。用户:提示。助手:
我们的高性能强化学习基础设施在补充材料B.1(https://arxiv.org/html/2501.12948#A2.SS1)中有描述,确保了可扩展且高效的训练。
2.2 奖励设计
奖励是训练信号的来源,决定了强化学习优化的方向。对于DeepSeek-R1-Zero,我们采用基于规则的奖励,为数学、编码和逻辑推理领域的数据提供精确的反馈。我们的基于规则的奖励系统主要由两种奖励组成:准确性奖励和格式奖励。
准确性奖励评估回答是否正确。例如,在具有确定性结果的数学问题中,要求模型以指定格式(例如,在框内)提供最终答案,从而实现可靠的基于规则的正确性验证。类似地,对于编程竞赛提示,可以使用编译器根据一组预定义的测试用例来评估模型的回答,从而生成关于正确性的客观反馈。
格式奖励通过强制执行特定的格式要求来补充准确性奖励模型。特别是,模型被激励将其推理过程封装在指定的标签内,即“”和“”。这确保了模型的思维过程被清晰地勾勒出来,增强了可解释性并便于后续分析。
Rewardrule=Rewardacc+Rewardformat
准确性奖励和格式奖励以相同权重组合。值得注意的是,我们避免对推理任务使用神经奖励模型——无论是基于结果的还是基于过程的。这一决定基于我们的观察:神经奖励模型在大规模强化学习过程中容易受到奖励黑客攻击的影响。此外,重新训练此类模型需要大量的计算资源,并为训练流程增加了额外的复杂性,从而使整体优化过程变得复杂。
2.3 在大语言模型中激发推理能力
具体来说,我们在DeepSeek-V3基础模型上应用强化学习技术来训练DeepSeek-R1-Zero。在训练过程中,我们设计了一个简单的模板,要求DeepSeek-R1-Zero首先产生推理过程,然后给出最终答案。我们有意将限制仅限于这种结构格式,避免任何内容特定的偏差,以确保我们能准确观察到模型在强化学习过程中的自然进展。
图1:(a)DeepSeek-R1-Zero在训练期间的AIME准确率。AIME以数学问题为输入,数字为输出,如表32(https://arxiv.org/html/2501.12948#A10.T32)所示。Pass@1和Cons@16的描述见补充材料D.1(https://arxiv.org/html/2501.12948#A4.SS1.SSS0.Px4)。基线是人类参与者在AIME竞赛中的平均得分。(b)DeepSeek-R1-Zero在强化学习过程中在训练集上的平均响应长度。DeepSeek-R1-Zero自然地学会了通过更多的思考时间来解决推理任务。注意,训练步骤指的是单次策略更新操作。
图1(https://arxiv.org/html/2501.12948#S2.F1)(a)描绘了DeepSeek-R1-Zero在整个强化学习训练过程中在AIME 2024基准测试上的性能轨迹,其中AIME 2024的平均pass@1分数显著提高,从最初的15.6%跃升至77.9%。此外,通过利用自一致性解码(Wang et al., 2023c (https://arxiv.org/html/2501.12948#bib.bib54)),模型的性能可以进一步提高,达到86.7%的准确率。这一性能显著超越了所有人类参赛者的平均水平。
除了数学竞赛,如图10(https://arxiv.org/html/2501.12948#A4.F10)所示,DeepSeek-R1-Zero在编程竞赛以及研究生级别的生物学、物理学和化学问题上也取得了显著的性能。这些结果凸显了强化学习在增强大语言模型推理能力方面的有效性。
表2:DeepSeek-R1-Zero一个中间版本的有趣的“顿悟时刻”。模型学会了
相似文章
DeepSeek-V4 Flash 实际表现如何?
对 DeepSeek-V4 Flash 的性能和能力的评估,评估其实际有效性。
DeepSeek V4 Flash 搭配 Antirez Dwarfstar 4 表现惊人
本文强调了在高内存Mac上使用DeepSeek V4 Flash搭配Antirez Dwarfstar 4的出色性能,指出其超越其他AI模型,并减少了对更大系统的需求。
@danveloper: 简直不敢相信,我竟然在树莓派 5(8GB 版)上以超过1 tok/s的速度运行了 DeepSeek-V4-Flash(284B 参数)……
一位开发者经过大量实验,成功在树莓派 5 上以超过1 tok/s的速度运行了284B参数的DeepSeek-V4-Flash模型,使用的是来自 antirez 的未经修改的 GGUF 文件。
Deepseek v4 Flash 确实惊艳,正准备入手一台 2.5 万美元的电脑
作者称赞 DeepSeek V4 Flash 实现了高性能的本地大语言模型部署,为此计划斥资 2.5 万美元采购硬件,以为对数据隐私要求严格的客户服务。
DeepSeek v4 Flash 在 4090 + DDR5 上的体验
一位用户分享了在 24GB 显卡和 DDR5 内存上运行 DeepSeek v4 Flash 模型的体验,包括性能数据和优化技巧。