@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……
摘要
这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。
查看缓存全文
缓存时间: 2026/06/08 21:28
一篇关于推理模型训练后如何改进的入门论文
表明更好的推理模型更少依赖原始数据规模,更多依赖可验证的训练证据。
推理数据并非简单的问答对。有用的部分往往是那些指出答案、步骤、工具操作或整次尝试为何好或为何不好的反馈。
一条提示词和对应的回答只能告诉你模型说了什么,但无法说明:这个答案为什么变成了可学习的、是哪个评判机制认可了它、哪些失败被隐藏了,以及该技能是否已经存在于基础模型之中。
核心思路是将每个训练示例描述为一条记录,其中包含任务、模型行为、验证信号,以及关于该示例来源的元数据。
作者按验证方式对推理数据进行分类:例如数学和代码场景下基于规则的精确验证、智能体使用工具时的环境验证,以及在没有精确验证器时的人工或模型评判。
他们还解释了常见假设为何不成立——因为长的推理链可能是虚假的、更难的例子对某些模型可能毫无用处、而更大的数据集仍可能遗漏重要的覆盖范围。
关键在于:智能体数据应当保留混乱——失败的动作、重试、恢复、状态差异以及最终检查——因为学习信号往往就在其中。
链接 – arxiv.org/abs/2606.02113
标题:“A Primer in Post-Training Reasoning Data: What They Know About How It Works”
相似文章
@dair_ai:关于后训练推理数据的优秀入门指南。(收藏它)这是首批将分散的后……
一份全面的入门指南,综合了150多项关于后训练推理数据的公开研究,围绕四个关键问题组织该领域:数据对象、有用性、构建和扩展。
@rohanpaul_ai: 这篇论文揭示了AI推理中的一个奇怪弱点:模型可以解决数学问题,却无法判断推理过程。令人不安的是…
这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。
@rohanpaul_ai: 论文表明,当不丢弃任何过往信息时,智能体在长时间跨度内的推理能力更强。保留所有过往…
该论文提出了PRO-LONG,它为AI智能体采用了一种程序化、无损耗的记忆系统,将所有过往动作存储在一个结构化的文本日志中。这种方法显著提升了长期推理能力以及在ARC-AGI-3游戏上的表现,同时使用的token数量比更强的专用系统少4.2到5.8倍。
推理监督的哪些特性与下游模型质量的提升相关?
本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。
后训练如何塑造生物学推理模型
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。