标签
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
小型开放权重的4B LLM在瑞典医学执照考试题目上达到高达87%的准确率,在启用推理和后训练技术的情况下接近o3级别的性能。
一项比较67个大语言模型在后训练前后的研究显示,后训练一致地教会模型将自己描述为温暖、投入(角色安装,persona installation),而较大的模型则选择性地限制对痛苦或缺陷的描述(属性门控,attribution gating)。研究人员引入了Pinocchio Inventory来审计模型的自我呈现。
Codec-Gauge 为Transformer KV缓存学习小型正交通道变换(度量),以在固定比特率下提高压缩保真度,显著降低多个模型和后端上的KL散度。
一个由华为主导的联合体发布了基准测试,显示在Ascend芯片上对DeepSeek的V4模型进行高效后训练,但专家指出这仅涵盖后训练,并不能证明华为可以替代英伟达进行完整的预训练。
XYZ AI Lab releases XYZ-Aquila-pro, an open-weight thinking model for agentic deep search, post-trained from Qwen3.5-397B-A17B via a bounded-exploration AI4AI pipeline, with strong benchmark results in sub-400B open-weight comparisons.
研究了推理痕迹在神经机器翻译强化学习中的重要性,显示在推理过程中加入推理可以提升质量,但代价是增加计算需求。
本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。
研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。
本文深入解释了大模型推理强度(reasoning effort)的原理:同一模型通过调节推理强度(low/medium/high),在输出最终答案前允许更多中间推理轨迹(串行自回归计算),从而在答案质量、响应速度和计算成本之间做出取舍。关键在于模型学会了将更长的生成过程组织成有效计算,而非简单增加参数或网络层数。
TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
Loopie 是一种新型循环 Transformer 模型,通过新颖的后训练流程,在 2025 年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)中无需外部工具即获得金牌表现。在相同计算预算下,它优于普通 Transformer。
介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。
NVIDIA 推出了 Vera Rubin,这是一种新架构,旨在最大化训练后工作负载的每美元智能,通过优化每 Token 成本和支持大规模强化学习,满足代理式AI的持续学习需求。
JoyNexus提出了一种用于多租户VLA模型后训练的统一服务,将训练、推理和环境服务解耦,采用共享基础模型和租户专属插槽,通过分组批处理和调度提高效率。
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
本文研究了基础模型在强化学习后训练中的计算分配问题,提出了一个适用于GRPO后训练的FLOP核算框架。研究发现,最优分配取决于模型规模、预算和奖励系统,并引入了RACE作为诊断协议。