标签
本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。
本文提出Wasserstein-Tilted Flow Maps(WTF),一种无需模拟的强化学习算法,用于微调基于流的生成模型以增强奖励对齐效果。该方法可在减少高达280倍计算量的情况下,实现比基线方法更高的奖励值。
本文识别出'Preference Coverage Collapse'作为多目标强化学习后见重标注中的一种失败模式,并引入'her_mix'来缓解该问题,从而在各种设置下提升性能。
本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。
本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。
本文倡导使用范畴论和环境群胚来结构化部分可观测环境中的强化学习,利用对称性以提高样本效率和泛化能力。
SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。
本文提出 Planned Test-Time Scaling (PTTS),一种通过协调推理分支来提升挑战性任务性能的方法,在数学推理基准测试中相比重复采样取得了显著提升。
本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。
本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。
来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。
Rufus-Air 是一个开放且可复现的LLM后训练配方,详细描述了一个八阶段的流程,从基础到高级增强能力,相比现有模型如GLM-4.5-Air-Base有所改进。
本文介绍了Qwen-Planner-Agent,一个用于移动规划智能体可扩展开发的AI-for-AI闭环框架,整合了数据生成、训练和部署,以提升在真实世界任务和基准测试中的性能。
IterSynth介绍了一种针对深度搜索代理的角色解耦迭代合成范式,利用强化学习提高在长时搜索任务中的性能,并在基准测试中超越先前方法。
文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。
Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。
本文提出了一种代理引导分层强化学习框架,通过学习基于电池的负载整形策略来干扰非侵入式负载监测模式,从而防御针对智能电表数据的多种推理攻击。
本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。
本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。
本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。