标签
HuatuoGPT-3-27B 是一个基于 Qwen3.8-27B 构建的医疗语言模型,采用单阶段策略优化 (OnePO),这是一种无需监督微调的强化学习领域适应方法。
本文提出QRLQ,一种量子强化学习框架,该框架将参数化量子电路与dueling double deep Q-networks集成,以优化量子云编排中的成本与延迟权衡,实现在成本和延迟上优于启发式基线,同时参数量少于经典DRL。
本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。
本文提出Wasserstein-Tilted Flow Maps(WTF),一种无需模拟的强化学习算法,用于微调基于流的生成模型以增强奖励对齐效果。该方法可在减少高达280倍计算量的情况下,实现比基线方法更高的奖励值。
本文识别出'Preference Coverage Collapse'作为多目标强化学习后见重标注中的一种失败模式,并引入'her_mix'来缓解该问题,从而在各种设置下提升性能。
本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。
本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。
本文倡导使用范畴论和环境群胚来结构化部分可观测环境中的强化学习,利用对称性以提高样本效率和泛化能力。
SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。
本文提出 Planned Test-Time Scaling (PTTS),一种通过协调推理分支来提升挑战性任务性能的方法,在数学推理基准测试中相比重复采样取得了显著提升。
本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。
本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。
文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。
Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。
本文提出了一种代理引导分层强化学习框架,通过学习基于电池的负载整形策略来干扰非侵入式负载监测模式,从而防御针对智能电表数据的多种推理攻击。
本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。
本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。
本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。
ProcessLight 提出了一个基于大型语言模型的交通信号控制框架,该框架将决策分解为可验证的语义步骤,并采用逐步强化学习方法(STeP-PO)进行增强,以实现细粒度推理优化。
TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。