标签
本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。
本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。
本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。
ProcessLight 提出了一个基于大型语言模型的交通信号控制框架,该框架将决策分解为可验证的语义步骤,并采用逐步强化学习方法(STeP-PO)进行增强,以实现细粒度推理优化。
TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。
AutoGym提出一个框架,通过蓝图优先生成,从最小种子自动生成完整的智能体训练环境(包括任务、可执行环境和验证器),以确保可解性并实现主动课程综合,用于自适应难度调控。
DeepSeek Elastic Compute (DSec) 是专为大规模大语言模型有效代理训练设计的沙盒基础设施,具备弹性执行、统一SDK,并支持与强化学习框架集成。
本文介绍了VHD-Play,一个通过首先解决数学模型来生成多样化智能体强化学习环境的流程,显著提高了像Qwen3.6-35B-A3B这样的语言模型代理的训练效率,且成本低廉,并扩展到外部基准测试。
一条推文描述了为 MiMo-V2.6-Pro-RL AI 模型准备八张 RTX PRO 6000 显卡。
一位用户在Hugging Face上讨论了Mimo 2.6 AI模型的简单架构,将其与更复杂的近期模型进行比较,并将其性能归功于有效的强化学习。
MiMo 发布了 2.6 flash 版本,并引用了 Tianjun Zhang 关于在 TPUs 上使用 JAX 扩展强化学习的博客文章。
Bonnie Li,一位24岁的AI研究员,曾在Google DeepMind参与Gemini、Genie和SIMA项目,现已加入OpenAI担任研究科学家,致力于对齐超级智能。
本文提出了一种平衡监督微调和强化学习的方法,用于训练长期广告代理,表明定向RL可以减少数据泄露,并提升企业分析任务的性能。
本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。
对比世界模型提出了一种新方法,无需像素重建即可学习潜在动态,并通过对比目标来提高在视觉复杂环境中的鲁棒性和效率,适用于基于模型的强化学习。
本文利用奇异值分解分析LLM的后训练权重更新,识别出驱动性能提升的几何成分,表明重塑奇异值不如旋转和路由变化关键。
本文介绍了SHADE,一个使用GRPO微调的强化学习框架,旨在逃避AI文本检测器,在对抗替代检测器时实现了高逃避率,但对未见过的评估分类器的迁移效果有限。
一项研究合作介绍了ARLI,这是一种通过异步推理使用实时分块来启用视觉-语言-动作模型的强化学习微调的方法,通过让强化学习策略观察更近期的图像来改善机器人行为。
Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。
该论文为大型语言模型强化学习中的令牌级信用制定了正则条件,并介绍了策略对齐评论家训练(PACT),该方法在数学推理和编码基准测试中优于GRPO和PPO。