标签
本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。
提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
本文提出了一种多目标贝叶斯优化方法,用于自动化强化学习中的权重选择以实现节能控制,并在物理Quanser Aero 2测试平台上展示了优于网格搜索的样本效率。
提出了Agentic-Ideation框架,用于高效合成智能体轨迹以训练LLMs进行科学构想,实现了超过10倍的样本效率提升,并优于现有的基于工作流的基线方法。
AC-ODM 使用强化学习动态优化大语言模型的预训练数据组成,实现了更快的收敛速度和更高的下游任务准确率,且计算开销可忽略不计。
本文发现了一种基于LLM的LEGO组装生成中的失败模式PhysHack,并提出PVPO,一种结合基于模型的数据选择的高效样本强化学习方法,仅使用一小部分训练数据即可改善物理和语义对齐。
ChainzRule 提出了一种具有可学习多项式层和微分正则化的神经架构,在表格、NLP和视觉任务上实现了样本高效且鲁棒的性能,在Pima Diabetes、SST-5、Yelp Full和CIFAR-10-C数据集上取得了成果。