标签
本文将对偏好的奖励学习重新定义为人机自主团队问题,指出知道目标的教师能够设计出比学习者驱动的查询选择更高效的训练示例。文章引入了带有二阶心理理论的理解陈述,以保持教师对学习者模型的同步,并通过仿真表明该方法优于学习者主导的选择。
本文提出了一种基于EM的算法,在Boltzmann理性模型下从成对比较中联合学习项目奖励和工人可靠性,利用Polya-Gamma潜在变量实现可处理的优化。实验表明,该方法在众包和奖励学习场景中对垃圾制造者和对抗性工人具有鲁棒性。
提出了面向纠正的策略优化(CIPO),这是对RLVR的一种扩展,它将失败轨迹转化为面向纠正的监督信号,从而在数学和代码基准测试中提升LLM的推理与纠错能力。
本文识别了逆强化学习(IRL)中观测缺失的问题,该问题可能导致专家行为看似次优,并提出了一种实用算法,用于量化使专家行为显得最优所需的最小扰动,并在合成任务、癌症治疗模拟和ICU数据上进行了验证。
# 论文页面 - GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调 来源:[https://huggingface.co/papers/2604.14258](https://huggingface.co/papers/2604.14258) ## 摘要 Group Fine-Tuning 通过利用多样化的回复群组和自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。大语言模型通常在后训练中使用[监督微调](https://hug