公平强化学习

Reddit r/AI_Agents 论文

摘要

公平强化学习引入了民主对齐,以整合来自不同代理的多个竞争性价值集,克服了传统RLHF的局限性,并通过黑盒策略包装器实现了数量级更快的优化。

**ICLR 2026 论文** * ⚖️ **民主对齐:** 无缝整合来自不同代理的多个竞争性价值集,超越了传统RLHF的“一刀切”局限。 * 📦 **黑盒策略优化:** 作为围绕*标准策略优化*算法的包装器运行,消除了对状态或动作总数的直接依赖。 * 🚀 **数量级加速:** 大幅降低样本复杂度,与先前的表格方法相比,计算效率提升数个数量级。
查看原文

相似文章

面向公平强化学习的推理时策略对齐

arXiv cs.LG

本文提出了一种推理时策略塑形框架,受大语言模型推理时对齐的启发,无需重新训练即可将预训练的强化学习策略引导至基于福利的公平目标。

偏好平均导致的RLHF程序公平性失败

arXiv cs.LG

本文指出,RLHF因平均化异质偏好而导致程序公平性失败:多数群体主导奖励学习,少数偏好代表性不足。文章提出了偏好感知RLHF(PA-RLHF),在受控实验中提升了对齐准确率并缩小了公平性差距。

FBOS-RL:反馈驱动的双目标协同强化学习

arXiv cs.LG

本文提出FBOS-RL,一个反馈驱动的双目标协同强化学习框架,通过使用反馈引导的探索和两个相互增强的训练目标——面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)——来提升训练效率和性能上限,优于GRPO在大语言模型对齐和推理中的表现。