标签
本文提出了JUROR,一种基于强化学习的框架,在集中训练与分散执行的模式下,联合优化时延容忍网络中的无人机飞行路径和分散式机会路由。
介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。
在 Atari Breakout 上进行了 123 次失败的 PPO 实验后,添加一个简单的接近奖励来追踪球的下落,最终实现了反应式的、非脚本化的玩法,并且能够迁移到不熟悉的砖块布局上。
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
本文提出一种基于图的交通信号控制接口,使用共享图神经网络为各个交通流向分配分数,并通过关联矩阵确定性地构造相位。实验评估了在合成和城市道路网络上的迁移效果,结果表明可行性,但对分布偏移敏感。
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。
安全探索者(SafeExplorer)引入了一种用于带有恢复干预的强化学习的无偏策略梯度估计器,在机器人任务上显著减少了训练期间的跌倒次数,同时达到或超过了标准PPO的最终奖励。
提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。
解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。
本文介绍了一种在强化学习智能体中诱导七种心理障碍的可控剂量方法,通过操作基于评估引导的PPO智能体中的认知评估信号。这些障碍自组织成一个二维情感空间,该框架可对障碍诱导和治疗进行建模。
本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。
本文引入频谱有效秩熵作为度量指标,用于在演员-评论家强化学习中测量和控制评论家复杂性,并在TD3和PPO实验中证明了其可测量性和可控性。
本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。
本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。
文章讲述了PPO算法作为ChatGPT核心对齐算法之一,曾在2017年被顶级AI会议NIPS拒稿,理由是创新性有限和提升不显著,揭示了学术界同行评审的弊端。
本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。