ppo

标签

Cards List
#ppo

基于强化学习的时延容忍网络中无人机飞行与机会路由联合优化

arXiv cs.AI · 2026-08-06 缓存

本文提出了JUROR,一种基于强化学习的框架,在集中训练与分散执行的模式下,联合优化时延容忍网络中的无人机飞行路径和分散式机会路由。

0 人收藏 0 人点赞
#ppo

SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG · 2026-08-05 缓存

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

0 人收藏 0 人点赞
#ppo

反应式玩法:实现了!!Atari Breakout 实验 [R]

Reddit r/MachineLearning · 2026-08-04

在 Atari Breakout 上进行了 123 次失败的 PPO 实验后,添加一个简单的接近奖励来追踪球的下落,最终实现了反应式的、非脚本化的玩法,并且能够迁移到不熟悉的砖块布局上。

0 人收藏 0 人点赞
#ppo

面向小规模语言模型智能体的稳健强化学习

arXiv cs.AI · 2026-07-29 缓存

本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。

0 人收藏 0 人点赞
#ppo

基于图控制的异构道路网络交通信号接口

arXiv cs.LG · 2026-07-27 缓存

本文提出一种基于图的交通信号控制接口,使用共享图神经网络为各个交通流向分配分数,并通过关联矩阵确定性地构造相位。实验评估了在合成和城市道路网络上的迁移效果,结果表明可行性,但对分布偏移敏感。

0 人收藏 0 人点赞
#ppo

元强化学习的拟蒙特卡洛初始化

arXiv cs.LG · 2026-07-27 缓存

本文探讨了在元强化学习中使用拟蒙特卡洛(QMC)方法进行权重初始化,与正交初始化相比,在类似的控制任务中显示出改进的收敛性。

0 人收藏 0 人点赞
#ppo

面向小规模语言模型智能体的鲁棒强化学习

Hugging Face Daily Papers · 2026-07-27 缓存

本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。

0 人收藏 0 人点赞
#ppo

PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架

arXiv cs.AI · 2026-07-21 缓存

PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。

0 人收藏 0 人点赞
#ppo

强化学习小手册

Hacker News Top · 2026-07-16 缓存

从基础到应用算法的强化学习简明介绍,包含PyTorch实现和补充证明。

0 人收藏 0 人点赞
#ppo

从评论家到置信度:用于语言定量预测与置信度估计的PPO

arXiv cs.CL · 2026-07-15 缓存

本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。

0 人收藏 0 人点赞
#ppo

安全探索者:一种针对带有恢复干预的强化学习的无偏策略梯度

arXiv cs.LG · 2026-07-13 缓存

安全探索者(SafeExplorer)引入了一种用于带有恢复干预的强化学习的无偏策略梯度估计器,在机器人任务上显著减少了训练期间的跌倒次数,同时达到或超过了标准PPO的最终奖励。

0 人收藏 0 人点赞
#ppo

用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers · 2026-07-12 缓存

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

0 人收藏 0 人点赞
#ppo

@xennygrimmato_: 如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法:M_t = max_v [ pi_the…

X AI KOLs Timeline · 2026-07-11 缓存

解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。

0 人收藏 0 人点赞
#ppo

强化学习智能体中跨诊断的类障碍表型空间

arXiv cs.LG · 2026-07-10 缓存

本文介绍了一种在强化学习智能体中诱导七种心理障碍的可控剂量方法,通过操作基于评估引导的PPO智能体中的认知评估信号。这些障碍自组织成一个二维情感空间,该框架可对障碍诱导和治疗进行建模。

0 人收藏 0 人点赞
#ppo

深度强化学习用于自主订单拣选机器人的动态电池管理

arXiv cs.LG · 2026-07-08 缓存

本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。

0 人收藏 0 人点赞
#ppo

演员-评论家强化学习中评论家复杂性的评估、度量与控制

arXiv cs.LG · 2026-07-02 缓存

本文引入频谱有效秩熵作为度量指标,用于在演员-评论家强化学习中测量和控制评论家复杂性,并在TD3和PPO实验中证明了其可测量性和可控性。

0 人收藏 0 人点赞
#ppo

重新审视复杂动作空间中的动作分解

arXiv cs.LG · 2026-06-26 缓存

本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。

0 人收藏 0 人点赞
#ppo

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG · 2026-06-24 缓存

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

0 人收藏 0 人点赞
#ppo

@Phoenixyin13: 如今大名鼎鼎、作为 ChatGPT 底层核心对齐算法之一的 PPO,在 2017 年竟然被顶级 AI 会议 NIPS(现 NeurIPS)给拒了。 更讽刺的是审稿人给出的理由: 创新性有限 对比基线提升不够显著 这个现象,直接扯下了学术界…

X AI KOLs Timeline · 2026-06-18 缓存

文章讲述了PPO算法作为ChatGPT核心对齐算法之一,曾在2017年被顶级AI会议NIPS拒稿,理由是创新性有限和提升不显著,揭示了学术界同行评审的弊端。

0 人收藏 0 人点赞
#ppo

@johnschulman2: PPO在LLM时代迎来了第二波,原因超出了原始论文的预期——重要性比率目标会修正由数值误差、异步训练和前向传播噪声引起的偏差——而裁剪目标通过一种我们当初发表时未知的机制影响熵(DAPO, https://arxiv.org/abs/2509.26114)

X AI KOLs Following · 2026-06-18 缓存

本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈