proximal-policy-optimization

标签

Cards List
#proximal-policy-optimization

面向轨迹跟踪的预期强化学习

arXiv cs.LG · 2026-07-07 缓存

本文提出了一种预测性深度强化学习公式,通过将未来参考视界加入状态空间,实现轨迹跟踪的预期控制。仿真结果显示误差显著降低,但零样本迁移到物理硬件时暴露了仿真与现实的差距。

0 人收藏 0 人点赞
#proximal-policy-optimization

物理信息神经网络在单自由度直升机系统安全强化学习中的应用

arXiv cs.LG · 2026-07-07 缓存

本文作为一项进展中研究,提出将可微物理模型嵌入PPO策略损失函数,以惩罚强化学习中预期的安全违规行为,并在模拟的单自由度直升机系统上进行评估。物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。

0 人收藏 0 人点赞
#proximal-policy-optimization

EVOM: 智能体元进化中的Actor-Critic架构强化学习方法

arXiv cs.LG · 2026-06-26 缓存

介绍了EVOM,一种基于LLM的设计智能体的智能体元进化框架,用于自动发现高性能的Actor-Critic架构,在连续控制任务上优于手动基线方法和先前方法。

0 人收藏 0 人点赞
#proximal-policy-optimization

ESPO:早期停止近端策略优化

Hugging Face Daily Papers · 2026-05-28 缓存

ESPO为强化学习引入了一种早期停止机制,能够检测并终止大语言模型中失败的推理轨迹,从而提升数学推理性能,同时减少超过20%的计算量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈