hierarchical-rl

标签

Cards List
#hierarchical-rl

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

arXiv cs.AI ↗ · 2026-08-05 缓存

This paper proposes InK, a neurosymbolic hierarchical reinforcement learning approach that uses incremental knowledge for symbolic planning and reward-shaped low-level neural modules, achieving improved sample efficiency in navigation tasks.

0 人收藏 0 人点赞
#hierarchical-rl

HOBA: 面向自适应在线广告的分层在线策略竞价代理

arXiv cs.AI ↗ · 2026-07-29 缓存

HOBA提出了一种用于在线广告的分层强化学习框架,该框架利用大型语言模型进行超参数推断,使用SARSA代理进行专家模型选择,并通过动态专家池执行出价,在大规模A/B测试中实现了+3.6%的提升。

0 人收藏 0 人点赞
#hierarchical-rl

NFTR:从可证明的模式平均到离线目标条件强化学习中的测地线子目标选择

arXiv cs.LG ↗ · 2026-07-10 缓存

本文提出NFTR,一种用于离线目标条件强化学习的方法,该方法使用归一化流作为子目标策略,并采用三角松弛重新加权以解决层次隐式Q学习中的乐观偏差和模式坍缩问题。

0 人收藏 0 人点赞
#hierarchical-rl

基于约束流形控制的安全且可泛化的分层多智能体强化学习

arXiv cs.AI ↗ · 2026-06-24 缓存

本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。

0 人收藏 0 人点赞
#hierarchical-rl

利用局部动态规律实现离线分层强化学习中的可复用技能

arXiv cs.AI ↗ · 2026-05-27 缓存

本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。

0 人收藏 0 人点赞
#hierarchical-rl

面向法律探究型对话代理的双层次对话策略学习

arXiv cs.CL ↗ · 2026-05-15 缓存

介绍了一种用于法律对话中主动信息提取的探究型对话代理(ICA),提出了一个双层次强化学习框架,该框架学习何时以及如何提出探测性问题,并在美国最高法院口头辩论数据上进行评估。

0 人收藏 0 人点赞
#hierarchical-rl

StraTA:通过策略轨迹抽象激励智能体强化学习

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。

0 人收藏 0 人点赞
#hierarchical-rl

Agent Lightning: 使用强化学习训练任何AI智能体

Papers with Code Trending ↗ · 2025-08-05 缓存

Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈