标签
This paper proposes InK, a neurosymbolic hierarchical reinforcement learning approach that uses incremental knowledge for symbolic planning and reward-shaped low-level neural modules, achieving improved sample efficiency in navigation tasks.
HOBA提出了一种用于在线广告的分层强化学习框架,该框架利用大型语言模型进行超参数推断,使用SARSA代理进行专家模型选择,并通过动态专家池执行出价,在大规模A/B测试中实现了+3.6%的提升。
本文提出NFTR,一种用于离线目标条件强化学习的方法,该方法使用归一化流作为子目标策略,并采用三角松弛重新加权以解决层次隐式Q学习中的乐观偏差和模式坍缩问题。
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。
介绍了一种用于法律对话中主动信息提取的探究型对话代理(ICA),提出了一个双层次强化学习框架,该框架学习何时以及如何提出探测性问题,并在美国最高法院口头辩论数据上进行评估。
StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。
Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。