policy-optimization

标签

Cards List
#policy-optimization

@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……

X AI KOLs Timeline · 3天前 缓存

一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。

0 人收藏 0 人点赞
#policy-optimization

基于非确定性因果模型的鲁棒反事实策略优化

arXiv cs.LG · 4天前 缓存

本文形式化了在概率非确定性因果模型下马尔可夫决策过程的反事实策略优化,该模型将潜在混杂因素与固有随机性分开,并提出了一种实用的优化程序来推导鲁棒的反事实策略。该方法在脓毒症治疗模拟器上得到验证,其中糖尿病状态作为未观测的全局混杂因素。

0 人收藏 0 人点赞
#policy-optimization

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI · 4天前 缓存

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

0 人收藏 0 人点赞
#policy-optimization

Q-Steer:分子策略优化的动作价值指导

arXiv cs.LG · 2026-07-30 缓存

提出了Q-Steer,一种用于分子策略优化的 rollout 时间动作价值引导方法,它使用冻结的前缀动作价值评分器来改进采样,而不改变在线 oracle 预算。

0 人收藏 0 人点赞
#policy-optimization

β-OPSD:以策略优化推导,以自蒸馏训练

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。

0 人收藏 0 人点赞
#policy-optimization

面向长周期代理任务的进度条件组策略优化

arXiv cs.LG · 2026-07-28 缓存

提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。

0 人收藏 0 人点赞
#policy-optimization

CIGPO:用于多轮证据读取LLM智能体的上下文信息增益策略优化

arXiv cs.LG · 2026-07-21 缓存

本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。

0 人收藏 0 人点赞
#policy-optimization

组熵控制策略优化

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。

0 人收藏 0 人点赞
#policy-optimization

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers · 2026-07-16 缓存

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

0 人收藏 0 人点赞
#policy-optimization

超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃

Hugging Face Daily Papers · 2026-07-11 缓存

本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。

0 人收藏 0 人点赞
#policy-optimization

基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法

arXiv cs.AI · 2026-07-08 缓存

提出了IGRPO框架,该框架基于中间状态的信息性为多轮LLM智能体自适应分配展开预算,将自适应树结构探索与策略学习相统一。在七个搜索增强型问答基准上的实验表明,该框架一致优于基线方法。

0 人收藏 0 人点赞
#policy-optimization

ACPO:基于细粒度替代熵的自适应信用策略优化

arXiv cs.LG · 2026-07-07 缓存

介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。

0 人收藏 0 人点赞
#policy-optimization

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#policy-optimization

GRPO、Dr. GRPO 和 DAPO 是对同一数值的三种操作:组标准差恒等式

arXiv cs.LG · 2026-07-02 缓存

本文证明 GRPO、Dr. GRPO 和 DAPO 是同一底层机制的三种表述:调整一组采样答案中奖励的标准差。组标准差恒等式表明,一致的组不提供任何学习信号,而分裂的组驱动学习,揭示了训练语言模型推理的统一旋钮。

0 人收藏 0 人点赞
#policy-optimization

ReGRPO:面向工具使用智能体的反思增强策略优化

arXiv cs.AI · 2026-07-01 缓存

ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#policy-optimization

从命题性不对称到感知性不对称:将摩擦策略优化扩展到非对称部分信息对话

arXiv cs.CL · 2026-07-01 缓存

本文扩展了摩擦策略优化(FPO)以处理对话中的感知性不对称,即参与者持有不对称的部分信息。研究表明,从每个参与者的视角评估摩擦比全知访问更有效,并提出了针对共同基础状态的标注改进。

0 人收藏 0 人点赞
#policy-optimization

VideoSearch-R1: 通过软查询优化的迭代式视频检索与推理

Hugging Face Daily Papers · 2026-07-01 缓存

VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。

0 人收藏 0 人点赞
#policy-optimization

@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…

X AI KOLs Following · 2026-06-26 缓存

JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。

0 人收藏 0 人点赞
#policy-optimization

BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计

arXiv cs.CL · 2026-06-25 缓存

BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。

0 人收藏 0 人点赞
#policy-optimization

超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization

arXiv cs.AI · 2026-06-24 缓存

介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈