policy-optimization

标签

Cards List
#policy-optimization

分解子任务强化学习 (RLDS)

arXiv cs.AI · 6小时前 缓存

本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。

0 人收藏 0 人点赞
#policy-optimization

超越任务完成:训练有能力且安全的计算机使用智能体

arXiv cs.LG · 2天前 缓存

本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。

0 人收藏 0 人点赞
#policy-optimization

GVPO++: 用于LLM后训练和在策略蒸馏的组方差策略优化

arXiv cs.AI · 3天前 缓存

本文介绍GVPO++,一种用于LLM的新型后训练方法,该方法集成了KL约束的奖励最大化,增强了训练稳定性并实现了在策略蒸馏。

0 人收藏 0 人点赞
#policy-optimization

DAPO:来自字节跳动Seed和清华AIR的开源强化学习系统

Hacker News Top · 3天前 缓存

DAPO是一个为大型语言模型设计的开源强化学习系统,由字节跳动Seed和清华AIR开发,使用Qwen2.5-32B模型在AIME 2024基准测试中实现了最先进的性能。

0 人收藏 0 人点赞
#policy-optimization

RewardVerse:评分标准指导的策略优化用于视频奖励建模

Hugging Face Daily Papers · 5天前 缓存

RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。

0 人收藏 0 人点赞
#policy-optimization

LLM 代理的双轴策略优化:Bayesian Feedback Attribution 和 Trajectory Mass Normalization

arXiv cs.AI · 6天前 缓存

本文介绍了 BATON,这是一个用于 LLM 代理的双轴策略优化框架,采用 Bayesian Feedback Attribution 和 Trajectory Mass Normalization,在强化学习实验中展示了性能提升。

0 人收藏 0 人点赞
#policy-optimization

通过参考策略引导正则化自我对弈中的均衡选择

arXiv cs.AI · 6天前 缓存

这篇研究论文探讨了使用参考策略有意引导双人零和博弈中正则化自我对弈的均衡选择,并在可解博弈上提供了实验结果和理论分析。

0 人收藏 0 人点赞
#policy-optimization

锚定关键要素:面向视觉基础多模态推理的双层学习框架

arXiv cs.AI · 2026-09-17 缓存

本文提出PIVOT,一个双层学习框架,通过自校准经验回放和视觉引导优势分配优化强化学习,以增强大型视觉语言模型中的视觉基础推理。

0 人收藏 0 人点赞
#policy-optimization

TIAO: 基于令牌重要性感知的文本摘要策略优化

arXiv cs.CL · 2026-09-16 缓存

TIAO是一种面向文本摘要的令牌重要性感知强化学习策略,它基于令牌依赖性重新加权轨迹,在真实世界数据集上实现了与GPT-4和GPT-5-nano相媲美的结果。

0 人收藏 0 人点赞
#policy-optimization

EvolveTrade:基于经验驱动的策略优化,用于自我进化的LLM交易代理

Hugging Face Daily Papers · 2026-09-15 缓存

EvolveTrade 引入了一个针对 LLM 交易代理的自我进化框架,该框架利用决策轨迹和投资组合反馈来优化工具使用策略,在不同市场状态下改善夏普比率和累计收益率。

0 人收藏 0 人点赞
#policy-optimization

贝尔曼策略优化 (BPO)

Hugging Face Daily Papers · 2026-09-14 缓存

贝尔曼策略优化 (BPO) 是一种无评论家的强化学习方法,它利用贝尔曼方程重新表述策略镜像下降 (PMD),用于具有终端奖励的自回归生成,从而提升大语言模型的数学推理能力。

0 人收藏 0 人点赞
#policy-optimization

既然可以枚举,为何要采样?基因组工具选择的精确策略优化

arXiv cs.AI · 2026-09-11 缓存

论文提出了FGPO,这是一种基因组工具选择中的精确策略优化方法,通过枚举所有可能的工具子集来优于基于采样的方法如GRPO。

0 人收藏 0 人点赞
#policy-optimization

VERPO:验证证据正则化策略优化

arXiv cs.LG · 2026-09-10 缓存

VERPO 引入了一个框架,用于在语言模型中进行验证证据正则化策略优化,通过将证据视为策略修正的提议,同时保持目标结果,以提高在科学推理和工具使用任务上的性能。

0 人收藏 0 人点赞
#policy-optimization

基于难度适应的树结构策略优化以扩展RLVR中的推理覆盖

Hugging Face Daily Papers · 2026-09-08 缓存

论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。

0 人收藏 0 人点赞
#policy-optimization

@wenhaocha1: 真的很喜欢这张图!

X AI KOLs Timeline · 2026-09-07 缓存

一位开发者探讨了为何即便初始策略对目标行为的覆盖度不佳,尾部强化学习依然能够保持有效性。

0 人收藏 0 人点赞
#policy-optimization

TIGPO:用于长视域LLM智能体的时间实例图策略优化

arXiv cs.LG · 2026-09-04 缓存

TIGPO提出了一种时间实例图策略优化方法,通过持久转移图和重访槽,扩展了基于图的信用分配跨策略更新,用于长视域LLM智能体,以改善优势估计和在ALFWorld和WebShop等基准测试上的性能。

0 人收藏 0 人点赞
#policy-optimization

DMRL:用于广告推荐中技能优化的文档介导强化学习

arXiv cs.LG · 2026-09-03 缓存

DMRL 是一种文档介导强化学习框架,通过结构化编辑动作、策略优化和长期奖励预测来优化广告推荐中的技能文档,并在大规模部署中展示了优于基线的性能。

0 人收藏 0 人点赞
#policy-optimization

PGPO:面向多轮智能体任务的势引导策略优化

arXiv cs.AI · 2026-09-03 缓存

PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。

0 人收藏 0 人点赞
#policy-optimization

群组自适应裁剪策略优化

arXiv cs.LG · 2026-09-02 缓存

本文提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,通过根据rollout优势自适应调整裁剪边界,在数学推理和编程基准测试中提升了Pass@1和Pass@k的表现。

0 人收藏 0 人点赞
#policy-optimization

偏好提取用于策略优化及其在心脏移植与人类价值观对齐中的应用

arXiv cs.AI · 2026-09-01 缓存

本文提出了一种新的偏好提取算法,通过成对比较学习效用函数,应用于心脏移植分配,以使策略与人类价值观对齐,显著优于现有方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈