grpo

标签

Cards List
#grpo

PlanPO:面向多轮代理式大语言模型的群体规划感知策略优化

arXiv cs.AI ↗ · 2026-08-19 缓存

PlanPO是一种强化学习方法,它为多轮代理式大语言模型引入了从粗到细的优势信号,在ALFWorld、WebShop和SciWorld等基准测试中,性能比GRPO提高了27.2%。

0 人收藏 0 人点赞
#grpo

Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。

0 人收藏 0 人点赞
#grpo

超越英语的GRPO:非英语与多语言环境中GRPO的大规模研究

arXiv cs.CL ↗ · 2026-08-17 缓存

这项大规模研究调查了非英语和多语言环境中的GRPO,发现以母语进行推理训练与英语训练之间差距较小,并显示出强大的跨语言迁移能力,尽管效果取决于模型和语言。

0 人收藏 0 人点赞
#grpo

ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers ↗ · 2026-08-17 缓存

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。

0 人收藏 0 人点赞
#grpo

I-SDPO:实例级自适应自蒸馏策略优化

arXiv cs.LG ↗ · 2026-08-14 缓存

介绍 I-SDPO,一种实例级自适应自蒸馏策略优化方法,根据 rollout 组中是否包含任何成功响应,在 GRPO 与特权自蒸馏之间切换,从而提升 SciKnowEval 上的推理性能。

0 人收藏 0 人点赞
#grpo

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

arXiv cs.LG ↗ · 2026-08-14 缓存

Introduces SSPO, a step-level self-distilled policy optimization method for training deep search agents, which uses evidence anchors and advantage weights to improve credit assignment beyond sparse outcome rewards. SSPO outperforms GRPO on benchmarks like BrowseComp and GAIA with only ~5% overhead per step.

0 人收藏 0 人点赞
#grpo

GCPO:诊断并约束大语言模型Rollout强化学习中的子空间几何

arXiv cs.LG ↗ · 2026-08-13 缓存

本文提出GCPO,一种用于诊断和约束基于rollout的大语言模型强化学习中的子空间几何的方法,在推理、编程和工具使用任务上相较于GRPO及其变体提升了稳定性和性能。

0 人收藏 0 人点赞
#grpo

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

arXiv cs.LG ↗ · 2026-08-13 缓存

A Scale AI research paper proposes Rubric Dropout, a dropout-style regularization for rubric criteria in rubric-as-reward RL, showing it mitigates reward hacking and improves out-of-distribution gold judge scores on medical and science benchmarks.

0 人收藏 0 人点赞
#grpo

用于财务建议生成的GRPO:在CATE评估中超越商业LLM

arXiv cs.CL ↗ · 2026-08-13 缓存

本文提出了一种方法,使用组相对策略优化(GRPO)对开放权重语言模型进行微调,以生成可操作的财务建议,在独立于评判者的CATE评估中优于商业LLM,同时满足安全标准。

0 人收藏 0 人点赞
#grpo

ConRub-Med:基于共识评分标准的开放医学问答强化学习

arXiv cs.CL ↗ · 2026-08-12 缓存

本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。

0 人收藏 0 人点赞
#grpo

面向多语言机器翻译的开放大型语言模型无参考后训练

arXiv cs.CL ↗ · 2026-08-12 缓存

本文来自小米,介绍了面向多语言机器翻译的无参考后训练,将带有质量评估奖励的GRPO应用于MiLMMT-46-v0.1 SFT模型,生成MiLMMT-46-v1.0,该模型提升了46种语言的翻译质量,并超越了开放和专有基线。

0 人收藏 0 人点赞
#grpo

面向长时程工具使用智能体任务的高效强化学习

arXiv cs.LG ↗ · 2026-08-12 缓存

本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。

0 人收藏 0 人点赞
#grpo

GraphThink:面向长时程具身任务规划的图增强LLM思维

arXiv cs.AI ↗ · 2026-08-11 缓存

GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。

0 人收藏 0 人点赞
#grpo

开放大语言模型的无参考后训练用于多语言机器翻译

Hugging Face Daily Papers ↗ · 2026-08-11 缓存

本文介绍了MiLMMT-46-v1.0,这是一个通过GRPO和检查点插值进行无参考后训练改进的多语言机器翻译模型,在46种语言上超越了强大的开放和专有基线模型。

0 人收藏 0 人点赞
#grpo

基于变分学习的RLVR参数探索

Hugging Face Daily Papers ↗ · 2026-08-10 缓存

本文介绍了扰动参数策略优化(3PO),这是一种用于LLM强化学习的参数空间探索方法族,展示了在数学和代码任务上相较于GRPO的一致改进。

0 人收藏 0 人点赞
#grpo

GRASP:通过组相对策略优化强化语言模型匿名化器

arXiv cs.CL ↗ · 2026-08-10 缓存

介绍GRASP,一种使用组相对策略优化来训练小型设备端语言模型进行对抗性匿名化的方法,在运行成本仅为前沿教师模型的一小部分的同时,改善了相对于DPO蒸馏基线的隐私-效用权衡。

0 人收藏 0 人点赞
#grpo

LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距

arXiv cs.LG ↗ · 2026-08-07 缓存

本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。

0 人收藏 0 人点赞
#grpo

@gm8xx8: Harness-R1 保持目标模型冻结,并学习从失败轨迹编辑其周围运行时,mo…

X AI KOLs Timeline ↗ · 2026-08-04 缓存

Harness-R1 提出了一种方法,从失败轨迹中学习为 LLM 智能体编辑可执行的运行时 harness,使用一个独立的 9B 工程师模型通过在线 GRPO 优化,同时保持目标模型冻结。它在 WebShop、ALFWorld 和 DBBench 上提高了成功率。

0 人收藏 0 人点赞
#grpo

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL ↗ · 2026-08-04 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#grpo

SERL-SQL:面向Text-to-SQL强化智能体学习的选择性事后蒸馏

arXiv cs.CL ↗ · 2026-08-04 缓存

SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈