grpo

标签

Cards List
#grpo

Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。

0 人收藏 0 人点赞
#grpo

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

arXiv cs.AI ↗ · 2026-08-03 缓存

TAPR is a lightweight model trained with reinforcement learning to rewrite user prompts into task-optimized prompts, improving downstream LLM performance on benchmarks like Natural Questions and GSM8K.

0 人收藏 0 人点赞
#grpo

@vintcessun: 最难的题,反而最教不会模型?GRPO 的死区就在这里:一组 rollout 全错,组内优势归零,梯度也随之消失。 https://arxiv.org/abs/2607.27787 LSPO 给这些“悬崖题”临时装上 LoRA:用标准推导短…

X AI KOLs Timeline ↗ · 2026-08-03 缓存

该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。

0 人收藏 0 人点赞
#grpo

@rohanpaul_ai:Meta 新论文。代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后……

X AI KOLs Following ↗ · 2026-08-01 缓存

Meta 的一篇论文分析了标准 RL 方法为何在代码优化上失败,并通过校准后的计时、问题相对排名以及 GRPO 改动重建了整个反馈流水线,将 Qwen 2.5 7B 的速度阈值从 18.0% 提升至 31.3%。

0 人收藏 0 人点赞
#grpo

极简RAG模型:B1ade 335M嵌入模型与1B参数小型语言模型

arXiv cs.CL ↗ · 2026-07-31 缓存

介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。

0 人收藏 0 人点赞
#grpo

SAF-OPD:用于在线策略蒸馏的稳定优势融合

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。

0 人收藏 0 人点赞
#grpo

并非所有Token都值得同等信用:面向长CoT推理的反事实敏感性信用再分配

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。

0 人收藏 0 人点赞
#grpo

MemHarness:记忆是重构的,而非重放的

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

MemHarness 是一个框架,它使 LLM 智能体能够根据当前语境重构过去的经验,而不是逐字重放它们,从而在 ALFWorld 和 WebShop 上提升性能,同时减少负迁移。

0 人收藏 0 人点赞
#grpo

CoRT:用于令牌级评分导向策略优化的反事实重放

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

CoRT 提出了一种针对 GRPO 的令牌级信用加权方法,利用反事实重放计算令牌级的对数似然对比,将带符号的优势值重新分配到各个令牌上,无需辅助评分器,与响应级 GRPO 相比平均提升 4.4 个百分点。

0 人收藏 0 人点赞
#grpo

代码优化的强化学习

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

本文针对使用强化学习进行代码优化时面临的挑战,提出了三个阶段:通过DMC-Optim改进测试方法;通过正确性与速度组合以及离线模拟器将执行时间转化为奖励;以及调整GRPO以适应含噪时序奖励。该方法在代码优化基准测试中取得了显著提升。

0 人收藏 0 人点赞
#grpo

@SergioPaniego:快速提醒!明天(7月28日,星期二),我们将继续训练代理直播系列的第三节课:内容:强化…

X AI KOLs Following ↗ · 2026-07-27 缓存

训练代理直播系列第三节课的提醒,涵盖用于训练代理的强化学习(GRPO)、如何在TRL中实现以及端到端示例,将于7月28日星期二在Hugging Face的X、YouTube和LinkedIn上直播。

0 人收藏 0 人点赞
#grpo

对抗性风格优化:基于GRPO的风格触发器优化增强VLM越狱攻击

arXiv cs.CL ↗ · 2026-07-27 缓存

本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。

0 人收藏 0 人点赞
#grpo

@ADarmouni:https://arxiv.org/pdf/2607.18082 这里是CriPO,来自字节跳动的一项非常出色的工作,可能带来令人印象深刻的影响……

X AI KOLs Timeline ↗ · 2026-07-21 缓存

结合GRPO和OPSD,CriPO是字节跳动和浙江大学提出的一种基于规则的强化学习方法,通过自蒸馏处理未探索和被抑制的标准,实现了更好的性能和计算效率。

0 人收藏 0 人点赞
#grpo

CIGPO:用于多轮证据读取LLM智能体的上下文信息增益策略优化

arXiv cs.LG ↗ · 2026-07-21 缓存

本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。

0 人收藏 0 人点赞
#grpo

组熵控制策略优化

Hugging Face Daily Papers ↗ · 2026-07-18 缓存

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。

0 人收藏 0 人点赞
#grpo

小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制

arXiv cs.AI ↗ · 2026-07-15 缓存

本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。

0 人收藏 0 人点赞
#grpo

MAG:用于多模态动作和指南生成的Web-Agent基准与框架

arXiv cs.AI ↗ · 2026-07-14 缓存

MAG引入了一个用于多模态Web代理的基准和框架,这些代理既执行任务又生成逐步指南文本,使用截图和接地方案。该工作包括一种GRPO训练方法,几乎将9B代理的成功率提高了一倍。

0 人收藏 0 人点赞
#grpo

AgentKGV:基于两阶段训练的知识图谱事实验证智能LLM-RAG框架

arXiv cs.CL ↗ · 2026-07-13 缓存

提出了AgentKGV,一种基于两阶段训练(蒸馏SFT和轨迹级GRPO)的智能LLM-RAG框架,用于验证知识图谱中的事实,在T-REx基准上取得了显著改进,同时减少了检索调用。

0 人收藏 0 人点赞
#grpo

@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……

X AI KOLs Timeline ↗ · 2026-07-13 缓存

一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。

0 人收藏 0 人点赞
#grpo

SVR-R1:在强化学习中通过自验证引导多模态推理

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈