grpo

标签

Cards List
#grpo

@akshay_pachaar: Andrej Karpathy 将LLM训练的整个历史总结为三个名词:- 文本 - 对话 - 及环境…

X AI KOLs Timeline ↗ · 2026-07-12 缓存

Andrej Karpathy将LLM训练概括为文本、对话和环境;Prime Intellect的Verifiers是一个开源框架,用于构建和共享LLM的强化学习环境,采用MIT许可证发布,附带一个包含2500多个环境的中枢。

0 人收藏 0 人点赞
#grpo

@akshay_pachaar: 如果要定制LLM,我会学习的微调技术:收藏此推。1. LoRA 2. QLoRA 3. Prefix Tuning 4. A…

X AI KOLs Following ↗ · 2026-07-10 缓存

该推文列出了15种LLM微调技术,并介绍了ART(Agent Reinforcement Trainer),这是OpenPipe的一个开源框架,用于使用GRPO训练多步骤代理,并通过W&B Training提供无服务器强化学习支持。

0 人收藏 0 人点赞
#grpo

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG ↗ · 2026-07-10 缓存

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。

0 人收藏 0 人点赞
#grpo

当合成语音是唯一资源时:GRPO更胜一筹

arXiv cs.CL ↗ · 2026-07-10 缓存

本文提出使用Group Relative Policy Optimization(GRPO)来适配基于LLM的ASR模型到监管领域,仅使用合成语音,相较于监督微调实现了40-45%的相对词错误率降低。

0 人收藏 0 人点赞
#grpo

当不可信令牌被强化:面向大语言模型强化学习的尾部感知信用校准

arXiv cs.CL ↗ · 2026-07-10 缓存

提出尾部感知信用校准(TACO),通过校准统一信用分配以抑制对不可信尾部令牌的更新,解决大语言模型强化学习中的正向信用污染问题,提升训练稳定性和性能。

0 人收藏 0 人点赞
#grpo

最大化GRPO信号:针对困难推理问题的自适应轨迹前缀控制

arXiv cs.CL ↗ · 2026-07-09 缓存

本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。

0 人收藏 0 人点赞
#grpo

DrugGen 2:一种疾病感知的语言模型,用于增强药物发现

Hugging Face Daily Papers ↗ · 2026-07-09 缓存

DrugGen-2通过监督学习和强化学习(GRPO)微调GPT-2,在疾病本体和靶点蛋白质序列条件下生成小分子,实现了药物发现中更高的多样性和结合亲和力。

0 人收藏 0 人点赞
#grpo

自我审查强化学习(SRRL):跨回合记忆与策略蒸馏

arXiv cs.LG ↗ · 2026-07-08 缓存

本文介绍了一种名为自我审查强化学习(SRRL)的训练框架,该框架在强化学习回合中嵌入自我审查步骤,利用跨回合记忆和选择性策略蒸馏,将稀疏的环境反馈转化为行为改进。在GSM8K上的评估表明,SRRL在Qwen 3-4B和OLMo-3-7B模型上均优于使用GRPO的标准RLVR方法。

0 人收藏 0 人点赞
#grpo

面向智能体强化学习的单次生成异步优化

Hugging Face Daily Papers ↗ · 2026-07-08 缓存

本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。

0 人收藏 0 人点赞
#grpo

@cwolferesearch: 智能体强化学习需要新的算法改进。在GRPO中,用于训练的“群体”开始发生变化……

X AI KOLs Timeline ↗ · 2026-07-07 缓存

本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。

0 人收藏 0 人点赞
#grpo

NormWorlds-CF:基于求解器验证的反事实规范推理与变形关系GRPO

arXiv cs.CL ↗ · 2026-07-07 缓存

NormWorlds-CF是一个用于反事实规范推理的、经求解器验证的基准。论文提出了MR-GRPO,一种奖励机制,能够改进超越最终答案的结构化推理,表明仅答案准确率在规范任务中可能具有误导性。

0 人收藏 0 人点赞
#grpo

@akshay_pachaar: https://x.com/akshay_pachaar/status/2074200571834515574

X AI KOLs Following ↗ · 2026-07-06 缓存

一个技术教程,介绍如何使用开源的Verifiers库为大型语言模型(LLMs)构建强化学习环境,并以奥赛罗(Othello)作为实际示例。

0 人收藏 0 人点赞
#grpo

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#grpo

Mastermind: 基于策略的仓库级漏洞复现学习

arXiv cs.AI ↗ · 2026-07-03 缓存

本文介绍了Mastermind,一种双循环框架,通过学习可复用的漏洞复现策略来处理仓库级任务,通过将策略学习与执行分离,在冻结执行器的情况下实现了84.5%的通过率。

0 人收藏 0 人点赞
#grpo

超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证

arXiv cs.AI ↗ · 2026-07-03 缓存

本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。

0 人收藏 0 人点赞
#grpo

GRPO、Dr. GRPO 和 DAPO 是对同一数值的三种操作:组标准差恒等式

arXiv cs.LG ↗ · 2026-07-02 缓存

本文证明 GRPO、Dr. GRPO 和 DAPO 是同一底层机制的三种表述:调整一组采样答案中奖励的标准差。组标准差恒等式表明,一致的组不提供任何学习信号,而分裂的组驱动学习,揭示了训练语言模型推理的统一旋钮。

0 人收藏 0 人点赞
#grpo

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline ↗ · 2026-07-01 缓存

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。

0 人收藏 0 人点赞
#grpo

预测性GRPO:训练动力学的闭式模型

arXiv cs.LG ↗ · 2026-07-01 缓存

提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。

0 人收藏 0 人点赞
#grpo

过程优势信号塑形:用于LLM推理器中过程监督强化学习的范式无关中间件

arXiv cs.AI ↗ · 2026-06-30 缓存

PASS是一种中间件,它修复了LLM推理器过程监督强化学习中的三种病理现象,通过独立标准化流、按值分块和使用平均价值密度来改进GRPO。它在数学推理和多跳问答中显示出持续的增益。

0 人收藏 0 人点赞
#grpo

BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习

arXiv cs.AI ↗ · 2026-06-30 缓存

BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈