Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)
摘要
一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。
暂无内容
查看缓存全文
缓存时间: 2026/07/14 13:17
在强化学习循环中的人工智能,其行动是训练另一个在强化学习循环中的人工智能。(来源:assets/hero.svg。)
一次完整的回合,端到端。(来源:assets/episode.svg。)
相似文章
@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…
精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。
@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…
rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。
训练前沿知识工作代理:使用SkyRL的397B强化学习训练指南(18分钟阅读)
Mercor详细介绍了Qwen3.5-397B-A17B和Qwen3.6-35B-A3B针对知识工作代理的强化学习后训练,在APEX-Agents基准上实现了70%的相对改进,并开源了完整的训练配方。
@adithya_s_k: https://x.com/adithya_s_k/status/2054961319179420035
分析为什么强化学习在编程任务中因可验证奖励而受到青睐,以及新兴框架Harbor如何解决RL训练中环境复杂度的瓶颈。
超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证
本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。