agent-training

标签

Cards List
#agent-training

Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)

Hacker News Top ↗ · 2026-07-14 缓存

一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。

0 人收藏 0 人点赞
#agent-training

TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练

arXiv cs.AI ↗ · 2026-07-08 缓存

TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。

0 人收藏 0 人点赞
#agent-training

@qingke_ai: https://x.com/qingke_ai/status/2071281892964659384

X AI KOLs Timeline ↗ · 2026-06-28 缓存

该文章由ROLL团队分享了在终端环境中进行Agentic RL训练时的实践经验,包括环境管理器设计、异步训练管线以及多种模式切换,并对比了RLVR与Agentic RL的本质区别。

0 人收藏 0 人点赞
#agent-training

验证视界:编码智能体奖励并无银弹

arXiv cs.AI ↗ · 2026-06-26 缓存

该论文指出,对于当前的编码智能体,验证解决方案比生成解决方案更为困难,且任何固定的奖励函数都无法随着能力增长而持续有效。作者通过四种奖励构建的实验表明,针对性的验证设计可以抑制奖励黑客行为并提升任务完成质量。

0 人收藏 0 人点赞
#agent-training

@gabepereyra: Harvey与@appliedcompute合作训练法律智能体。我们优化了智能体堆栈的每个部分,包括……

X AI KOLs Following ↗ · 2026-06-22 缓存

Harvey与Applied Compute合作训练了一个法律智能体,对智能体堆栈进行了优化,并使用来自其法律智能体基准(LAB)的奖励信号对GLM-5.1模型进行了后训练。

0 人收藏 0 人点赞
#agent-training

@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…

X AI KOLs Timeline ↗ · 2026-06-21 缓存

精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。

1 人收藏 1 人点赞
#agent-training

@akshay_pachaar: Karpathy关于强化学习的预测正在成真!他指出奖励函数不可靠,并认为单一的奖励…

X AI KOLs Following ↗ · 2026-06-19 缓存

Karpathy对强化学习中奖励函数的批评被OpenPipe的ART框架通过RULER解决,该框架允许使用自然语言定义奖励并由LLM评估,取代了手动奖励工程。

0 人收藏 0 人点赞
#agent-training

@ben_burtenshaw: https://x.com/ben_burtenshaw/status/2067615361428545566

X AI KOLs Timeline ↗ · 2026-06-18 缓存

一份关于监督微调(SFT)训练AI代理的详细教程,完全基于纯PyTorch从零构建,使用Qwen3-0.6B模型,解释了下一个词元预测和标签掩码的机制。

0 人收藏 0 人点赞
#agent-training

SENTINEL:面向训练工具使用语言模型代理的失败驱动强化学习

arXiv cs.CL ↗ · 2026-06-12 缓存

本文介绍了SENTINEL,一个面向训练工具使用语言模型代理的失败驱动强化学习框架。它使用控制器-提议器-求解器循环,从失败轨迹中生成有针对性的训练任务,从而提升在基准测试上的性能。

0 人收藏 0 人点赞
#agent-training

OpenEnv 现由 HF、Torch、Prime Intellect、Unsloth、Modal、Mercor 等机构共同管理!可用于训练智能体。

Reddit r/LocalLLaMA ↗ · 2026-06-08

OpenEnv 是一个用于创建终端、浏览器等智能体执行环境的工具。目前,它正过渡到更开放的治理模式,由包括 Hugging Face、Meta-PyTorch、Nvidia 等在内的委员会协调,以推动智能体训练的开源化。

0 人收藏 0 人点赞
#agent-training

Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。

0 人收藏 0 人点赞
#agent-training

是什么使交互轨迹对训练终端智能体有效?

arXiv cs.AI ↗ · 2026-06-03 缓存

本文研究了什么使交互轨迹对训练基于终端的AI智能体有效,介绍了Terminal-Lego流程,并揭示了一个教学悖论:较弱的智能体可以产生更好的训练数据。研究发现,环境基础监督(而非教师性能)是学生泛化能力的关键。

0 人收藏 0 人点赞
#agent-training

WRIT:面向多轮用户代理的写读密集型轨迹合成

arXiv cs.CL ↗ · 2026-06-03 缓存

本文提出WRIT,一种用于合成多轮代理训练轨迹的流水线,该流水线平衡了写密集型与读重复杂度。该方法生成多样化的任务和模拟,使小型模型能够以更低的推理成本实现强大性能。

0 人收藏 0 人点赞
#agent-training

@DAIEvolutionHub: 微软刚刚开源了一种无需触及模型权重即可“训练”AI智能体的方法 SkillOpt 将简单的 markdown 技能文件视为神经网络参数...

X AI KOLs Timeline ↗ · 2026-05-28 缓存

微软开源了 SkillOpt,这是一种将 markdown 技能文件视为神经网络参数来训练 AI 智能体的方法,无需修改模型权重,并使用学习率、验证检查、小批量数据和训练轮次进行优化。

0 人收藏 0 人点赞
#agent-training

@athleticKoder: https://x.com/athleticKoder/status/2057091692235481560

X AI KOLs Timeline ↗ · 2026-05-20 缓存

一篇技术博文,从基本原理出发解释如何构建智能体训练系统,以文本转图表智能体为例,涵盖环境定义、教师轨迹生成、学生微调以及强化学习。

0 人收藏 0 人点赞
#agent-training

Trainer

Product Hunt ↗ · 2026-05-19

Trainer 是一款工具,让用户通过录制屏幕来训练AI智能体,现已在 Product Hunt 上架。

0 人收藏 0 人点赞
#agent-training

EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准

arXiv cs.AI ↗ · 2026-05-11 缓存

本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。

0 人收藏 0 人点赞
#agent-training

EnvScaler:通过程序综合为LLM智能体扩展工具交互环境

arXiv cs.CL ↗ · 2026-04-20 缓存

EnvScaler是一个自动化框架,通过程序综合为LLM智能体扩展工具交互环境,创建了191个多样化环境和7K个场景,以提升智能体在多轮、多工具交互任务上的性能。

0 人收藏 0 人点赞
#agent-training

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL ↗ · 2026-04-20 缓存

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。

0 人收藏 0 人点赞
#agent-training

Mind DeepResearch 技术报告

Hugging Face Daily Papers ↗ · 2026-04-17 缓存

# 论文页面 - Mind DeepResearch 技术报告 来源:[https://huggingface.co/papers/2604.14518](https://huggingface.co/papers/2604.14518) ## 摘要 MindDR 是一个高效的多智能体深度研究框架,通过协作式三智能体架构与专门设计的四阶段训练流程,在多个基准测试中取得优异成绩。我们提出 Mind DeepResearch(MindDR),一个高效的[多智能体深度研究框架](https://hug

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈