agent-training

标签

Cards List
#agent-training

@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…

X AI KOLs Following · 4天前 缓存

腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。

0 人收藏 0 人点赞
#agent-training

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

arXiv cs.AI · 5天前 缓存

This paper introduces State-Matched Routing and Contextualized Self-Distillation (SMRC-SD), a method that selectively applies privileged trajectory guidance only when the student agent's current state matches the reference, improving multi-turn agent performance on ALFWorld and WebShop benchmarks.

0 人收藏 0 人点赞
#agent-training

超越单纯的环境扩展:为多模态智能体学习设计有效的环境分布

Hugging Face Daily Papers · 2026-08-06 缓存

本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。

0 人收藏 0 人点赞
#agent-training

CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers · 2026-08-06 缓存

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

0 人收藏 0 人点赞
#agent-training

通过预测性导航进行深度研究预训练

arXiv cs.CL · 2026-08-04 缓存

介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。

0 人收藏 0 人点赞
#agent-training

SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers · 2026-08-04 缓存

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

0 人收藏 0 人点赞
#agent-training

@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…

X AI KOLs Timeline · 2026-07-30 缓存

微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。

0 人收藏 0 人点赞
#agent-training

从结果到行动:利用事后视角进行长周期语言智能体训练

arXiv cs.LG · 2026-07-21 缓存

介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。

0 人收藏 0 人点赞
#agent-training

NexForge:通过需求驱动任务合成扩展LLM的智能体能力

Hugging Face Daily Papers · 2026-07-21 缓存

NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。

0 人收藏 0 人点赞
#agent-training

Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)

Hacker News Top · 2026-07-14 缓存

一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。

0 人收藏 0 人点赞
#agent-training

TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练

arXiv cs.AI · 2026-07-08 缓存

TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。

0 人收藏 0 人点赞
#agent-training

@qingke_ai: https://x.com/qingke_ai/status/2071281892964659384

X AI KOLs Timeline · 2026-06-28 缓存

该文章由ROLL团队分享了在终端环境中进行Agentic RL训练时的实践经验,包括环境管理器设计、异步训练管线以及多种模式切换,并对比了RLVR与Agentic RL的本质区别。

0 人收藏 0 人点赞
#agent-training

验证视界:编码智能体奖励并无银弹

arXiv cs.AI · 2026-06-26 缓存

该论文指出,对于当前的编码智能体,验证解决方案比生成解决方案更为困难,且任何固定的奖励函数都无法随着能力增长而持续有效。作者通过四种奖励构建的实验表明,针对性的验证设计可以抑制奖励黑客行为并提升任务完成质量。

0 人收藏 0 人点赞
#agent-training

@gabepereyra: Harvey与@appliedcompute合作训练法律智能体。我们优化了智能体堆栈的每个部分,包括……

X AI KOLs Following · 2026-06-22 缓存

Harvey与Applied Compute合作训练了一个法律智能体,对智能体堆栈进行了优化,并使用来自其法律智能体基准(LAB)的奖励信号对GLM-5.1模型进行了后训练。

0 人收藏 0 人点赞
#agent-training

@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…

X AI KOLs Timeline · 2026-06-21 缓存

精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。

1 人收藏 1 人点赞
#agent-training

@akshay_pachaar: Karpathy关于强化学习的预测正在成真!他指出奖励函数不可靠,并认为单一的奖励…

X AI KOLs Following · 2026-06-19 缓存

Karpathy对强化学习中奖励函数的批评被OpenPipe的ART框架通过RULER解决,该框架允许使用自然语言定义奖励并由LLM评估,取代了手动奖励工程。

0 人收藏 0 人点赞
#agent-training

@ben_burtenshaw: https://x.com/ben_burtenshaw/status/2067615361428545566

X AI KOLs Timeline · 2026-06-18 缓存

一份关于监督微调(SFT)训练AI代理的详细教程,完全基于纯PyTorch从零构建,使用Qwen3-0.6B模型,解释了下一个词元预测和标签掩码的机制。

0 人收藏 0 人点赞
#agent-training

SENTINEL:面向训练工具使用语言模型代理的失败驱动强化学习

arXiv cs.CL · 2026-06-12 缓存

本文介绍了SENTINEL,一个面向训练工具使用语言模型代理的失败驱动强化学习框架。它使用控制器-提议器-求解器循环,从失败轨迹中生成有针对性的训练任务,从而提升在基准测试上的性能。

0 人收藏 0 人点赞
#agent-training

OpenEnv 现由 HF、Torch、Prime Intellect、Unsloth、Modal、Mercor 等机构共同管理!可用于训练智能体。

Reddit r/LocalLLaMA · 2026-06-08

OpenEnv 是一个用于创建终端、浏览器等智能体执行环境的工具。目前,它正过渡到更开放的治理模式,由包括 Hugging Face、Meta-PyTorch、Nvidia 等在内的委员会协调,以推动智能体训练的开源化。

0 人收藏 0 人点赞
#agent-training

Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体

Hugging Face Daily Papers · 2026-06-05 缓存

Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈