标签
本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。
本文介绍了 Taste-Bench,一个用于衡量 LLM 代理长期决策品味的基准,发现前沿模型准确率较低,且品味可通过蒸馏训练提升。
OpenBMB发布了UltraData-SFT-Agent-2609,这是一个包含50万个样本的数据集,用于代理指令调优,并在MiniCPM5-2B模型的后训练中使用。
本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。
Hugging Face 分享了一次广播的重播,讨论了训练 AI 智能体的高级技术,强调了从奖励函数到基于环境的方法的转变。
AgentBrew 引入了一个离线训练框架,用于工具使用智能体,它从原始交互轨迹中学习,无需任务验证器,使用回顾性任务推断和基于互信息的信用分配,以提升在 GitHub 和 Notion 等现实世界应用中的性能。
一篇对OpenAI技术团队成员Brookea Joseph的采访,详述了她从一名创业公司实习生到从事AI代理计算机使用研究的职业生涯,她认为这对推进AGI至关重要。
Runway 发布 Solaris,这是其 Interface World Models 系列中的首个 AI 模型,它通过直接合成帧来生成实时交互界面,无需编码,并支持动态设计和智能体训练。
Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。
本文介绍了一种多阶段框架WER,它使用执行反馈的强化学习来训练技能优化器,以改进工具使用代理,在BFCL v4和τ2-bench等基准测试中实现了显著的性能提升。
腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。
This paper introduces State-Matched Routing and Contextualized Self-Distillation (SMRC-SD), a method that selectively applies privileged trajectory guidance only when the student agent's current state matches the reference, improving multi-turn agent performance on ALFWorld and WebShop benchmarks.
本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。
CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。
介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。
SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。
微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。
介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。
NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。
一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。