agent-training

标签

Cards List
#agent-training

部分正确的工具缓存可能逆转组归一化策略更新

arXiv cs.LG ↗ · 3天前 缓存

本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。

0 人收藏 0 人点赞
#agent-training

品味代理:长期任务中品味的衡量与提升

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了 Taste-Bench,一个用于衡量 LLM 代理长期决策品味的基准,发现前沿模型准确率较低,且品味可通过蒸馏训练提升。

0 人收藏 0 人点赞
#agent-training

@AtriaASI:我们感谢OpenBMB通过UltraData-SFT-Agent-2609支持Atria Dawn Preview。该数据集的高质量…

X AI KOLs Timeline ↗ · 2026-09-16 缓存

OpenBMB发布了UltraData-SFT-Agent-2609,这是一个包含50万个样本的数据集,用于代理指令调优,并在MiniCPM5-2B模型的后训练中使用。

0 人收藏 0 人点赞
#agent-training

AMDKernelVault:面向AMD GPU内核优化的大规模数据集与智能代理训练

arXiv cs.CL ↗ · 2026-09-14 缓存

本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。

0 人收藏 0 人点赞
#agent-training

@huggingface: 训练智能体 4:从奖励函数到环境

X AI KOLs Timeline ↗ · 2026-09-10 缓存

Hugging Face 分享了一次广播的重播,讨论了训练 AI 智能体的高级技术,强调了从奖励函数到基于环境的方法的转变。

0 人收藏 0 人点赞
#agent-training

AgentBrew:从原始现实世界轨迹进行的离线工具使用智能体学习

arXiv cs.AI ↗ · 2026-09-10 缓存

AgentBrew 引入了一个离线训练框架,用于工具使用智能体,它从原始交互轨迹中学习,无需任务验证器,使用回顾性任务推断和基于互信息的信用分配,以提升在 GitHub 和 Notion 等现实世界应用中的性能。

0 人收藏 0 人点赞
#agent-training

@juliafedorin: 她从Waterloo辍学。现在她是@OpenAI的技术团队成员。@BrookeaJoseph加入了一个12人的…

X AI KOLs Following ↗ · 2026-09-08 缓存

一篇对OpenAI技术团队成员Brookea Joseph的采访,详述了她从一名创业公司实习生到从事AI代理计算机使用研究的职业生涯,她认为这对推进AGI至关重要。

0 人收藏 0 人点赞
#agent-training

介绍 Solaris(阅读时间约 17 分钟)

TLDR AI ↗ · 2026-09-01 缓存

Runway 发布 Solaris,这是其 Interface World Models 系列中的首个 AI 模型,它通过直接合成帧来生成实时交互界面,无需编码,并支持动态设计和智能体训练。

0 人收藏 0 人点赞
#agent-training

Agent Lightning v1.0

Hacker News Top ↗ · 2026-08-24 缓存

Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。

0 人收藏 0 人点赞
#agent-training

编写、执行、优化:通过执行反馈的强化学习从技能跟随者到技能优化者

arXiv cs.CL ↗ · 2026-08-19 缓存

本文介绍了一种多阶段框架WER,它使用执行反馈的强化学习来训练技能优化器,以改进工具使用代理,在BFCL v4和τ2-bench等基准测试中实现了显著的性能提升。

0 人收藏 0 人点赞
#agent-training

@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…

X AI KOLs Following ↗ · 2026-08-08 缓存

腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。

0 人收藏 0 人点赞
#agent-training

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

arXiv cs.AI ↗ · 2026-08-07 缓存

This paper introduces State-Matched Routing and Contextualized Self-Distillation (SMRC-SD), a method that selectively applies privileged trajectory guidance only when the student agent's current state matches the reference, improving multi-turn agent performance on ALFWorld and WebShop benchmarks.

0 人收藏 0 人点赞
#agent-training

超越单纯的环境扩展:为多模态智能体学习设计有效的环境分布

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。

0 人收藏 0 人点赞
#agent-training

CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

0 人收藏 0 人点赞
#agent-training

通过预测性导航进行深度研究预训练

arXiv cs.CL ↗ · 2026-08-04 缓存

介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。

0 人收藏 0 人点赞
#agent-training

SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

0 人收藏 0 人点赞
#agent-training

@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…

X AI KOLs Timeline ↗ · 2026-07-30 缓存

微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。

0 人收藏 0 人点赞
#agent-training

从结果到行动:利用事后视角进行长周期语言智能体训练

arXiv cs.LG ↗ · 2026-07-21 缓存

介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。

0 人收藏 0 人点赞
#agent-training

NexForge:通过需求驱动任务合成扩展LLM的智能体能力

Hugging Face Daily Papers ↗ · 2026-07-21 缓存

NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。

0 人收藏 0 人点赞
#agent-training

Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)

Hacker News Top ↗ · 2026-07-14 缓存

一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈