@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…
摘要
腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。
查看缓存全文
缓存时间: 2026/08/08 07:06
AI 系统能否持续为 AI 智能体生成更难训练任务?
腾讯的新研究表明,它们可以。递归合成终端任务(RST)从现有可用的终端任务出发,逐步添加新步骤,使其变得更难。
随后,它会更新指令和测试,与新的工作流程保持一致。每个修订后的任务都会在全新的沙盒中经过验证,才能用于生成下一轮更难的任务。
从 639 个任务起步,RST 在 15 轮中产出了 37,484 个经校验的任务。DeepSeek-V4-Pro 能够在四次尝试内解决 90% 的第一轮任务,但在最后一轮任务上仅能解决 2.5%。
这些更难的任务也带来了有价值的训练数据。基于生成任务进行强化学习,将 Qwen3.5-27B 在独立构建的基准测试 Terminal-Bench Hard 上的成绩从 22.7% 提升至 32.0%。
通过可执行验证,一组固定任务可以转化为难度逐步提升的训练数据。
Yucheng Shi(@Yucheng__Shi): 构建合成的长周期终端任务很难。让它们可解又不贵更难。
所以我们反过来做:不先写任务,而是先构建解决方案。
我们先扩展参考解决方案及其运行环境,再为它配上验证器和任务说明。
相似文章
长时程终端任务的递归合成
本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
@MaxForAI: 田渊栋 @tydsh 的创业团队Recursive @Recursive_SI 发布了一个阶段性的成果:自动化AI研究系统 这个系统里AI能自己完成「提出想法→实现→跑实验→验证→根据结果选下一个实验」这一整套研究循环。 结果表明在目标清…
Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。
QUEST:通过全合成任务训练前沿深度研究智能体
QUEST是一个开放的深度研究智能体家族,使用合成数据和强化学习训练,在多种长周期搜索任务中取得了强劲的性能,接近前沿闭源智能体。
@MangQiuyang: 开放式编程训练数据可能不再是瓶颈:AI 能够规模化开放式任务——甚至超越人类专家…
FrontierSmith 是一个系统,能够从封闭式任务中规模化地合成开放式编程问题。它生成、过滤并构建训练环境;使用其数据训练的模型在表现上优于使用人类策划的开放式数据训练的模型。