@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…

X AI KOLs Following 论文

摘要

腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。

AI系统能否持续为AI智能体生成更难的训练任务? 腾讯的新研究表明它们可以。递归合成终端任务(RST)从一个已经有效的终端任务开始,添加新步骤使其更难。 然后更新指令和测试,使其匹配新的工作流程。每个修订后的任务都会在全新的沙盒环境中进行验证,然后才能用于生成下一轮更难的任务。 从639个任务开始,RST在15轮中生成了37,484个经过验证的任务。DeepSeek-V4-Pro能在四次尝试内解决90%的第一轮任务,但只能解决最后一轮任务中的2.5%。 更难的任务也产生了有用的训练数据。使用生成的任务进行强化学习,将Qwen3.5-27B在Terminal-Bench Hard(一个独立构建的基准)上的性能从22.7%提升到32.0%。 可执行的验证可以将一组固定的任务转化为逐步更难的训练数据。
查看原文
查看缓存全文

缓存时间: 2026/08/08 07:06

AI 系统能否持续为 AI 智能体生成更难训练任务?

腾讯的新研究表明,它们可以。递归合成终端任务(RST)从现有可用的终端任务出发,逐步添加新步骤,使其变得更难。

随后,它会更新指令和测试,与新的工作流程保持一致。每个修订后的任务都会在全新的沙盒中经过验证,才能用于生成下一轮更难的任务。

从 639 个任务起步,RST 在 15 轮中产出了 37,484 个经校验的任务。DeepSeek-V4-Pro 能够在四次尝试内解决 90% 的第一轮任务,但在最后一轮任务上仅能解决 2.5%。

这些更难的任务也带来了有价值的训练数据。基于生成任务进行强化学习,将 Qwen3.5-27B 在独立构建的基准测试 Terminal-Bench Hard 上的成绩从 22.7% 提升至 32.0%。

通过可执行验证,一组固定任务可以转化为难度逐步提升的训练数据。

Yucheng Shi(@Yucheng__Shi): 构建合成的长周期终端任务很难。让它们可解又不贵更难。

所以我们反过来做:不先写任务,而是先构建解决方案。

我们先扩展参考解决方案及其运行环境,再为它配上验证器和任务说明。

相似文章

长时程终端任务的递归合成

Hugging Face Daily Papers

本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。

@MaxForAI: 田渊栋 @tydsh 的创业团队Recursive @Recursive_SI 发布了一个阶段性的成果:自动化AI研究系统 这个系统里AI能自己完成「提出想法→实现→跑实验→验证→根据结果选下一个实验」这一整套研究循环。 结果表明在目标清…

X AI KOLs Timeline

Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。