Marathoner:超长时间范围自主智能

Hugging Face Daily Papers 论文

摘要

本文提出了Marathoner,一个用于超长时间范围执行的自主代理模型,使用一个全面的后训练管道,任务从GitHub PR合成,并采用一种新颖的奖励策略,以在基准测试中实现卓越性能。

人类自然地拥有为长期目标持续工作的能力。面对一个挑战性任务,人类可以连续工作数月甚至数年来完成一个特定目标。在本文中,我们提出了Marathoner,一个具有超长时间范围执行能力的自主代理模型。具体来说,我们提出了一个全面的后训练管道,将这种关键能力注入基础模型。对于超长时间范围任务合成,我们利用来自不同GitHub仓库的主要发布PR(包含1000+行新代码)作为合成具有挑战性的任务级数据的主要来源。此外,我们引入了多任务链接,将多个生成的任务链接成一个更具有挑战性的任务,从而能够合成具有前沿难度的任务。对于拒绝采样微调,我们结合强大的教师模型与多样化的执行环境,在我们的合成任务上生成轨迹,并使用拒绝采样的轨迹对基础模型进行有监督微调。对于强化学习,冷启动模型通过执行环境在独立沙箱中执行真实世界操作,在展开过程中有效地促进获取真正的超长时间范围执行能力。我们进一步提出了一种新颖的奖励策略,后期阶段奖励,明确鼓励模型在执行后期阶段进行有意义的操纵。通过对包含超长时间范围任务的5个基准进行广泛评估,Marathoner相比基础模型实现了持续且显著的性能改进,甚至超越了强大的专有模型的性能。进一步分析表明,Marathoner可以在高挑战性任务上持续工作10小时以上并执行1000多次工具调用。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:19

论文页面 - Marathoner:超长期自主智能

来源:https://huggingface.co/papers/2609.34378

摘要

人类天生具备为长期目标持续工作的能力。面对具有挑战性的任务,人类可以连续数月甚至数年努力以实现特定目标。本文提出Marathoner,一个具备超长期执行能力的自主智能体模型。具体而言,我们提出了一套完整的后训练流程,旨在将这一关键能力注入基础模型。

对于超长期任务合成,我们利用来自多元GitHub仓库、包含1000+行新代码的重大发布PR,作为合成高难度任务级数据的主要来源。此外,我们引入了多任务链式方法,将多个生成的任务串联为更具挑战性的单一任务,从而能够合成具有前沿难度水平的任务。

在拒绝采样微调方面,我们结合强教师模型与多元执行环境,在合成任务上生成轨迹,并基于拒绝采样的轨迹对基础模型进行监督微调。对于强化学习,冷启动模型在展开过程中通过独立沙箱内的执行环境进行真实世界执行,这有效促进了获取真正的超长期执行能力。

我们进一步提出了一种新颖的奖励策略——后期阶段奖励加成,该策略明确鼓励模型在执行后期阶段进行有意义的复杂操作。通过对包含超长期任务的5个基准测试的全面评估,Marathoner相对于基础模型实现了持续且显著的性能提升,甚至超越了强大的专有模型的性能。进一步分析表明,Marathoner能够在高难度任务上持续工作10+小时并进行1000+次工具调用。

查看 arXiv 页面 (https://arxiv.org/abs/2609.34378) 查看 PDF (https://arxiv.org/pdf/2609.34378) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34378)

在你的智能体中获取本文:

hf papers read 2609\.34378

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。

引用本文的数据集 0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。

引用本文的 Spaces 0

没有 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。

包含本文的合集 0

没有包含本文的合集

将本文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

@dair_ai: Meta Superintelligence Labs 一篇关于控制长时智能体运行的超有趣论文。他们使用相同的 worker 和……

X AI KOLs Timeline

Meta Superintelligence Labs 提出 agentic meta-reasoning(智能体元推理),这是一种推理时的调度框架,由控制器决定长时智能体运行中下一步该执行什么任务。在相同的 worker 和预算下,配合 GPT-5.5,ProgramBench 成绩从 63.7% 提升至 71.5%。在 ProofBench、ARC-AGI-2 和 LongCoT-mini 上,对前沿模型取平均后,增益稳定在 3.6 至 4.2 个百分点。

@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?

X AI KOLs Following

AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。