Marathoner:超长时间范围自主智能
摘要
本文提出了Marathoner,一个用于超长时间范围执行的自主代理模型,使用一个全面的后训练管道,任务从GitHub PR合成,并采用一种新颖的奖励策略,以在基准测试中实现卓越性能。
查看缓存全文
缓存时间: 2026/09/30 04:19
论文页面 - Marathoner:超长期自主智能
来源:https://huggingface.co/papers/2609.34378
摘要
人类天生具备为长期目标持续工作的能力。面对具有挑战性的任务,人类可以连续数月甚至数年努力以实现特定目标。本文提出Marathoner,一个具备超长期执行能力的自主智能体模型。具体而言,我们提出了一套完整的后训练流程,旨在将这一关键能力注入基础模型。
对于超长期任务合成,我们利用来自多元GitHub仓库、包含1000+行新代码的重大发布PR,作为合成高难度任务级数据的主要来源。此外,我们引入了多任务链式方法,将多个生成的任务串联为更具挑战性的单一任务,从而能够合成具有前沿难度水平的任务。
在拒绝采样微调方面,我们结合强教师模型与多元执行环境,在合成任务上生成轨迹,并基于拒绝采样的轨迹对基础模型进行监督微调。对于强化学习,冷启动模型在展开过程中通过独立沙箱内的执行环境进行真实世界执行,这有效促进了获取真正的超长期执行能力。
我们进一步提出了一种新颖的奖励策略——后期阶段奖励加成,该策略明确鼓励模型在执行后期阶段进行有意义的复杂操作。通过对包含超长期任务的5个基准测试的全面评估,Marathoner相对于基础模型实现了持续且显著的性能提升,甚至超越了强大的专有模型的性能。进一步分析表明,Marathoner能够在高难度任务上持续工作10+小时并进行1000+次工具调用。
查看 arXiv 页面 (https://arxiv.org/abs/2609.34378) 查看 PDF (https://arxiv.org/pdf/2609.34378) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34378)
在你的智能体中获取本文:
hf papers read 2609\.34378
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。
引用本文的数据集 0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。
引用本文的 Spaces 0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.34378 以从此页面链接它。
包含本文的合集 0
没有包含本文的合集
将本文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
@dair_ai: Meta Superintelligence Labs 一篇关于控制长时智能体运行的超有趣论文。他们使用相同的 worker 和……
Meta Superintelligence Labs 提出 agentic meta-reasoning(智能体元推理),这是一种推理时的调度框架,由控制器决定长时智能体运行中下一步该执行什么任务。在相同的 worker 和预算下,配合 GPT-5.5,ProgramBench 成绩从 63.7% 提升至 71.5%。在 ProofBench、ARC-AGI-2 和 LongCoT-mini 上,对前沿模型取平均后,增益稳定在 3.6 至 4.2 个百分点。
Meta-Harness研发:企业级自我改进以支持长周期AI工作流
本文探讨了将自主代码改进变得规范且适用于企业,以支持长周期AI工作流的研发工作。
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。