LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Hugging Face Daily Papers 论文

摘要

介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。

大型语言模型(LLM)智能体越来越多地承担长时程任务,这些任务需要在许多相互依赖的步骤中进行持续的推理、工具使用和修改。然而,现有的智能体框架在不断增长的上下文中维护任务执行、任务状态和完成评估,使得状态难以跟踪,并允许错误的自评估传播到后续决策中。我们将长时程执行重新表述为任务状态管理问题,并提出LongHorizon-Harness,它在执行之外显式维护任务状态,并且仅使用从环境中独立验证的事实来更新状态。其Manage-Execute-Audit(MEA)循环使用一个管理器来维护任务状态并确定下一个子任务,一个全新上下文的执行器来执行该子任务,以及一个只读审计器在下一轮之前验证所产生的环境状态。轻量级的AgentAdapter支持在不修改其原生智能体循环的情况下,替换模型和框架后端。LongHorizon-Harness将Qwen~3.7-Plus在WeaveBench上的性能从51.8%提升到80.7%,在Terminal-Bench~2.1上从69.7%提升到77.2%,在OSWorld~2.0上从2.8%提升到8.3%。它还将Claude Opus~4.7在OSWorld2.0子集上的性能从20.0%提升到34.3%,展示了在模型、框架和交互领域上的一致提升。
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - LongHorizon-Harness:推进面向现实世界任务的长时程智能体

来源:https://huggingface.co/papers/2608.01964

摘要

大语言模型(LLM)智能体越来越多地承担长时程任务,这些任务需要在许多相互依赖的步骤中进行持续推理、工具使用和修正。然而,现有的智能体框架(harness)将任务执行、任务状态和完成情况评估都维护在不断增长的上下文中,这使得状态难以跟踪,并可能导致错误的自我评估传播到后续决策中。我们将长时程执行重新定义为任务状态管理问题,并提出 LongHorizon-Harness。它在执行之外显式维护任务状态,并且仅使用从环境中独立验证的事实来更新该状态。其 Manage-Execute-Audit(MEA)循环使用一个管理者(manager)来维护任务状态并确定下一个子任务,使用一个全新上下文的执行器(executor)来执行该子任务,并使用一个只读审计器(auditor)在下一轮之前验证由此产生的环境状态。一个轻量级的 Agent Adapter 支持可互换的模型和 harness 后端,而无需修改其原生智能体循环。LongHorizon-Harness 在 WeaveBench 上将 Qwen 3.7-Plus 从 51.8% 提升至 80.7%,在 Terminal-Bench 2.1 上从 69.7% 提升至 77.2%,在 OSWorld 2.0 上从 2.8% 提升至 8.3%。它还将 OSWorld 2.0 子集上的 Claude Opus 4.7 从 20.0% 提升至 34.3%,展示了在模型、harness 和交互领域上的一致提升。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01964)
查看 PDF (https://arxiv.org/pdf/2608.01964)
项目页面 (https://lh-harness.pages.dev/)
GitHub51 (https://github.com/AMAP-ML/LongHorizon-Harness)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01964)

在您的智能体中获取这篇论文:

hf papers read 2608\.01964

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型

0

没有模型链接至该论文

在模型 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该模型。

引用该论文的数据集

0

没有数据集链接至该论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该数据集。

引用该论文的 Space

0

没有 Space 链接至该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该 Space。

包含该论文的收藏

0

没有收藏包含该论文

将这篇论文添加到收藏(https://huggingface.co/new-collection)中,即可从此页面链接到它。

相似文章

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

面向执行轨迹的推理时对齐框架

arXiv cs.LG

本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。