LongHorizon-Harness:推进面向真实世界任务的长时程智能体
摘要
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - LongHorizon-Harness:推进面向现实世界任务的长时程智能体
来源:https://huggingface.co/papers/2608.01964
摘要
大语言模型(LLM)智能体越来越多地承担长时程任务,这些任务需要在许多相互依赖的步骤中进行持续推理、工具使用和修正。然而,现有的智能体框架(harness)将任务执行、任务状态和完成情况评估都维护在不断增长的上下文中,这使得状态难以跟踪,并可能导致错误的自我评估传播到后续决策中。我们将长时程执行重新定义为任务状态管理问题,并提出 LongHorizon-Harness。它在执行之外显式维护任务状态,并且仅使用从环境中独立验证的事实来更新该状态。其 Manage-Execute-Audit(MEA)循环使用一个管理者(manager)来维护任务状态并确定下一个子任务,使用一个全新上下文的执行器(executor)来执行该子任务,并使用一个只读审计器(auditor)在下一轮之前验证由此产生的环境状态。一个轻量级的 Agent Adapter 支持可互换的模型和 harness 后端,而无需修改其原生智能体循环。LongHorizon-Harness 在 WeaveBench 上将 Qwen 3.7-Plus 从 51.8% 提升至 80.7%,在 Terminal-Bench 2.1 上从 69.7% 提升至 77.2%,在 OSWorld 2.0 上从 2.8% 提升至 8.3%。它还将 OSWorld 2.0 子集上的 Claude Opus 4.7 从 20.0% 提升至 34.3%,展示了在模型、harness 和交互领域上的一致提升。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01964)
查看 PDF (https://arxiv.org/pdf/2608.01964)
项目页面 (https://lh-harness.pages.dev/)
GitHub51 (https://github.com/AMAP-ML/LongHorizon-Harness)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01964)
在您的智能体中获取这篇论文:
hf papers read 2608\.01964
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型
0
没有模型链接至该论文
在模型 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该模型。
引用该论文的数据集
0
没有数据集链接至该论文
在数据集 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该数据集。
引用该论文的 Space
0
没有 Space 链接至该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.01964,即可从此页面链接到该 Space。
包含该论文的收藏
0
没有收藏包含该论文
将这篇论文添加到收藏(https://huggingface.co/new-collection)中,即可从此页面链接到它。
相似文章
OneDayAgent:迈向自主智能体的长时程执行框架
OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。