HarnessDev:LLMs能否创建并演化其自身的代理执行框架?

Hugging Face Daily Papers 论文

摘要

HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。

随着智能体从研究原型转变为部署工具,其能力越来越依赖于模型外部的执行基础设施,通常称为代理执行框架。在固定模型权重的情况下改变此框架可以显著改变任务性能。当前的智能体评估通常报告在选定框架下的下游性能,使得模型自身开发框架的能力相对未被充分探索。我们引入HarnessDev,这是一个将评估单元从任务输出转向可运行基础设施的基准测试。HarnessDev涵盖两个阶段。在创建阶段,智能体从最小种子和少量案例开始,构建完整的执行系统。在演化阶段,它从自身创建的框架开始,利用下游执行反馈迭代修订,以提高基准性能。然后我们根据能力(在保留基准上的任务成功率)和效率(执行令牌成本)评估每个构建的框架。报告的创建结果涵盖六个创建者LLM、四个领域和五个下游基准,共计2,207个独特的下游实例,隐藏的评估任务从开发中保留。我们发现生成的框架在代码以及搜索和研究方面仍远落后于成熟的人工工程参考,而在写作和机器学习实验方面匹配或超越了选定参考,执行成本差异大。演化产生了一些性能提升,但它们不稳定且仅部分迁移到保留任务。使用固定运行时模型的实验进一步表明,收益强烈依赖于执行框架的模型,表明模型间迁移有限。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:49

论文页面 - HarnessDev:LLM能否创建并演进自己的代理工具链?

来源:https://huggingface.co/papers/2609.01437 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

HarnessDev通过衡量代理构建并迭代改进执行基础设施的能力(而非最终任务输出)来评估代理,揭示了自建工具链在能力和效率上差异显著,且跨模型迁移性较差。

随着代理从研究原型发展为部署工具,其性能越来越依赖于模型外部的执行基础设施(https://huggingface.co/papers?q=execution%20infrastructure),通常被称为代理工具链(https://huggingface.co/papers?q=agent%20harness)。在保持模型权重不变的情况下改变此工具链,可能显著改变任务性能。当前的代理评估通常只报告在选定工具链下的下游性能,导致模型自身开发工具链的能力相对未被充分探索。我们推出了HarnessDev(https://huggingface.co/papers?q=HarnessDev)基准测试,将评估单元从任务产出转移到可运行的基础设施。HarnessDev(https://huggingface.co/papers?q=HarnessDev)涵盖两个阶段。在创建阶段,代理从最小化种子和少量用例开始,构建完整的执行系统。在演进阶段,它从自身创建的工具链出发,利用下游执行反馈进行迭代修订,目标是提升基准测试性能。随后我们评估每个构建的工具链在能力(在留出基准测试(https://huggingface.co/papers?q=held-out%20benchmarks)上的任务成功率)和效率(执行令牌成本(https://huggingface.co/papers?q=execution-token%20cost))方面的表现。报告的创建结果涵盖六个创建用LLM(https://huggingface.co/papers?q=LLMs)、四个领域和五个下游基准测试,总计2,207个独立下游实例,并包含对开发过程隐藏的评估任务。我们发现生成的工具链在代码以及搜索和研究领域,仍远落后于成熟的人工工程参考实现;而在写作和机器学习实验领域,则匹配或超越选定的参考实现,但执行成本差异显著。演进带来了一些性能提升,但这些提升不稳定,仅能部分迁移到留出任务。使用固定运行时模型的实验进一步表明,这些提升强烈依赖于执行工具链的模型,表明跨模型迁移能力有限。

查看arXiv页面(https://arxiv.org/abs/2609.01437)查看PDF(https://arxiv.org/pdf/2609.01437)项目页面(https://self-developing-agents.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01437)

在你的代理中获取此论文:

hf papers read 2609\.01437

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.01437以从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.01437以从本页链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.01437以从本页链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接。

相似文章

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。

研究如何构建LLM智能体框架

Reddit r/AI_Agents

这篇研究文章回顾了关于构建LLM智能体框架的研究成果,强调确定性护栏、有效的多智能体层次结构和适当的记忆架构对性能和安全至关重要,同时指出了当前评估和认证中的空白。

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。