HarnessDev:LLMs能否创建并演化其自身的代理执行框架?
摘要
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
查看缓存全文
缓存时间: 2026/09/03 03:49
论文页面 - HarnessDev:LLM能否创建并演进自己的代理工具链?
来源:https://huggingface.co/papers/2609.01437 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
HarnessDev通过衡量代理构建并迭代改进执行基础设施的能力(而非最终任务输出)来评估代理,揭示了自建工具链在能力和效率上差异显著,且跨模型迁移性较差。
随着代理从研究原型发展为部署工具,其性能越来越依赖于模型外部的执行基础设施(https://huggingface.co/papers?q=execution%20infrastructure),通常被称为代理工具链(https://huggingface.co/papers?q=agent%20harness)。在保持模型权重不变的情况下改变此工具链,可能显著改变任务性能。当前的代理评估通常只报告在选定工具链下的下游性能,导致模型自身开发工具链的能力相对未被充分探索。我们推出了HarnessDev(https://huggingface.co/papers?q=HarnessDev)基准测试,将评估单元从任务产出转移到可运行的基础设施。HarnessDev(https://huggingface.co/papers?q=HarnessDev)涵盖两个阶段。在创建阶段,代理从最小化种子和少量用例开始,构建完整的执行系统。在演进阶段,它从自身创建的工具链出发,利用下游执行反馈进行迭代修订,目标是提升基准测试性能。随后我们评估每个构建的工具链在能力(在留出基准测试(https://huggingface.co/papers?q=held-out%20benchmarks)上的任务成功率)和效率(执行令牌成本(https://huggingface.co/papers?q=execution-token%20cost))方面的表现。报告的创建结果涵盖六个创建用LLM(https://huggingface.co/papers?q=LLMs)、四个领域和五个下游基准测试,总计2,207个独立下游实例,并包含对开发过程隐藏的评估任务。我们发现生成的工具链在代码以及搜索和研究领域,仍远落后于成熟的人工工程参考实现;而在写作和机器学习实验领域,则匹配或超越选定的参考实现,但执行成本差异显著。演进带来了一些性能提升,但这些提升不稳定,仅能部分迁移到留出任务。使用固定运行时模型的实验进一步表明,这些提升强烈依赖于执行工具链的模型,表明跨模型迁移能力有限。
查看arXiv页面(https://arxiv.org/abs/2609.01437)查看PDF(https://arxiv.org/pdf/2609.01437)项目页面(https://self-developing-agents.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01437)
在你的代理中获取此论文:
hf papers read 2609\.01437
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.01437以从本页链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.01437以从本页链接。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.01437以从本页链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接。
相似文章
工具更新并非工具收益:自进化LLM智能体中进化能力的解耦
本文分析了自进化LLM智能体中的两种能力:工具更新能力和工具收益能力。研究发现工具更新能力在不同基础能力层级间持平,而工具收益能力则呈现非单调性,其中中等层级模型收益最大。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
研究如何构建LLM智能体框架
这篇研究文章回顾了关于构建LLM智能体框架的研究成果,强调确定性护栏、有效的多智能体层次结构和适当的记忆架构对性能和安全至关重要,同时指出了当前评估和认证中的空白。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。