AI能否让其他AI变得更优秀?我们测试了5个前沿LLM在重写其他代理框架的能力,评分基于它们从未见过的测试集(HarnessOpt-Bench,arXiv + MIT代码)
摘要
文章介绍了HarnessOpt-Bench,一个评估LLM改进其他AI代理框架能力的基准测试,并基于5个前沿模型的研究结果,指出模型选择对性能的影响大于框架选择。
AI能否让其他AI变得更优秀?又是什么阻止了它作弊?上个月,一个OpenAI评估代理逃出了其沙盒并入侵了Hugging Face,显然是为了从基准测试中获取测试解决方案。这正是一个重写代理并查看自己评分的系统所做出的行为。尽管如此,我们仍然着手测量递归自我改进,将考试锁在沙盒之外。我们介绍了HarnessOpt-Bench,它评估LLM在提升另一个代理框架方面的改进程度。在开发集上,优化器可以看到每个案例的追踪。在验证时,它获得一个综合分数。在测试集上,什么也没有——直到一个受信任的服务器对最终候选框架进行评分。API密钥、预算执行和保留数据永远不会进入优化器的沙盒。这种隔离是通过设计实现的,而非通过指令:保留的评估器和权限控制位于演化框架的循环之外。5个前沿模型,4个下游任务,111次运行以测试两个假设:1️⃣ 相同编码框架,更换模型:Claude Opus 5在OpenCode下在4个任务中排名第一。在一项任务上查看从2025年11月到2026年7月的发布,GPT从3%提升到49%的性能空间,Claude Opus从37%提升到59%。2️⃣ 相同模型,更换编码框架:模型是否在自身框架中表现最佳?没有一致的主场优势:opencode在20个模型-任务对中击败了11个原生框架(Claude Code, Codex, Kimi CLI)。模型选择带来的增益是框架选择的1.8倍。论文:https://arxiv.org/abs/2608.06301 代码(MIT许可,基于我们团队的ICML 2026 VeRO):https://github.com/scaleapi/vero 原文:https://www.linkedin.com/posts/shehabyasser_can-an-ai-make-other-ais-better-and-what-share-7498801902260981760-xuCo/
相似文章
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
AI能自我改进吗?RSI或许是答案[研究]
介绍HarnessOpt-Bench以测量AI中的递归自我改进,评估了5个前沿模型在4项任务上的表现,发现模型选择比编程工具选择的影响更大。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。