MILO:通过多智能体协同进化实现自动化 Harness 发现

Hugging Face Daily Papers 论文

摘要

论文提出了 MILO,一个让智能体 harness 与用于发现它们的搜索策略协同进化的框架,采用基于岛屿的进化搜索,并结合变异体智能体与协调器。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 优于最前沿的 harness 和搜索方法,甚至超越了 Terminal-Bench 2.1 排行榜的榜首条目,且 token 消耗减少 26%。

现代智能体系统将 AI 模型与一个控制执行和环境交互的 harness 结合在一起。Harness 的设计对长期任务表现有强烈影响,但其组合式搜索空间需要大量人工投入,且随着模型更新必须反复进行。现有的自动化方法对这一搜索空间的探索较为狭隘,往往只优化提示词(prompt)或技能(skill)等单一组件,或被固定的、利用式(exploitative)的搜索策略所困。我们提出 MILO(Meta-evolutionary Island Orchestration,元进化岛屿协调)框架,实现智能体 harness 与其发现策略的协同进化。MILO 结合了以下三部分:(i) 基于岛屿树的层级谱系记忆,将被拒绝的变异作为负向证据加以利用;(ii) 每个岛屿上的变异体智能体,利用全局搜索历史和针对特定父代的反馈,重写完整的 harness;(iii) 一个通过谱系嫁接(grafting)、物种分化(speciation)、变异体重分配和课程修订来自适应调整搜索的协调器。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 使用前沿模型(Opus 4.8)和开放权重模型(gpt-oss-120b),在对比中优于八种最先进 harness 和六种搜索方法。使用 Opus 4.8 时,MILO 相对于其初始 harness 的解决率分别提升了 +12.0%、+28.3% 和 +10.3%,而此前最好的搜索方法的提升分别为 +4.5%、+18.3% 和 0%。在 Terminal-Bench 2.1 上,MILO 达到 86.1 ± 2.0%,超过了官方排行榜的榜首条目(83.8 ± 2.3%),同时比其初始 harness 少用 26\% 的 token。在 EinsteinArena 的开放问题上,MILO 改进了目前已知的上界:Erdős 最小重叠问题(0.3808586 提升至 0.3808568)以及第一和第三个自相关不等式(1.50274365 提升至 1.50274360;1.45081 提升至 1.44889)。
查看原文
查看缓存全文

缓存时间: 2026/10/01 20:24

论文页面 - MILO:通过编排式多智能体演化实现自动化 Harness 发现

来源:https://huggingface.co/papers/2609.38349 作者:

,

,

,

,

,

,

,

,

,

摘要

现代 agent 系统将 AI 模型与一个控制执行和环境交互的 harness 结合在一起。Harness 的设计对长程任务性能影响极大,但其组合式搜索空间需要大量人力投入,且随着模型更新还必须反复进行。现有的自动化方法对此空间的探索十分有限,往往只优化 prompt 或 skill 等组件,或被困于固定的、只做利用(exploitative)的搜索策略中。我们提出 MILO(Meta-evolutionary Island Orchestration,元演化岛屿编排),一个让 agent harness 与其发现策略共同演化的框架。MILO 结合了:(i) 基于岛屿树的层级谱系记忆,并将被拒绝的变异作为负向证据加以利用;(ii) 每个岛屿配备的 mutator agent,借助全局搜索历史和针对特定父代的反馈来重写完整的 harness;(iii) 一个 orchestrator,通过谱系嫁接(lineage grafting)、物种形成(speciation)、mutator 重新分配以及课程修订(curriculum revision)来自适应地调整搜索过程。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 使用前沿模型(Opus 4.8)和开放权重模型(gpt-oss-120b)时,均优于八个最先进 harness 和六种搜索方法。在 Opus 4.8 上,MILO 相比其初始 harness 分别将解决率提升了 +12.0%、+28.3% 和 +10.3%,而此前最佳搜索方法的提升仅为 +4.5%、+18.3% 和 0%。在 Terminal-Bench 2.1 上,它达到了 86.1±2.0%,超过了官方排行榜榜首条目(83.8±2.3%),同时使用的 token 比其初始 harness 少 26%。在 EinsteinArena 开放问题上,MILO 改进了已知的最佳上界:Erdős 最小重叠问题(0.3808586 提升至 0.3808568),以及第一和第三自相关不等式(1.50274365 提升至 1.50274360;1.45081 提升至 1.44889)。

查看 arXiv 页面 (https://arxiv.org/abs/2609.38349) 查看 PDF (https://arxiv.org/pdf/2609.38349) 项目页面 (https://jprithwish.github.io/MILO/) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.38349)

将此论文加载到你的 agent 中:

hf papers read 2609.38349

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.38349,即可将模型与本页面关联。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.38349,即可将数据集与本页面关联。

引用此论文的 Spaces 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2609.38349,即可将 Space 与本页面关联。

收录此论文的合集 0

暂无合集收录此论文

将此论文添加到合集 (https://huggingface.co/new-collection),即可将其与本页面关联。

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

来自 Meta 的一篇关于智能体框架(agent harness)优化的优秀论文。Meta-Harness 式的搜索方法只使用一个开发集和一个提议……

X AI KOLs Timeline

# Meta(联合 Duke 与 UC Davis)提出用于智能体 harness 优化的「自改进分支混合」框架 Meta 联合杜克大学(Duke)与加州大学戴维斯分校(UC Davis)提出了一种 **Mixture of Self-Improving Branches(自改进分支混合)** 框架,用于优化智能体 harness(运行框架)。该方法将原本单轨迹的 **Meta-Harness** 搜索拆分为多个**自适应分支**:每个分支拥有不断演进的开发子集(development subsets)和提案策略(proposal policies),并引入一个**路由器(router)**,针对每个输入动态选择表现最佳的分支。 该框架在多个基准上取得了显著提升: - **Olympiad 级别数学任务**:相对提升最高可达 **+34.8%** - **Terminal-Bench 2.0**:提升 **+11.6%** - **SWE-bench Lite**:提升 **+3.8%**

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。