MILO:通过多智能体协同进化实现自动化 Harness 发现
摘要
论文提出了 MILO,一个让智能体 harness 与用于发现它们的搜索策略协同进化的框架,采用基于岛屿的进化搜索,并结合变异体智能体与协调器。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 优于最前沿的 harness 和搜索方法,甚至超越了 Terminal-Bench 2.1 排行榜的榜首条目,且 token 消耗减少 26%。
查看缓存全文
缓存时间: 2026/10/01 20:24
论文页面 - MILO:通过编排式多智能体演化实现自动化 Harness 发现
来源:https://huggingface.co/papers/2609.38349 作者:
,
,
,
,
,
,
,
,
,
摘要
现代 agent 系统将 AI 模型与一个控制执行和环境交互的 harness 结合在一起。Harness 的设计对长程任务性能影响极大,但其组合式搜索空间需要大量人力投入,且随着模型更新还必须反复进行。现有的自动化方法对此空间的探索十分有限,往往只优化 prompt 或 skill 等组件,或被困于固定的、只做利用(exploitative)的搜索策略中。我们提出 MILO(Meta-evolutionary Island Orchestration,元演化岛屿编排),一个让 agent harness 与其发现策略共同演化的框架。MILO 结合了:(i) 基于岛屿树的层级谱系记忆,并将被拒绝的变异作为负向证据加以利用;(ii) 每个岛屿配备的 mutator agent,借助全局搜索历史和针对特定父代的反馈来重写完整的 harness;(iii) 一个 orchestrator,通过谱系嫁接(lineage grafting)、物种形成(speciation)、mutator 重新分配以及课程修订(curriculum revision)来自适应地调整搜索过程。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 使用前沿模型(Opus 4.8)和开放权重模型(gpt-oss-120b)时,均优于八个最先进 harness 和六种搜索方法。在 Opus 4.8 上,MILO 相比其初始 harness 分别将解决率提升了 +12.0%、+28.3% 和 +10.3%,而此前最佳搜索方法的提升仅为 +4.5%、+18.3% 和 0%。在 Terminal-Bench 2.1 上,它达到了 86.1±2.0%,超过了官方排行榜榜首条目(83.8±2.3%),同时使用的 token 比其初始 harness 少 26%。在 EinsteinArena 开放问题上,MILO 改进了已知的最佳上界:Erdős 最小重叠问题(0.3808586 提升至 0.3808568),以及第一和第三自相关不等式(1.50274365 提升至 1.50274360;1.45081 提升至 1.44889)。
查看 arXiv 页面 (https://arxiv.org/abs/2609.38349) 查看 PDF (https://arxiv.org/pdf/2609.38349) 项目页面 (https://jprithwish.github.io/MILO/) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.38349)
将此论文加载到你的 agent 中:
hf papers read 2609.38349
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.38349,即可将模型与本页面关联。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.38349,即可将数据集与本页面关联。
引用此论文的 Spaces 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2609.38349,即可将 Space 与本页面关联。
收录此论文的合集 0
暂无合集收录此论文
将此论文添加到合集 (https://huggingface.co/new-collection),即可将其与本页面关联。
相似文章
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
来自 Meta 的一篇关于智能体框架(agent harness)优化的优秀论文。Meta-Harness 式的搜索方法只使用一个开发集和一个提议……
# Meta(联合 Duke 与 UC Davis)提出用于智能体 harness 优化的「自改进分支混合」框架 Meta 联合杜克大学(Duke)与加州大学戴维斯分校(UC Davis)提出了一种 **Mixture of Self-Improving Branches(自改进分支混合)** 框架,用于优化智能体 harness(运行框架)。该方法将原本单轨迹的 **Meta-Harness** 搜索拆分为多个**自适应分支**:每个分支拥有不断演进的开发子集(development subsets)和提案策略(proposal policies),并引入一个**路由器(router)**,针对每个输入动态选择表现最佳的分支。 该框架在多个基准上取得了显著提升: - **Olympiad 级别数学任务**:相对提升最高可达 **+34.8%** - **Terminal-Bench 2.0**:提升 **+11.6%** - **SWE-bench Lite**:提升 **+3.8%**
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
EVOHARNESSBENCH: 你的代理能否跟上不断演进的框架?
本文介绍了EVOHARNESSBENCH,一个用于评估在工具、技能和代理框架不断演进下的LLM代理的基准测试,揭示了在保持和适应方面的差距。