在测试时 AI4AI 中学习智能体框架设计的元技能
摘要
本文提出了 Meta-Skill 方法,让一个冻结的 Builder 模型从 Target 的执行反馈中学习可复用的原则,从而为未见过的任务构建更优的智能体框架。该方法在 Harness-Bench 和 NewtonBench 上将性能提升了 8.95 个百分点,指出了一条通过学习构建更好的环境(而非修改模型权重)来实现系统级自我改进的路径。
查看缓存全文
缓存时间: 2026/10/01 04:20
论文页面 - 在测试时 AI4AI 中学习 Agent 框架设计的元技能
来源:https://huggingface.co/papers/2609.38143
摘要
Agent 的表现既取决于其推理能力,也取决于它所处的执行环境。我们研究了测试时的 AI-for-AI(AI4AI)问题:在 Target 和 Builder 两个模型的权重都保持固定的情况下,Builder 如何学会为 Target 构建更好的执行环境?为了使 Builder 的经验可复用,我们提出了 Meta-Skill(元技能):一组用于说明何时需要支持、以及应提供何种资源的原则。Builder 从 Target 在开发集上的执行反馈中学习这些原则,然后利用冻结的技能库(skill bank)为未见过的任务构建框架(harness)。在 Harness-Bench 和 NewtonBench 上,使用完整技能库的元技能方法相比无技能构建在宏平均性能上提升了 8.95 个百分点,相比将同一技能库直接交给 Target 则提升了 12.02 个百分点。这些结果凸显了将经验转化为可执行支持的价值。当同一模型同时扮演两个角色时取得的提升,进一步提示了一条通过学习构建更好的环境来实现系统级自我改进的路径。
查看 arXiv 页面 (https://arxiv.org/abs/2609.38143) | 查看 PDF (https://arxiv.org/pdf/2609.38143) | GitHub1 (https://github.com/qiancheng-apodex/MetaSkill-AI4AI) | 加入收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.38143)
在你的 agent 中获取这篇论文:
hf papers read 2609.38143
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.38143,即可将该论文链接到本页面。
引用本文的数据集 0
暂无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.38143,即可将该论文链接到本页面。
引用本文的 Spaces 0
暂无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.38143,即可将该论文链接到本页面。
收录本文的合集 0
暂无收录本文的合集
将本文添加到合集 (https://huggingface.co/new-collection),即可链接到本页面。
相似文章
来自 Meta 的一篇关于智能体框架(agent harness)优化的优秀论文。Meta-Harness 式的搜索方法只使用一个开发集和一个提议……
# Meta(联合 Duke 与 UC Davis)提出用于智能体 harness 优化的「自改进分支混合」框架 Meta 联合杜克大学(Duke)与加州大学戴维斯分校(UC Davis)提出了一种 **Mixture of Self-Improving Branches(自改进分支混合)** 框架,用于优化智能体 harness(运行框架)。该方法将原本单轨迹的 **Meta-Harness** 搜索拆分为多个**自适应分支**:每个分支拥有不断演进的开发子集(development subsets)和提案策略(proposal policies),并引入一个**路由器(router)**,针对每个输入动态选择表现最佳的分支。 该框架在多个基准上取得了显著提升: - **Olympiad 级别数学任务**:相对提升最高可达 **+34.8%** - **Terminal-Bench 2.0**:提升 **+11.6%** - **SWE-bench Lite**:提升 **+3.8%**
@dair_ai:// 面向多智能体系统的元技能演化 // 多智能体系统能否在不触及...的情况下提升编排能力?
Skill-MAS提出了一种在无需修改模型权重的情况下,为多智能体系统演化元技能以提升编排能力的方法,实现了跨任务和LLM的可迁移性能提升。
Harness Engineering for Self-Improvement(28 分钟阅读)
这篇博客文章由 Lilian Weng 撰写,探讨了递归自我改进在 AI 中的概念,重点介绍了 harness engineering——即围绕基础模型的系统——如何通过工作流设计和评估实现 AI 代理的自动化和改进。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。