Harness-Zero:通过Agent-as-Harness的Harness蒸馏

Hugging Face Daily Papers 论文

摘要

本文介绍了Harness-Zero,一种通过agent-as-harness将优化的代理框架蒸馏到大语言模型中的方法,即使在专业框架被移除后,也能显著提升知识工作、工具使用和科学领域的任务性能。

代理框架,即调解模型-环境交互的外部系统,可以显著提高代理性能,但其收益在部署时仍与框架绑定。因为最佳框架在不同领域、实例和模型间存在差异,通用代理要么满足于次优的共享框架,要么在不断增长的专业框架集中进行路由。因此,我们研究代理框架蒸馏:使用领域或实例优化的框架作为训练时指导,并将诱导的行为转移到模型权重中,使其收益在单一固定目标框架下得以保留。挑战在于两个框架在动作空间和可用信息上存在差异,因此来自优化框架的指导不能直接作为目标框架的监督。我们引入Harness-Zero,它通过agent-as-harness实现框架蒸馏。在优化框架的指导下,一个代理框架代理在目标框架的动作空间中执行前纠正学生响应,将框架指导转化为训练示范。对由此产生的轨迹进行微调,将框架诱导的行为内化到模型中,因此专业框架可以在部署时被移除。我们跨越知识工作、工具使用和科学领域的实验表明:(1) 对于使用相同进化框架的前沿LLMs,agent-as-harness优于code-as-harness。(2) 在部署时移除专业框架后,Harness-Zero将基础模型的宏平均任务成功率从23.3%提高到44.3%,甚至超过了该框架仍附着时达到的41.7%。(3) Harness-Zero恢复了基础模型中缺失的框架诱导行为,在三个领域的28种模式中平均恢复率为82.3%。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:27

论文页面 - Harness-Zero:通过智能体作为约束器实现约束蒸馏

来源:https://huggingface.co/papers/2609.24974

摘要

智能体约束器(Agentharnesses)作为中介模型与环境交互的外部系统,能显著提升智能体性能,但其优势始终依赖于部署时所用的约束器。由于最优约束器因领域、实例和模型而异,通用智能体要么满足于次优的共享约束器,要么在不断增长的专用约束器集合间切换。因此,我们研究智能体约束蒸馏:将针对特定领域或实例优化的约束器作为训练时引导,并将其诱导的行为迁移到模型权重中,使其优势在单一固定目标约束器下得以保留。挑战在于两种约束器在动作空间和可用信息上存在差异,因此优化约束器的引导无法直接作为目标约束器的监督信号。我们提出 Harness-Zero,通过“智能体作为约束器”的方式实现约束蒸馏。在优化约束器的引导下,约束智能体在目标约束器的动作空间中对学生产出进行执行前纠正,将约束引导转化为训练演示。基于生成轨迹的微调将约束诱导行为内化到模型中,从而在部署时可移除专用约束器。我们在知识工作、工具使用和科学领域的实验表明:(1) 对于使用相同进化约束器的前沿大语言模型,智能体作为约束器优于代码作为约束器。(2) 部署时移除专用约束器后,Harness-Zero 将基础模型的宏平均任务成功率从 23.3% 提升至 44.3%,甚至超过保留该约束器时达到的 41.7%。(3) Harness-Zero 能恢复基础模型中缺失的约束诱导行为,在三个领域的 28 种模式中平均恢复率达 82.3%。

查看 arXiv 页面 (https://arxiv.org/abs/2609.24974) 查看 PDF (https://arxiv.org/pdf/2609.24974) GitHub1 (https://github.com/metaevo-ai/harness-zero) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24974)

在您的智能体中获取此论文:
hf papers read 2609.24974

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.24974 以从本页链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.24974 以从本页链接。

引用此论文的空间 0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.24974 以从本页链接。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。