HarnessForge: 联合执行框架与策略演化用于自适应智能体系统

Hugging Face Daily Papers 论文

摘要

HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。

LLM 智能体日益需要在需要不同执行范式的异构任务领域中进行操作。这对固定智能体系统构成了挑战,并促使超越孤立组件更新的系统级元自适应。尽管现有工作调整了外部执行框架或训练了底层推理策略,但全系统自适应仍未得到充分刻画。结构与执行之间的自适应空间很少被明确化,并且外部执行框架与内部推理器之间的兼容性未得到联合优化。我们提出 HarnessForge,一种用于演化 LLM 智能体系统的元自适应框架。HarnessForge 将智能体系统形式化为执行框架-策略对,定义了一个稳定的自适应空间,将框架级别的执行结构与策略级别的推理行为分离。然后,它通过故障引导的框架剪裁和框架条件化的策略对齐来执行框架-策略共同演化。跨五个不同领域基准测试的实验表明,HarnessForge 持续改进了 Qwen3-4B 和 Qwen3-8B 骨干模型,优于仅执行框架和仅策略的基线,在最强基线上实现了高达 12.0\% 的提升,并实现了有利的推演效率权衡,证明框架-策略共同演化是有效的,并且执行框架与推理策略之间的可执行兼容性对于智能体系统自适应至关重要。代码可在 https://github.com/mingju-c/HarnessForge 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/08 11:15

论文页面 - HarnessForge:用于自适应代理系统的协同框架与策略演化

来源:https://huggingface.co/papers/2606.01779

摘要

LLM代理在面对需要不同执行范式的异构任务场景时面临挑战,这推动了超越组件更新的系统级元适应的需求。

LLM代理(https://huggingface.co/papers?q=LLM%20agents)日益需要在需要不同执行范式的异构任务场景中运行。这挑战了固定代理系统(https://huggingface.co/papers?q=agent%20systems),并推动了超越孤立组件更新的系统级元适应(https://huggingface.co/papers?q=meta-adaptation)。虽然现有工作已调整外部框架或训练底层推理策略,但全系统适应仍未得到充分表征。结构与执行之间的适应空间很少被明确化,并且外部框架与内部推理器之间的兼容性也未得到联合优化。我们提出HarnessForge,一个用于演化LLM代理系统(https://huggingface.co/papers?q=agent%20systems)的元自适应框架。HarnessForge将代理系统表述为框架-策略对,定义了将框架级执行结构与策略级推理行为分离的稳定适应空间。然后,它通过故障引导的框架剪裁(https://huggingface.co/papers?q=fault-guided%20harness%20tailoring)和框架条件化的策略对齐(https://huggingface.co/papers?q=harness-conditioned%20policy%20alignment)执行框架-策略协同演化(https://huggingface.co/papers?q=co-evolution)。在来自不同领域的五个基准上的实验表明,HarnessForge持续改进了Qwen3-4B和Qwen3-8B骨干网络,超越了仅框架和仅策略的基线,相比最强基线提升了高达12.0%,并实现了有利的展开效率权衡,表明框架-策略协同演化(https://huggingface.co/papers?q=co-evolution)是有效的,并且框架与推理策略之间的执行兼容性对于代理系统适应至关重要。代码可在https://github.com/mingju-c/HarnessForge获取。

查看arXiv页面(https://arxiv.org/abs/2606.01779)查看PDF(https://arxiv.org/pdf/2606.01779)GitHub8(https://github.com/mingju-c/HarnessForge)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01779)

在你的代理中获取此论文:

hf papers read 2606.01779

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2606.01779以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2606.01779以从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2606.01779以从此页面链接。

包含此论文的收藏0

没有包含此论文的收藏

请将这篇论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。

面向执行轨迹的推理时对齐框架

arXiv cs.LG

本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。