协同演化辅助框架与模型:在线策略校正助力弱模型在模仿失败时追赶

Hugging Face Daily Papers 论文

摘要

本文提出一种在线策略专家校正流程,用于协同演化辅助框架与模型,使弱AI模型能通过纠正失败回合而非完全模仿来改进,保持兼容性并提升企业代理任务性能。

代理辅助框架(包括模型周围的系统提示、工具集、执行钩子和上下文管理脚手架)是代理任务成功的关键决定因素。自动化框架演化可以使较小模型以远低于前沿模型的成本在特定领域任务中表现良好。由于辅助框架和模型权重都影响行为,我们探讨如何结合框架演化和轻量级微调。在七个企业代理任务中,我们首先用弱模型演化一个辅助框架,然后发现更强的专家通常能更有效地使用它,表明专家监督可以弥合剩余差距。然而,在演化后的辅助框架下,用专家的完整轨迹训练弱模型适得其反:性能在所有七个任务上下降了4到30点,涉及Qwen3-Coder和Gemma 4,尽管相同程序在未演化的辅助框架下有所帮助。我们的分析表明,模仿转移知识并增加脚手架使用,但破坏了模型与辅助框架的契合度:弱模型采用了专家的规划策略,却没有执行它的能力,不再匹配围绕其原生规划风格演化的辅助框架。因此,我们开发了一个在线策略专家校正流程,由元级MLE代理自动化,该流程在弱模型自身展开中定位失败回合,并要求专家仅重写该回合。这保留了模型的规划风格,并结合了框架演化和模型适应的收益。我们的结果识别并解决了辅助框架和权重更新之间的冲突来源,为特定领域企业任务的经济协同演化提供了保持兼容性的方案。
查看原文
查看缓存全文

缓存时间: 2026/09/10 06:10

论文页面 - 共同演进框架与模型:当模仿学习失效时,在线策略修正如何帮助较弱模型迎头赶上

来源:https://huggingface.co/papers/2609.09134 作者:

,

,

,

,

,

,

,

,

,

,

摘要

将框架演进与局部专家修正相结合,能够在不破坏模型原生规划风格的前提下改进较弱模型。

智能体框架(https://huggingface.co/papers?q=Agent%20harness)(包括系统提示词、工具集、执行钩子以及围绕模型的上下文管理脚手架)是智能体任务成功的关键决定因素。自动化的框架演进(https://huggingface.co/papers?q=harness%20evolution)能够使较小的模型以远低于前沿模型的成本,在特定领域任务上表现出色。由于框架和模型权重共同塑造了模型行为,我们探讨了如何将框架演进(https://huggingface.co/papers?q=harness%20evolution)与轻量级微调(https://huggingface.co/papers?q=fine-tuning)结合起来。在七个企业智能体任务中,我们首先用较弱的模型演进一个框架,然后发现更强的专家模型通常能更有效地使用它,这表明专家指导可能弥合剩余差距。然而,让较弱模型在演进后的框架下,模仿专家的完整运行轨迹进行训练,结果适得其反:在Qwen3-Coder和Gemma 4上,所有七个任务的性能都下降了4到30个百分点,尽管同样的方法在未经演进的框架下是有帮助的。我们的分析表明,模仿学习可以传递知识并增加脚手架的使用,但破坏了模型-框架适配度(https://huggingface.co/papers?q=model-harness%20fit):较弱模型采用了专家的规划策略,却缺乏执行该策略的能力,并且不再匹配围绕其原生规划风格演进出的框架。因此,我们开发了一套在线策略的专家修正流程,由一个元级别MLE智能体(https://huggingface.co/papers?q=meta-level%20MLE%20agent)自动化执行,该流程能定位较弱模型自身生成轨迹中的失败轮次,并请专家仅重写该轮次。这保留了模型的规划风格,并结合了框架演进(https://huggingface.co/papers?q=harness%20evolution)与模型适应的收益。我们的研究识别并解决了一个框架更新与权重更新之间的冲突源头,为特定领域企业任务的经济高效共同演进,提供了一个兼容性保留的方案。

查看arXiv页面 (https://arxiv.org/abs/2609.09134) 查看PDF (https://arxiv.org/pdf/2609.09134) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09134)

在你的智能体中获取这篇论文:

hf papers read 2609\.09134

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文 在模型的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文 在数据集的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。

引用此论文的Spaces0

没有Space链接此论文 在Space的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。

包含此论文的收藏0

没有收藏包含此论文 将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。