协同演化辅助框架与模型:在线策略校正助力弱模型在模仿失败时追赶
摘要
本文提出一种在线策略专家校正流程,用于协同演化辅助框架与模型,使弱AI模型能通过纠正失败回合而非完全模仿来改进,保持兼容性并提升企业代理任务性能。
查看缓存全文
缓存时间: 2026/09/10 06:10
论文页面 - 共同演进框架与模型:当模仿学习失效时,在线策略修正如何帮助较弱模型迎头赶上
来源:https://huggingface.co/papers/2609.09134 作者:
,
,
,
,
,
,
,
,
,
,
摘要
将框架演进与局部专家修正相结合,能够在不破坏模型原生规划风格的前提下改进较弱模型。
智能体框架(https://huggingface.co/papers?q=Agent%20harness)(包括系统提示词、工具集、执行钩子以及围绕模型的上下文管理脚手架)是智能体任务成功的关键决定因素。自动化的框架演进(https://huggingface.co/papers?q=harness%20evolution)能够使较小的模型以远低于前沿模型的成本,在特定领域任务上表现出色。由于框架和模型权重共同塑造了模型行为,我们探讨了如何将框架演进(https://huggingface.co/papers?q=harness%20evolution)与轻量级微调(https://huggingface.co/papers?q=fine-tuning)结合起来。在七个企业智能体任务中,我们首先用较弱的模型演进一个框架,然后发现更强的专家模型通常能更有效地使用它,这表明专家指导可能弥合剩余差距。然而,让较弱模型在演进后的框架下,模仿专家的完整运行轨迹进行训练,结果适得其反:在Qwen3-Coder和Gemma 4上,所有七个任务的性能都下降了4到30个百分点,尽管同样的方法在未经演进的框架下是有帮助的。我们的分析表明,模仿学习可以传递知识并增加脚手架的使用,但破坏了模型-框架适配度(https://huggingface.co/papers?q=model-harness%20fit):较弱模型采用了专家的规划策略,却缺乏执行该策略的能力,并且不再匹配围绕其原生规划风格演进出的框架。因此,我们开发了一套在线策略的专家修正流程,由一个元级别MLE智能体(https://huggingface.co/papers?q=meta-level%20MLE%20agent)自动化执行,该流程能定位较弱模型自身生成轨迹中的失败轮次,并请专家仅重写该轮次。这保留了模型的规划风格,并结合了框架演进(https://huggingface.co/papers?q=harness%20evolution)与模型适应的收益。我们的研究识别并解决了一个框架更新与权重更新之间的冲突源头,为特定领域企业任务的经济高效共同演进,提供了一个兼容性保留的方案。
查看arXiv页面 (https://arxiv.org/abs/2609.09134) 查看PDF (https://arxiv.org/pdf/2609.09134) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09134)
在你的智能体中获取这篇论文:
hf papers read 2609\.09134
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文 在模型的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。
引用此论文的数据集0
没有数据集链接此论文 在数据集的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。
引用此论文的Spaces0
没有Space链接此论文 在Space的README.md中引用arxiv.org/abs/2609.09134以从本页链接它。
包含此论文的收藏0
没有收藏包含此论文 将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
Salesforce 发现了更好的方法来共同进化代理及其控制机制(9分钟阅读)
这项研究探讨了将框架进化与模型适应相结合用于AI代理,发现直接模仿专家会损害较弱模型的性能,并提出了一种基于策略的纠正方法,以在不破坏框架适应企业任务的情况下提高性能。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
HELIX:模型-工具链协同进化以实现递归自我改进
本文提出将模型-工具链协同进化作为AI代理递归自我改进的基本原则,并引入HELIX,一个可溯源的系统,通过生成验证轨迹的结构化训练信号来改进执行和学习。
测试时AI4AI:通过框架实现强到弱能力迁移
本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。
@dair_ai: 关于自进化代理框架的精彩论文。自进化代理框架有两个实际问题:1. 搜索很慢…
论文提出了 Ecdysis,一个用于训练LLM代理运行时框架的框架,它通过识别重复的失败模式来提高效率和准确性,实现了1.84倍更快的训练和18.56%更高的推理准确性。