AgentPatch:用于合并智能体多模态大语言模型的从粗到精弱任务修复

arXiv cs.AI 论文

摘要

介绍了AgentPatch,一种无需训练的从粗到精修复框架,用于合并智能体多模态大语言模型,解决了非对称能力保持和行为关键遗忘问题。

arXiv:2608.06699v1 公告类型:新 摘要:智能体多模态大语言模型(MLLMs)将多模态感知和推理与规划、工具使用以及动态环境中的交互相结合。然而,当前模型针对特定工具或环境进行了专门化,使得将其整合为单一通用模型变得复杂。我们提出了智能体多模态大语言模型合并(Agentic MLLM Merging)问题,并识别出两个挑战:非对称能力保持,即具有不同交互复杂度的能力被不均衡地保留,导致合并后产生弱任务;以及行为关键遗忘,即丢失关键决策行为可能破坏长期执行。我们提出了AgentPatch,一种无需训练的从粗到精修复框架。它选择一个稳定的合并主干,通过弱任务唯一残差恢复(Weak-Task Unique Residual Recovery)来恢复被稀释的弱任务特定信号,并应用智能体引导的行为关键补丁(Agent-Guided Behavior-Critical Patch),在显式能力保护下恢复关键决策行为。AgentPatch生成单个静态检查点,无需路由或集成。在六个智能体和多模态基准上的实验表明,AgentPatch改进了多种合并主干,缓解了弱任务退化,并在弱任务恢复与保留互补搜索和智能体视觉处理能力之间取得了更好的平衡。代码可在 https://github.com/ziboshao/AgentPatch 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/10 07:58

# AgentPatch:面向智能体多模态大语言模型合并的从粗到细弱任务修复

来源:https://arxiv.org/html/2608.06699

Zibo Shao1,2,3, Baochen Xiong1,2,3, Chengdong Xu4, Linhui Xiao2, Kaichen Li1,2,3, Haoran Gong2, Yan Li2, Yaguang Song2(通讯作者), Xiaoshan Yang1,2,3(通讯作者)

###### 摘要

智能体多模态大语言模型(MLLMs)通过规划、工具使用和动态环境中的交互,扩展了多模态感知与推理能力。然而,现有模型通常针对特定工具或环境进行专门化,这使得将它们整合为单一通用模型变得复杂。我们正式提出“智能体MLLM合并”(Agentic MLLM Merging)任务,并识别出两个挑战:非对称能力保持,即不同交互复杂度的能力被不均衡地保留,导致合并后出现弱任务;以及行为关键遗忘,即丢失决定性动作会使长程执行偏离轨道。我们提出了AgentPatch,一个无需训练的从粗到细修复框架。它首先选择一个稳定的合并主干,通过弱任务唯一残差恢复(Weak-Task Unique Residual Recovery)恢复被稀释的弱任务特定信号,并应用智能体引导的行为关键补丁(Agent-Guided Behavior-Critical Patch),在显式能力保护下恢复决定性行为。AgentPatch生成单个静态检查点,无需路由或集成。在六个智能体和多模态基准上的实验表明,AgentPatch改善了多种合并主干,缓解了弱任务退化,并更好地平衡了弱任务恢复与互补搜索和智能体视觉处理能力的保持。代码可在https://github.com/ziboshao/AgentPatch获取。

参见图(a) 弱任务退化。参见图(b) 行为关键退化。

**图1:** 智能体MLLM合并的两个挑战。(a) 开发子集上的结果表明,合并方法不均衡地保留异质能力,导致严重的弱任务退化。(b) 失去一个行为关键动作可能改变环境状态并引发轨迹级失败。

## 引言

智能体多模态大语言模型(MLLMs)正成为自主决策模型,整合多模态推理、外部工具调用和与动态环境的交互(Yao et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib9))。在视觉感知和跨模态推理的最新进展基础上(Liu et al. 2023 (https://arxiv.org/html/2608.06699#bib.bib1);Li et al. 2023 (https://arxiv.org/html/2608.06699#bib.bib2);Zhu et al. 2023 (https://arxiv.org/html/2608.06699#bib.bib3);Dai et al. 2023 (https://arxiv.org/html/2608.06699#bib.bib4);Li et al. 2024 (https://arxiv.org/html/2608.06699#bib.bib5);Wang et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib6);Bai et al. 2025a (https://arxiv.org/html/2608.06699#bib.bib7)),它们能够组织多步骤动作、在需要时调用工具,并根据环境反馈调整决策。这些能力使智能体MLLM能够处理涉及信息检索、计算机操作和细粒度视觉分析的复杂任务。

尽管潜力广泛,许多当前的智能体MLLM仍然针对特定能力或交互环境进行专门化。例如,搜索智能体专注于多模态信息检索和证据综合(Wu et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib10);Geng et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib11));GUI智能体将不断变化的屏幕观察转化为具体的动作和多步骤工作流(Ye et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib14);Qin et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib15));智能体视觉处理模型通过裁剪、缩放和图像操作等操作获取细粒度证据(Zheng et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib12);Zhang et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib13))。尽管这些专家在目标领域表现出色,但它们的能力往往难以迁移到具有不同动作空间、工具协议或轨迹分布的环境中(Feng et al. 2026 (https://arxiv.org/html/2608.06699#bib.bib35))。部署单独的专业检查点还会产生大量的存储、部署和系统维护开销。

模型合并(Model merging)(Garipov et al. 2018 (https://arxiv.org/html/2608.06699#bib.bib18);Draxler et al. 2018 (https://arxiv.org/html/2608.06699#bib.bib19);Wortsman et al. 2022 (https://arxiv.org/html/2608.06699#bib.bib20);Choshen et al. 2022 (https://arxiv.org/html/2608.06699#bib.bib21))提供了一种经济高效且模块化的方式来构建通用型智能体MLLM。通过组合具有兼容架构(通常源自相同基础模型)的专家检查点,模型合并能够将互补能力迁移到单个模型中,而无需额外的端到端训练。现有的MLLM合并研究主要集中于在固定输入-输出设置下组合静态多模态能力,包括视觉问答、光学字符识别、图表理解、视觉定位、多模态推理、模态扩展和跨模态对齐(Sung et al. 2023 (https://arxiv.org/html/2608.06699#bib.bib27);Chen et al. 2024 (https://arxiv.org/html/2608.06699#bib.bib28);Du et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib31);Wei et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib30);Shao et al. 2026 (https://arxiv.org/html/2608.06699#bib.bib34))。相比之下,智能体MLLM必须在异质观察、工具协议、动作空间和长程交互轨迹上运行,这使得它们的能力集成比静态多模态模型更具挑战性。在单个MLLM中合并此类交互能力仍未得到充分探索。因此,我们正式提出“智能体MLLM合并”(Agentic MLLM Merging)任务,旨在将针对不同工具和交互环境开发的专门化智能体MLLM合并为单个通用模型,同时在多样化的智能体任务上保持均衡性能。

智能体MLLM合并使两个挑战尤为突出。首先,异质智能体能力并非被平等保留。这些专家捕获不同交互复杂度和保留难度的任务,但全局平均和与任务无关的冲突消解标准并未明确考虑这种不对称性。因此,合并后的模型可能保留某些能力,同时大幅稀释另一种能力,产生我们称之为“弱任务退化”(weak-task degradation)的现象。如图1(a)所示,代表性方法(包括权重平均(Weight Averaging)(Wortsman et al. 2022 (https://arxiv.org/html/2608.06699#bib.bib20))、任务算术(Task Arithmetic)(Ilharco et al. 2022 (https://arxiv.org/html/2608.06699#bib.bib16))和TSVM(Gargiulo et al. 2025 (https://arxiv.org/html/2608.06699#bib.bib26)))不均衡地保留能力,最大的专家到合并差距出现在状态相关的多步交互上。其次,智能体的成功对轨迹敏感,并可能取决于单个行为关键决策。与静态预测不同,每个智能体动作都会改变后续观察,因此单个错误的检索、感知或交互决策都可能改变剩余轨迹的方向。在图1(b)中,两个模型都定位到了目标文件,但将专家的长按替换为点击会使合并模型陷入“打开方式”循环并阻止任务完成。我们将这种决定性模式的丢失称为“行为关键遗忘”(behavior-critical forgetting)。现有的合并方法主要优化参数级兼容性,而没有显式识别或保护决定轨迹成功的局部行为。

为了解决这些挑战,我们提出了AgentPatch,一个无需训练的从粗到细弱任务修复框架,用于智能体MLLM合并。AgentPatch首先执行稳定主干选择(Stable Backbone Selection),从候选的无训练合并中选择可靠的接收者。为了解决弱任务退化,我们引入了弱任务唯一残差恢复(Weak-Task Unique Residual Recovery),它识别弱任务专家特有的参数更新,并选择性地恢复合并期间被稀释的信号。将恢复限制在弱任务特定坐标上,可以在限制对互补能力干扰的同时提供广泛的参数级补偿。为了解决行为关键遗忘,我们进一步引入了智能体引导的行为关键补丁(Agent-Guided Behavior-Critical Patch)。它对比接收者和专家的轨迹,

相似文章

ANNEAL: 通过受控符号补丁学习适配LLM代理

arXiv cs.AI

介绍了ANNEAL,一种神经符号代理,能将重复性故障转化为过程知识图谱的受控符号编辑,无需修改模型权重,在测试环境中实现持久的结构修复并消除重复性故障。

当 Attribution Patching 存在偏差:诊断与二阶修正

arXiv cs.LG

本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。

Causal Episodic Memory for Feedback-Driven Agent Repair

arXiv cs.CL

This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.