AMATA:面向知识密集型问答的自适应多智能体轨迹对齐框架

arXiv cs.CL 论文

摘要

提出AMATA,一种用于知识密集型问答的多智能体轨迹对齐框架,通过引入轨迹内偏好学习和智能体间依赖学习,提升事实依据和可解释性,在五个基准测试中优于基线方法。

arXiv:2605.17352v1 公告类型:新 摘要:尽管大型语言模型(LLM)取得了显著进展,但在知识密集型问答中生成事实一致的响应仍然具有挑战性。这些困难主要源于幻觉以及LLM在弥补长尾知识缺口方面的局限性。为解决这一问题,我们提出AMATA,一种自适应多智能体轨迹对齐框架,它动态整合外部知识以提升响应的可解释性和事实依据。我们的架构利用六个专门智能体,协作执行结构化动作以进行复杂问题推理。我们将多智能体与外部工具的协作形式化为轨迹偏好对齐问题,融入了问题感知的智能体定制和智能体间偏好协调。AMATA引入两项主要创新:(1)轨迹内偏好学习,学习面向目标的偏好以优先处理关键智能体;(2)智能体间依赖学习,通过一种新颖的依赖感知直接偏好优化技术捕获跨智能体的工具依赖关系。实验结果表明,AMATA在五个既定的知识密集型QA基准上始终优于基线方法、知识增强框架和基于LLM的轨迹系统。进一步分析展示了我们的方法在减少令牌消耗方面的效率。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:39

# AMATA:面向知识密集型问答的自适应多智能体轨迹对齐  
来源:https://arxiv.org/html/2605.17352  

陶林张¹,董阳李²,晨陈⁴,秋洲陈³,九恒万¹,晓峰何³,程宇王⁵,日昌洪¹†  
¹合肥工业大学计算机科学与信息工程学院  
²上海电力大学  
³华东师范大学  
⁴广东财经大学  
⁵阿里巴巴集团  
[email protected], [email protected]  

###### 摘要  

尽管大语言模型取得了显著进展,但在知识密集型问答中生成事实一致的回答仍然具有挑战性。这些困难主要源于幻觉以及大语言模型在填补长尾知识缺口方面的局限性。为解决这一问题,我们提出**AMATA**——一种自适应多智能体轨迹对齐框架,该框架动态整合外部知识以提升回答的可解释性和事实基础。我们的架构利用六个专用智能体协同执行结构化动作,用于复杂问题推理。我们将多智能体与外部工具的协作形式化为轨迹偏好对齐问题,融合了问题感知的智能体定制和智能体间偏好和谐化。AMATA引入两大核心创新:(1) **轨迹内偏好学习**,学习面向目标的偏好以优先处理关键智能体;(2) **智能体间依赖学习**,通过一种新颖的依赖感知直接偏好优化技术捕获跨智能体的工具依赖关系。实验结果表明,**AMATA**在五个已建立的知识密集型问答基准上持续优于基线方法、知识增强框架及基于LLM的轨迹系统。进一步分析证明了我们的方法在减少令牌消耗方面的效率。  

## 1 引言  

大语言模型作为现代NLP基础设施的支柱(Hu et al., 2024),但面临持续存在的可靠性挑战。其中最主要的是表面看似合理的幻觉(Woo et al., 2025)以及其他不良行为(Yang et al., 2025)。检索增强生成提供了一种缓解策略,使大语言模型在推理过程中能够从外部知识源动态检索最新信息(Rubin et al., 2022;Xu et al., 2024b)。然而,RAG自身也存在缺点,例如检索不准确(Zhu et al., 2024)以及因上下文变长而导致的推理延迟增加(Zou et al., 2024)。因此,研究越来越多地转向多智能体系统,利用多样化的工具和协作反思机制来增强任务鲁棒性(Xu et al., 2024a;Yue et al., 2025)。  

<figure>  
<figcaption>图1:用于知识密集型问答的多智能体范式比较。*模块化训练*和*端到端训练*分别侧重于局部智能体推理和全局联合适应,而*全局-局部训练*范式则结合了两者的优势。我们的*AMATA*框架动态学习问题与LLM智能体之间的轨迹内关系,并在智能体整体中建立智能体间依赖关系。</figcaption>  
</figure>  

以往用于知识密集型问答的多智能体方法大致可分为三种范式:*模块化训练*、*端到端训练*和*全局-局部训练*。  
(1) **模块化训练**针对各个智能体的子任务能力,在定制化数据集上微调独立智能体(Long et al., 2023;Koopman et al., 2024)。这些局部优化的智能体随后通过静态工作流手动集成,执行序列和交接流程被严格定义。缺乏全局优化会导致错误传播和整体性能下降,因为局部最优的智能体无法补偿智能体间依赖或系统级动态。  
(2) **端到端训练**采用统一优化策略,在单一框架内使用任务级监督联合训练所有智能体(Zong et al., 2024;Klisura et al., 2025)。虽然反向传播在智能体整体中更新参数,实现了联合适应和隐式协调,但统一的梯度更新掩盖了异构智能体不同的专门化需求。负责不同子任务的智能体(Khot et al., 2023;Yue et al., 2024)需要个性化的学习信号;参数共享可能导致过度同质化,从而削弱专业能力。  
(3) **全局-局部训练**采用两阶段过程:首先独立优化智能体以掌握子任务,然后联合微调以对齐全局行为(Yue et al., 2025)。尽管该策略结合了局部专门化与全局协调,但通常无法捕获动态的智能体间依赖关系,而这对于处理多样化的知识密集型任务至关重要(Zhang et al., 2025a, b)。如图1所示,对于高置信度的问题,在前五个智能体之后添加“验证器”智能体可能是不必要的。此外,三个知识智能体(“检索器”、“过滤器”和“定位器”)表现出强相互依赖关系;当“检索器”被触发时,其他两个智能体的后续动作也必须执行。  

本文中,我们提出**自适应多智能体轨迹对齐**(*AMATA*),这是一个旨在改进智能体级别对齐并捕获动态智能体间依赖关系的框架。AMATA 在保持高推理性能的同时,显著降低了推理过程中的令牌开销。我们的主要贡献总结如下:  

**轨迹内偏好学习。** 现有方法通常将所有智能体在整个推理过程中视为同等相关。相反,我们的方法为每个问题动态优化智能体参与度,学习问题特定的智能体偏好分布,根据当前输入对各智能体的效用自适应地调节其影响力。对于每个智能体-问题对,我们分配一个偏好分数(例如,*<* 与 *>*),与智能体描述拼接作为前缀,并与问题配对用于微调对应智能体。  

**智能体间依赖学习。** 多智能体系统表现出上下文相关的智能体间依赖关系,触发关键智能体需要协调执行功能相关的智能体,同时允许有条件地抑制无关智能体(Ji and Gao, 2024;Gao et al., 2025)。我们引入依赖感知直接偏好优化模块,学习上下文敏感的执行排序。具体来说,对于每个问题,我们构建显式编码智能体间依赖关系的偏好样本,并为每条轨迹标注一个反映多智能体序列全局最优性的联合偏好分数。这些分数在采样轨迹上诱导出依赖感知的排序,优先选择具有稳健智能体间协调的轨迹用于DA-DPO训练。该机制使大语言模型能够以高可靠性推断最优的多智能体执行序列。  

我们在五个基准上对**AMATA**与竞争性基线进行比较评估:HealthQA(Akhtar et al., 2022)、ARC-Choice(Clark et al., 2018)、PopQA(Mallen et al., 2022)、SQuAD 1.1(Rajpurkar et al., 2016)和ASQA(Gao et al., 2023)。我们的框架在所有任务上实现了平均+4.02%的性能提升,并将令牌消耗开销相较于强基线降低了约70%。  

## 2 相关工作  

**多智能体轨迹学习。** 多智能体轨迹学习是指编排多个智能体协同解决复杂任务的过程(Li, 2025)。现有文献可分为三大范式:  
(1) **模块化训练**(Long et al., 2023;Koopman et al., 2024)独立训练智能体以完成其子任务。由于缺乏系统级协调,这常导致全局性能次优。偏好学习已被引入以改善单个智能体层面的不良决策(Song et al., 2024;Xiong et al., 2024),但整体集成仍是难题。  
(2) **端到端训练**(Zong et al., 2024;Klisura et al., 2025)使用由教师大语言模型(例如 FireAct (Chen et al., 2023)、AgentTuning (Zeng et al., 2024))提供的专家轨迹导出的统一损失函数,联合优化所有智能体。其他方法如 MapGPT(Chen et al., 2024)和 LLM-A∗(Meng et al., 2024)侧重于为智能体提供环境的全局视图。尽管改进了协调,这些方法可能掩盖专门化智能体的贡献,可能阻碍个体专长与系统级协作之间的平衡(Zhang et al., 2025b)。  
(3) **全局-局部训练**结合了全局上下文和局部自适应信号以增强智能体专门化。例如,CoAct(Hou et al., 2024)模仿了大语言模型中的分层人类规划,而 SMART(Yue et al., 2025)利用多粒度轨迹进行智能体控制和系统协同。这些框架向智能体优化注入全局和局部信号,旨在保留广泛的任务对齐和智能体级区分(Subramonian et al., 2023)。然而,这些方法往往忽略智能体间依赖关系。  

**LLM的知识增强。** 大语言模型容易产生幻觉,且由于其参数化性质,对长尾知识的覆盖不足(Ji et al., 2023;Li et al., 2024;Huang et al., 2025)。为确保事实准确性,大语言模型常常依赖外部来源。RAG 整合非参数化资源以提升事实可靠性并丰富 LLM 输出(Fan et al., 2024;Singh et al., 2025)。该领域的进展包括使用密集检索器的更好检索机制(Karpukhin et al., 2020;Ye et al., 2024)和改进的信息整合(Zhang et al., 2024;Wang et al., 2025b;Cheng et al., 2025)。例如,Self-RAG(Asai et al., 2024)引入了反思令牌,用于在推理过程中评估检索和回答质量。然而,这些 RAG 技术通常在单智能体范式内运行,以顺序流水线方式执行检索和生成(Singh et al., 2025),因此未能利用多智能体 LLM 框架的新兴能力和协作推理潜力(Qian et al., 2025)。相比之下,**AMATA** 设计用于多智能体环境下的知识密集型 QA 任务。  

## 3 方法论  

| 智能体 | 头部 | 结束符 | 意图 |
|---------|------|--------|------|
| 问题重建器 | \(\mathcal{A}_\text{IR}\) | ⟨Reconstructor⟩ | ⟨/eoi⟩ |
| 知识检索器 | \(\mathcal{A}_\text{KR}\) | ⟨Retriever⟩ | ⟨/eor⟩ |
| 知识过滤器 | \(\mathcal{A}_\text{KF}\) | ⟨Filter⟩ | ⟨/eof⟩ |
| 知识定位器 | \(\mathcal{A}_\text{KL}\) | ⟨Locator⟩ | ⟨/eol⟩ |
| 回答生成器 | \(\mathcal{A}_\text{RG}\) | ⟨Generator⟩ | ⟨/eog⟩ |
| 答案验证器 | \(\mathcal{A}_\text{AV}\) | ⟨Verifier⟩ | ⟨/eov⟩ |

表1:轨迹中使用的智能体和特殊令牌。详细的智能体描述和轨迹数据收集过程见附录A.1和A.4。  

<figure>  
<figcaption>图2:*AMATA*与标准SFT和DPO流程的比较。*AMATA*通过自适应前缀评分(左)和DA-DPO(右)优化轨迹内偏好和智能体间依赖关系。</figcaption>  
</figure>  

### 3.1 任务形式化与基本符号  

图2展示了*AMATA*的整体架构。给定一个问题\(\mathcal{Q}\),我们设计一个工作流,利用基于LLM的多智能体系统生成答案\(\mathcal{Y}\),其中\(\mathcal{Y} = \mathcal{F}(\mathcal{Q}, \mathbf{A})\)。这里\(\mathcal{F}\)表示整个由可学习权重参数化的系统,\(\mathbf{A}\)是智能体集合,例如*AMATA*中的六个智能体(见表1)。在此框架中,每个智能体\(\mathcal{A} \in \mathbf{A}\)接收当前状态并产生三个输出:响应\(y_i\)、一个特殊结束令牌\(e_i\)和一个用于下一智能体的特殊头部令牌\(h_{i+1}\),表示为:\(y_i, e_i, h_{i+1} = \mathcal{A}(\mathcal{Q}, y_{i-1}, e_{i-1}, h_i)\),

相似文章

ACC:编译智能体轨迹以实现长上下文训练

arXiv cs.CL

ACC将多轮智能体轨迹转化为长上下文问答对,用于训练LLMs在无需额外标注的情况下进行长程推理,在MRCR和GraphWalks基准测试上取得了显著提升,同时保持通用能力。

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

TMAS:通过多智能体协同扩展测试时计算

Hugging Face Daily Papers

TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。

Multi-Agent Transactive Memory

arXiv cs.AI

提出了多智能体交易记忆(MATM)框架,用于在种群级别存储和检索智能体生成的轨迹,以提高任务性能并减少交互步骤,适用于ALFWorld和WebArena等交互环境。