Codebook Agent: LLM多代理系统的摊销拓扑设计

arXiv cs.AI 论文

摘要

Codebook Agent 引入了一种向量量化自编码器方法,用于设计LLM多代理系统的查询自适应通信拓扑,在多个基准测试上提高了准确性并减少了令牌消耗。

arXiv:2609.02264v1 公告类型:新 摘要:为LLM多代理系统调整每个查询的通信拓扑可以提高准确性和效率,但当前的设计者将其视为条件图生成:变分、自回归或扩散解码器在 $N \times N$ 邻接空间中搜索,一个在效用和结构成本(如边数)上训练的图网络代理对采样候选进行排名。我们认为这种表述与问题不匹配。经验上,通过奖励过滤的拓扑即使在码本容量从8增长到64时,也坍缩到大约六个不同的图;边数与测量的令牌消耗负相关(Pearson $r \approx -0.4$),因此稀疏化图会使推理更昂贵;并且在代理配置文件节点上的消息传递评分器在代理共享配置文件时是邻接不变的——这是已发布基准测试的默认配置——因此在该模式下无法对候选进行排名。这三个事实促使了Codebook Agent的产生:一个向量量化自编码器将成功的拓扑压缩为一个查询无关的16项码本;一个奖励加权MLP将查询嵌入映射到码的分布;一个读取扁平化邻接的MLP代理,在测量效用和每任务归一化令牌成本上回归,在单个批量前向传递中重新排名前几个解码候选。在测试时没有迭代搜索和消息传递,Codebook Agent是我们比较的所有六个基准测试中最准确的方法(平均84.6,对比最强先前设计的83.0),在2.4毫秒内生成拓扑,并使用了21.9%--33.2%更少的LLM令牌。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:04

# 码本智能体:面向LLM多智能体系统的摊销拓扑设计
来源:https://arxiv.org/html/2609.02264
Yubei Li,Eric Hanchen Jiang,Zhi Zhang,Dong Liu(合作者:Wenxiao Zhao,Levina Li,Kai-Wei Chang,Ying Nian Wu)

###### 摘要

针对每个查询调整LLM多智能体系统的通信拓扑能同时提升准确性和效率,但当前设计者将此视为条件图生成:一种变分、自回归或扩散解码器在N×N邻接空间中搜索,而基于效用和结构成本(如边数)训练的图网络代理则对采样候选进行排序。我们认为这种表述与问题本身并不匹配。实验表明,即使码本容量从8增至64,经奖励过滤后存活的拓扑也仅收敛至约六个不同的图;边数与实测令牌消耗呈负相关(皮尔逊相关系数r≈-0.4),因此稀疏化图反而使推理更昂贵;而当智能体共享配置文件时(这是已发布基准的默认配置),基于智能体配置文件节点的消息传递评分器对邻接结构保持不变——在这种情况下,它根本无法对候选进行排序。这三个事实促使了*码本智能体*的诞生:向量量化自编码器将成功的拓扑压缩为与查询无关的16条目码本;奖励加权MLP将查询嵌入映射至码本分布;一个MLP代理读取展平的邻接矩阵,并基于实测效用与每任务归一化令牌成本进行回归,在单次批量前向传播中对解码出的顶级候选重新排序。在测试时无迭代搜索、无消息传递的情况下,码本智能体在所有六个比较基准中达到了最高准确率(平均84.6,而此前最强设计者为83.0),在2.4毫秒内生成拓扑,并减少21.9%至33.2%的LLM令牌使用量。我们的代码在此可用:https://github.com/jinxiy1104/CodebookAgent 。

加州大学洛杉矶分校

参照图示图1:拓扑设计的三种范式。(上)固定拓扑用于每个查询:设计成本为零,但没有单一图能适用于所有任务。(中)查询条件生成器通过迭代循环适应图结构,每步采样并评分K个候选,通常使用基于效用和边数训练的代理。(下)码本智能体保留每查询适应性并移除循环:设计空间离线离散化为码本,查询嵌入选择编码,并在基于令牌的成本目标下通过单次批量代理调用返回最优解。## 1 引言

由LLM智能体构建的多智能体系统通过在通信拓扑上交换中间输出,解决推理、问答和编码任务。该拓扑不仅是记录机制:它决定了哪些智能体能查看哪些消息,准确性和令牌消耗都会随之变化。该领域因此从手工设计结构演进到学习结构,直至最近的*查询条件*生成器——为每个输入生成全新拓扑。

最新设计者共享一个自然但代价高昂的流程。变分、自回归或扩散解码器在N×N邻接空间中搜索;基于智能体配置文件节点的图网络随后使用效用头和结构成本头(通常是边数|E|)对候选进行排序。该流程看似合理——生成后评分——却暗中假设:有用的设计空间足够大,需要生成解码器;|E|能追踪推理成本;消息传递能区分两个拓扑。我们的测量否定了所有这三个假设。

图1概括了其后果。首先,有用的设计空间是简短列表,而非流形:解决任务的拓扑即使码本容量从8增至64,也仅归约为约六个不同的编码,且最佳固定拓扑与我们测量的每个生成拓扑相比,准确率差距保持在1.4个百分点内——因此,用于建模邻接的容量花在了问题不存在之处。其次,结构成本代理是反转的:边数与实测令牌的相关系数r≈-0.4,因为稀疏通信导致更长的补全,所以最小化|E|反而最大化了它原本旨在降低的成本。第三,在主导已发布基准的同构团队中,基于配置文件节点的消息传递评分器对邻接结构保持不变:每个候选获得相同分数,排序不存在,数百次引导扩散步骤再现一个常数。

如果问题是在实测成本下从几个图中选择,匹配的设计者不应该是另一个解码器。*码本智能体*因此将拓扑设计摊销为三个前馈组件:向量量化自编码器将成功拓扑索引至16个编码;奖励加权MLP将查询嵌入映射至这些编码的分布;以及一个MLP代理,它读取展平的邻接矩阵,并基于实测效用和每任务归一化令牌成本进行回归。测试时我们解码顶级编码,在一次批量代理调用中评分,并执行胜出者——耗时2.4毫秒,无采样循环,无消息传递。我们的贡献包括:

- ❶ 我们刻画拓扑设计而非假设其形式:奖励存活空间独立于模型容量收敛至约六个图;常见的结构成本代理相对于实测令牌是反转的;消息传递代理在同构团队上对拓扑结构盲目。
- ❷ 我们提出码本智能体,即这些事实所允许的最精简设计者:一个离散码本、一个奖励加权编码预测器,以及一次基于执行的代理批量调用,无迭代搜索,无消息传递。
- ❸ 在六个基准和两个LLM后端上,对比单智能体提示、多智能体协作及学习型拓扑设计者,码本智能体在表1的每个基准上均是最准确的方法,拓扑生成耗时2.4毫秒,令牌消耗减少21.9%–33.2%(表1和表2)。

## 2 相关工作

#### LLM智能体的通信拓扑。

早期框架通过手工固定拓扑。另一条优化路线:GPTSwarm通过策略梯度学习边分布,DyLAN动态选择智能体,基于搜索的系统离线探索智能体设计,剪枝方法稀疏化固定结构以节省令牌,而Optima则训练智能体以提高效率。最接近我们的是查询条件生成器。我们共享其问题陈述——每个查询一个拓扑——差异在于我们对此的假设:它们将邻接空间建模为需要生成并由图网络评分的东西,而我们证明这是一个可供选择并由实测成本评分的简短列表。

#### 图生成与离散潜变量。

深度图生成器主要是迭代的,无论是自回归还是基于分数,继承了采样成本——更快的采样器能降低但无法消除;存在用于小图的单次VAE解码器。我们需要在延迟约束下为每个查询生成一个小图,因此我们使用向量量化离散化输出空间,而非从连续过程中采样。VQGraph将局部结构标记化以改进GNN到MLP的蒸馏;我们借鉴其结构标记正则化器,但我们的代理没有需要蒸馏的教师:在同构团队上,消息传递教师对每个查询是常数,因此我们直接在实测奖励上训练MLP。

#### 多智能体推理的成本。

多智能体流水线增加LLM调用次数,而随着调用增长,收益递减或反转,许多观察到的失败归因于协调而非单智能体能力。成本感知模型选择解决了单次调用的情况。这些结果促使我们将实测令牌而非结构代理作为拓扑设计的成本目标。

参照图示图2:码本智能体概述。*左:*离线收集在训练集上执行固定拓扑,并记录每个(查询,拓扑)对的(A, c, u, τ)。*中:*(1) VQ自编码器将成功的拓扑(u>0.5)压缩为与查询无关的码本;(2) MLP预测器pθ(k|c)拟合至公式(6)的奖励加权软目标;(3) MLP代理fφ基于实测效用和每任务归一化令牌成本进行回归(公式8–10),辅以仅在训练中使用的结构标记头。*右:*测试时解码顶级M个编码,去重后在一次批量代理调用中评分;最大化û-λĉ的候选(公式11)被执行。虚线箭头仅用于训练;实线箭头为冻结的测试时路径(拓扑生成内部无LLM调用)。

## 3 问题设置与背景

#### 拓扑设计。

一个由N个智能体组成的团队拥有配置文本p1,...,pN,通过冻结的句子编码器嵌入为xi=E(pi)∈ℝ^d(d=384)。拓扑是有向邻接矩阵A∈{0,1}^{N×N}(无自环),其中Aij=1表示智能体i的输出可见于智能体j,且决策节点按照GDesigner聚合最终答案。在查询q下以A执行团队返回效用u(A,q)∈{0,1}和令牌成本τ(A,q)。记查询嵌入c=E(q),目标是生成器将c映射至最大化R=u-λτ~的拓扑,其中τ~为归一化成本,λ=0.1。本文所有方法基于相同记录训练:每个基准,50个训练任务在6种固定拓扑(完全图、链、星形及三个Erdos-Renyi采样)下使用真实LLM智能体执行,得到300个元组(Aj, cj, uj, τj)。

#### 两个设计轴。

查询条件设计者由两个独立选择决定,我们在实验中分别变化它们。*轴A,候选生成器*,将c映射至一个或多个拓扑;当前主流是邻接空间上的迭代或连续解码器——变分、自回归,或带有T步和每步K个候选的扩散反向过程,我们测量其单个查询耗时301至396毫秒。*轴B,评分器*,对候选排序;当前主流选择(在学习型设计文献中共享)是基于节点携带配置文件嵌入xi、边为候选A的图上的消息传递网络:

fgnn(A,c) = h(pool(MPNN(A,{xi},c))) ∈ ℝ²,(1)

其中二维头回归至效用和结构成本标签,最常见的是边数|E|。我们将公式(1)实现为GAT,并将其视为轴B的一个层级,因此它可与其他一切保持不变地嵌入我们自己的流水线。引言中的三个观察——坍缩的设计空间、反转的成本代理,以及同构团队上的邻接盲消息传递——决定了我们在下文如何实例化两个轴。

## 4 方法

码本智能体将轴A实例化为带有查询条件先验的离散码本,将轴B实例化为基于展平邻接矩阵、基于实测效用和令牌成本训练的MLP。设D={(Aj, cj, uj, τj)}_{j=1}^{|D|}为

相似文章

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

CORVUS:基于底层同步的LLM编码代理上下文优化与缩减

arXiv cs.LG

CORVUS提出了一种新的轨迹架构用于LLM编码代理,通过维护相关文件的同步注册表,将文件读取操作与观察结果解耦,从而减少输入令牌9-50%,推理周期最多减少37%,同时在SWE-bench基准上保持相当的通过率。