Agora:通过基于拍卖的任务分配增强LLM智能体推理
摘要
Agora引入了一种基于拍卖的任务分配机制,用于LLM智能体,将推理步骤视为可交易物品,并使用校准后的置信度将任务路由到最有能力的专家模型,从而在多个基准测试中提升推理性能。
arXiv:2607.09600v1 公告类型:新
摘要:增强大型语言模型(LLM)智能体的推理能力需要有效协调多种专家模型和工具。然而,现有框架通常基于任务与专家模型或工具功能的粗粒度匹配来调用API,而忽略了关键因素,如功能相似的替代方案之间的性能差异和成本效率。为了解决这个问题,我们提出了Agora,一个引入激励兼容拍卖机制的框架,用于动态分配任务给专家模型和工具。通过将推理步骤视为可交易物品,Agora使智能体能够基于其修正后的能力进行竞标——确保关键逻辑被路由到最有能力的求解器,而不是最过度自信的求解器。在五个基准测试上的评估表明,在可比的候选池下,Agora相较于匹配的单模型、路由和级联基线有所改进,同时通过单个拍卖参数展现可控的成本-质量权衡。
查看缓存全文
缓存时间: 2026/07/13 07:54
# Agora:通过基于拍卖的任务分配增强LLM代理推理能力 来源:https://arxiv.org/html/2607.09600 Kaiji Zhou 伯明翰大学 [email protected] Ales Leonardis 伯明翰大学 [email protected] Yue Feng 伯明翰大学 [email protected] ###### 摘要 增强大型语言模型(LLM)代理的推理能力需要有效协调多样化的专家模型和工具。然而,现有框架通常基于任务与专家模型或工具功能之间的粗粒度匹配来调用API,同时忽略了功能相似的替代方案之间性能差异和成本效率等关键因素。为了解决这个问题,我们提出了Agora,一个引入激励兼容拍卖机制的框架,用于动态地将任务分配给专家模型和工具。通过将推理步骤视为可交易物品,Agora使代理能够根据其修正的能力进行投标——确保关键逻辑被路由到最有能力的求解器,而不是最自信的求解器。在五个基准测试上的评估表明,在可比候选池下,Agora比匹配的单模型、路由和级联基线有所改进,同时通过单个拍卖参数提供了可控的成本-质量权衡。 # Agora:通过基于拍卖的任务分配增强LLM代理推理能力 Kaiji Zhou 伯明翰大学 [email protected] Ales Leonardis 伯明翰大学 [email protected] Yue Feng††感谢通讯作者。 伯明翰大学 [email protected] ## 1 引言 提升大型语言模型(LLM)的推理能力需要超越单一的执行方式。虽然思维链(CoT)策略(Wei等,2023 (https://arxiv.org/html/2607.09600#bib.bib9))通过将查询分解为原子步骤提供了结构蓝图,但执行这些复杂链通常超出任何单一通用模型的可靠范围。一个关键瓶颈限制了当前的推理系统:任务难度与模型能力之间的不匹配。当前的范式通常默认采用静态分配,将所有步骤路由到固定代理,忽略了专门的“专家”模型在特定子问题(例如检索或代码执行)上往往能胜过通用巨头模型(Dubois等,2024 (https://arxiv.org/html/2607.09600#bib.bib11))。因此,我们需要一个能够进行动态能力发现的系统——将每个推理步骤路由到最适合解决它的代理。然而,实现这种细粒度编排面临两个障碍:结构对齐和可信估值。首先,粗粒度路由(在查询级别)未能利用规划器生成的子任务结构。其次,更关键的是,建立可靠的拍卖受到过度自信的困扰(Huang等,2025 (https://arxiv.org/html/2607.09600#bib.bib12))。代理经常幻觉出确定性,对错误答案声称高置信度。如果没有对代理真实成功概率的可靠度量,动态分配就有可能将关键逻辑节点分配给过度自信但能力不足的代理,导致推理链崩溃。 为了解决这些挑战,我们提出了Agora,一个通过激励兼容拍卖机制重新构建任务分配的框架。具体来说,Agora分为两个阶段:规划器将查询分解为原子单元,拍卖将这些单元视为可交易物品。代理通过提交基于其执行成本和校准后的置信度的“出价”来竞争解决这些单元。关键的是,通过采用分层校准策略——结合静态基线和在线适应——Agora过滤掉了幻觉出的确定性。这确保了拍卖由真实能力驱动,使系统能够自适应地“学会信任”每个具体步骤的正确专家。总之,我们的贡献如下: - **基于拍卖的推理框架**:我们提出了Agora,一个利用拍卖机制动态路由推理步骤的框架,使专门代理能够高效协作完成复杂任务。 - **能力驱动的校准**:我们引入了一种结合嵌入分箱和在线优化的策略来标准化置信度估计,确保分配基于可靠性而非幻觉出的确定性。 - **实证验证**:大量评估表明,Agora在文本、科学代码和多模态基准测试上改进了匹配池路由,同时使成本-质量行为直接可调。 参见说明图1:Agora基于拍卖的推理框架概述。给定一个复杂查询x x,规划器将其分解为一个依赖关系图,分组为任务单元。每个单元通过置信度校准拍卖动态分配给最优代理,该拍卖通过权衡已验证的能力与执行成本来过滤掉幻觉出的确定性。最后,单元输出被综合为最终答案Y Y。 ## 2 相关工作 ### 2.1 模型选择与专门推理 增强推理能力依赖于协调多样化的专业知识。通用模型的高昂成本推动了对*动态模型选择*的研究,以高效获取专门能力。早期的启发式*级联*方法,如FrugalGPT,顺序查询模型以降低成本,但存在串行延迟问题(Chen等,2023 (https://arxiv.org/html/2607.09600#bib.bib4))。为了解决这个问题,近期工作采用学习型*路由器*。监督分类器如HybridLLM(Ding等,2024 (https://arxiv.org/html/2607.09600#bib.bib3))和Adaptive-Solver(Zhou等,2024 (https://arxiv.org/html/2607.09600#bib.bib1))在预算下优化准确性。先进方法利用上下文强盗(RouteLLM(Ong等,2025 (https://arxiv.org/html/2607.09600#bib.bib15)))或结构建模(MetaLLM(Nguyen等,2025b (https://arxiv.org/html/2607.09600#bib.bib16)))来适应查询复杂度。在此基础上,TensorOpera Router通过将查询投影到学习到的潜在空间以将输入映射到专家,实现了显著的通量提升(Stripelis等,2024 (https://arxiv.org/html/2607.09600#bib.bib24))。 并行研究朝着更细的粒度发展。诸如Confidence-Token路由(Chuang等,2025 (https://arxiv.org/html/2607.09600#bib.bib17))和Mixture-of-Depths(MoD)(Raposo等,2024 (https://arxiv.org/html/2607.09600#bib.bib25))等技术通过跳过不必要的操作,在*token*级别优化计算。与系统级路由并行,架构级*混合专家(MoE)*方法因扩展模型容量而备受关注。诸如Switch Transformers(Fedus等,2022 (https://arxiv.org/html/2607.09600#bib.bib31))和Mixtral(Jiang等,2024 (https://arxiv.org/html/2607.09600#bib.bib32))等架构将token路由到特定的内部专家层以优化计算效率。最近的创新如DeepSeek-MoE(Dai等,2024 (https://arxiv.org/html/2607.09600#bib.bib33))通过采用细粒度专家分割进一步改进了这一点。然而,尽管这些方法共享专门化的理念,它们需要端到端的预训练。相比之下,我们的框架专注于*基于拍卖的编排*,使多样化的代理(例如专有规划器与开放权重执行器的组合)能够在推理任务上无需架构修改即可协作。 关键的是,现有系统在极端上运行:要么路由*整个查询*(粗粒度),要么路由单个*token*(细粒度)。它们缺乏将复杂问题分解为不同*子任务*的语义粒度。我们的框架通过拍卖任务单元来填补这一空白,确保每个逻辑步骤都被路由到最优专家。 ### 2.2 用于可靠估值的校准 在基于拍卖的系统中,可靠路由依赖于准确的自我估值。早期的“要求校准”方法提示模型口头表达确定性(Tian等,2023 (https://arxiv.org/html/2607.09600#bib.bib18)),后续研究通过提示策略和聚合进行了优化(Xiong等,2024 (https://arxiv.org/html/2607.09600#bib.bib19); Yang等,2024 (https://arxiv.org/html/2607.09600#bib.bib20))。事后方法如QA-Calibration通过基于嵌入的分组提高了可靠性(Manggala等,2025 (https://arxiv.org/html/2607.09600#bib.bib14)),但它们通常依赖于静态校准集。 近期进展利用连续语义空间实现更高精度。核语言熵(KLE)通过语义相似性核计算不确定性(Nikitin等,2024 (https://arxiv.org/html/2607.09600#bib.bib26)),而语义最近邻熵(SNNE)通过聚合成对相似性来处理长文本生成(Nguyen等,2025a (https://arxiv.org/html/2607.09600#bib.bib27))。与先前的静态方法不同,我们的框架将这些连续度量纳入一个*在线*优化循环中。这使得代理能够动态修正其“出价”,有效过滤掉幻觉出的确定性,以维护市场公平。 ### 2.3 机制驱动的推理 将复杂问题分解为步骤对于推理至关重要,例如思维链(Wei等,2023 (https://arxiv.org/html/2607.09600#bib.bib9))和从少到多提示(Zhou等,2023 (https://arxiv.org/html/2607.09600#bib.bib10))。为了放宽单一模型的限制,多代理框架如HuggingGPT(Shen等,2023 (https://arxiv.org/html/2607.09600#bib.bib21))、Chameleon(Lu等,2023 (https://arxiv.org/html/2607.09600#bib.bib22))和Gradientsys(Song等,2025 (https://arxiv.org/html/2607.09600#bib.bib23))将子任务分派给多样化的专家。近期的编排工作进一步研究了自适应集中控制器,包括强化学习演化的编排器(Dang等,2025 (https://arxiv.org/html/2607.09600#bib.bib35))、零监督推理时MAS设计(Ke等,2025 (https://arxiv.org/html/2607.09600#bib.bib36))以及整体函数调用编排(Ke等,2026 (https://arxiv.org/html/2607.09600#bib.bib37))。这些方法优化了多代理协作的结构或顺序,而Agora则专注于一个互补的机制设计层:给定一个规划器和一个候选池,它通过校准能力减去成本来分配每个任务单元,不需要端到端训练或访问专有代理的内部。因此,Agora不是一个计划与分配共同训练的联合优化群体;它是一个即插即用的分配层,可以置于此类规划器或代理系统之上。 为了将协作推理建立在经济学原理之上,我们借鉴了*机制设计*。Duetting等人证明了激励兼容拍卖可以使LLM代理与全局系统目标对齐(Duetting等,2024 (https://arxiv.org/html/2607.09600#bib.bib28))。我们将这一保证应用于资源分配:通过将子任务视为可拍卖物品,我们将多代理分解与拍卖理论最优性结合起来。这一视角也与将LLM作为理性代理的研究相关。近期研究表明,代理辩论可以通过模拟社会动态来改善推理(Du等,2023 (https://arxiv.org/html/2607.09600#bib.bib29))。博弈论分析进一步发现,LLM可以在讨价还价等博弈中理性行动(Fan等,2023 (https://arxiv.org/html/2607.09600#bib.bib30)),支持它们在我们的设定中作为投标者。 ## 3 方法论 我们的框架遵循一个闭环流水线:*规划* → *校准* → *拍卖* → *执行* → *优化*(见图1 (https://arxiv.org/html/2607.09600#S1.F1))。给定用户请求x x,规划模块将其分解为一个原子任务单元的有向图。在校准阶段,潜在代理使用嵌套机制估计其成功概率:一个预训练的校准器S S用于基础准确率,以及一个动态事后校准器S′ S^\{\prime\}用于适应分布偏移。关键的是,这确保后续拍卖由经过验证的能力驱动,而非原始的、通常幻觉出的确定性。拍卖模块通过最大化最终校准置信度的效用函数来分配资源。选定的代理执行子任务,一个合成器生成*最终答案*。最后,优化模块通过使用评估器生成反馈来闭环,持续更新S′ S^\{\prime\}参数,以减少随时间的校准误差。 ### 3.1 任务规划与单元提取 LLM规划器(f 1 f_1)首先解释输入x x以生成一个有向任务图G = ( V , E ) G=(V,E),其中节点代表具有定义技能要求和数据依赖关系的原子步骤(提示详见附录A (https://arxiv.org/html/2607.09600#A1))。随后,任务单元提取器通过将紧密耦合的节点合并为更粗粒度的可执行*任务单元* T T来优化该图。候选组通过耦合信号识别——特别是共享的输入/输出、提示相似性或显式控制依赖关系。为确保可行性,仅当满足决策门时合并才最终确定:(i) 结果单元必须被代理能力支持,(ii) 在图中保持结构有效性。 ### 3.2 置信度校准 我们定义代理a j a_j在任务t i t_i上的校准置信度p ^ i j \hat{p}_{ij},使用静态和动态变换的分层组合。 ##### 静态校准(S S)。为了减轻内在的模型过度自信并确保跨不同领域的泛化,我们采用一个在*广泛语料*(包含多种公共基准测试,包括数学、编程和多模态数据集;细节见附录C (https://arxiv.org/html/2607.09600#A3))上训练的静态校准器S S。S S不是拟合单一的全局缩放器,而是应用分组特定缩放后跟直方图分箱: p ^ 0 = S ( p raw ) = S bin ( σ ( w g T ⋅ φ ( p raw ) + b g ) ) \hat{p}_0 = S(p_{\text{raw}}) = \mathcal{S}_{\text{bin}}\left(\sigma(\mathbf{w}_g^T \cdot \phi(p_{\text{raw}}) + b_g)\right) \quad (1) 其中p raw p_{\text{raw}}是原始置信度,参数( w g , b g ) (\mathbf{w}_g, b_g)特定于任务组g g,通过异构训练数据上的嵌入聚类(KD-树)确定。这使得系统即使对于未见过的任务类型,也能基于语义相似性检索适当的校准参数。 ##### 动态校准(S ′ S^\prime)。为了处理分布偏移(例如,静态语料中不存在的特定科学工作流),我们引入了一个在线动态校准器S ′ S^\prime。它通过时变变换优化静态估计p ^ 0 \hat{p}_0: p ^ final = S ′ ( p ^ 0 ; θ t ) = σ ( α t ⋅ logit ( p ^ 0 ) + β t ) \hat{p}_{\text{final}} = S^\prime(\hat{p}_0; \theta_t) = \sigma\left(\alpha_t \cdot \text{logit}(\hat{p}_0) + \beta_t\right) \quad (2) 参数θ t = { α t , β t } \theta_t = \{\alpha_t, \beta_t\}通过梯度下降在线更新,以最小化最近拍卖结果的负对数似然,持续适应测试时分布。 ### 3.3 拍卖与执行 ##### 出价构建。对于每个任务单元t i t_i和候选代理a j a_j,我们基于两个组件计算一个标量出价b i j b_{ij}。首先,我们对校准置信度p ^ i j \hat{p}_{ij}应用一个凹幂律变换: v ( p ^ i j ) = ( p ^ i j ) γ , with γ ∈ ( 0 , 1 ] . v(\hat{p}_{ij}) = (\hat{p}_{ij})^\gamma, \text{ with } \gamma \in (0,1].
相似文章
自适应潜在智能体推理
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。
@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题
一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析
本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。