UnitBoost:使用合并算子而非模型管理复合LLM系统
摘要
UnitBoost 引入合并算子来管理复合 LLM 系统,用一个定义的元级算子替代生成式管理器,以提高性能和透明度。
arXiv:2609.09815v1 公告类型:新
摘要:复合 LLM 系统通常通过添加更高层次的 LLM 来解决协调问题。由此产生的元代理读取工作者的输出,写出最终答案,分配后续调用,并决定何时停止。它富有表现力,但它也将三个控制决策集中在一个不透明、对顺序敏感的模型调用中。我们质疑管理器是否真的需要是生成式的。UnitBoost 用一个定义的元级算子替代了该模型:一个任务给定的单元映射将工作者输出转换为槽位值提议,一个受约束的 argmax 组装输出,而未填充或未支持的槽位成为下一轮的显式残差。该算子是顺序无关的,记录单元来源,并给出一个简单的保证:在没有耦合约束的情况下,在相同准入分数下的单元级最大化支配任何完整候选的选择。在三个保留基准测试中,它比使用黄金标签选择的最佳单一候选高出 0.060-0.195 个绝对任务分数点,比输入匹配的生成式管理器高出 0.048-0.076。仅替换管理步骤就改进了六个复合系统配置 0.013-0.182。残差导向轮次将 FanOutQA 单元 F1 从 0.4778 提高到 0.5524;匹配控制显示真正的残差优于随机目标和普通重读,而无标签供应信号在一轮无效轮次后标记耗尽。相同的分析测量了三种没有此类增益可用的情况(一个不可分割单元、不可用单元身份和一个对每个发射单元收费的端点),并将跨单元耦合量化为修复成本。管理器放弃了语义自由,获得了顺序不变性、单元来源和可测试的失败条件。
查看缓存全文
缓存时间: 2026/09/11 08:41
# 使用合并操作符而非模型管理复合LLM系统
来源:https://arxiv.org/html/2609.09815
## UnitBoost:使用合并操作符而非模型管理复合LLM系统
王光辉、崔燕伟、王梦迪、何培阳††thanks:通讯作者:peiyan@amazon\.com所属单位:AWS生成式AI创新中心
###### 摘要
复合LLM系统通常通过添加高层LLM来解决协调问题。由此产生的元智能体会读取工作者输出、编写最终答案、分配后续调用并决定何时停止。这种方法具有表达能力,但也将三个控制决策集中在一个不透明且对顺序敏感的模型调用中。我们探讨管理者是否必须具备生成能力。UnitBoost用一个定义的元层级操作符取代该模型:一个给定任务的单元映射将工作者输出转换为槽-值建议,一个受约束的argmax组装输出,而未填充或无支持的槽则成为下一轮显式残差。该操作符与顺序无关,记录单元来源,并给出简单保证:在没有耦合约束的情况下,相同准入分数下的单元最大化优于任何完整候选方案的选择。在三个保留基准测试上,它比使用黄金标签选择的最佳单个候选方案高出0.060–0.195绝对任务分数点,比输入匹配的生成式管理器高出0.048–0.076。仅替换管理步骤就改进了六个复合系统配置,提升0.013–0.182。残差导向轮次将FanOutQA单元F1从0.4778提高到0.5524;对照实验表明真实残差优于随机目标和普通重读,而无标签供应信号在一轮无效后标记耗尽。相同分析测量了三种无法获得此类收益的情况(一个不可分割单元、不可用单元身份以及对每个发射单元收费的端点),并将跨单元耦合量化为修复成本。管理者放弃语义自由度,获得顺序不变性、单元可追溯性和可测试的故障条件。
## 1引言
复合LLM系统通过协调多个模型调用来回答问题。其管理者有三项工作:将工作者的部分结果组装为单一输出、分配后续调用给剩余未解决部分,以及决定何时进一步工作不再有用。当前系统通常将这三项工作都委托给另一个语言模型。混合代理聚合器重写建议(Wang等人,2024);辩论报告模型介导的共识(Du等人,2023b);迭代细化要求模型诊断和修改自身答案(Madaan等人,2023)。语言模型程序的优化器改进提示和模块(Khattab等人,2023),但在推理时最终管理者通常仍是一个生成模型。
这个选择造成了一个可避免的控制问题。生成式管理者可能引入不支持的内容,对建议顺序做出反应,并隐藏工作者提供的答案部分来源。更根本的是,近期研究发现综合通常复制一个提议者,因此管理者表现得像一个选择器(Maryanskyy等人,2026),组合模型的价值受限于它们共同失败的问题(Chen,2026),而完整解决方案通信可能消除工作者多样性(Ann等人,2026)。更好的选择器仍然受限于它接收到的最佳候选方案。除非另一个模型成功重写,否则它无法返回“第一部分来自工作者A,第二部分来自工作者B”。
我们探讨这个管理者是否必须是一个生成式智能体。我们的答案是UnitBoost:一个确定的元层级操作符,管理输出的结构化部分而非完整输出。图1对比了两种控制接口。任务提供一个*单元映射*,将输出映射为建议$(s,v)$,其中$s$标识任务定义的单元,$v$是该单元的建议内容。对于多答案问题,归一化答案标识一个单元;对于表格,实体标识一个单元,其属性是值;对于类级代码,方法签名标识一个单元,其实施是值。该操作符对值进行局部评分,在每个槽位跨工作者选择,并对组装输出实施可行性谓词。其残差随后是字面意义:留空、不可行或未接受值的槽位成为下一轮的工作队列。
图1:相同元层级决策的两种设计。生成式管理者在一次不透明调用中拥有组装、分配和停止权。UnitBoost将这三个决策暴露为对持久单元表、命名残差和基于供应的停止进行的受约束argmax,并保留每个接受值背后的工作者和分数。这一改变使复合系统更易于推理。合并是集合操作,因此完全与顺序无关。每个接受的值都有来源、分数和可行性跟踪。在没有跨单元约束的情况下,每个单元最大值的总和至少等于每个候选方案总和的最大值,因此该操作符在结构上优于选择。对于多轮系统而言最重要的是,不同轮次的输出进入同一个持久单元表。后续工作者不需要重写现有内容;它只需要改进一个残差单元。
我们将管理者作为可替换的系统组件而非新的端到端智能体进行测试。智能体、提示、轮次、证据和调用次数保持不变,仅改变候选方案到输出的步骤。实验回答了四个问题:
1. 1\.定义的管理者能否突破约束候选方案选择的天花板?
2. 2\.它能否在不改变工作者的情况下改进现有复合协议?
3. 3\.它的残差是否比额外采样更好地分配后续调用?
4. 4\.哪些可观测属性预测管理者何时有帮助或何时失败?
前三个问题的答案是肯定的,有一个前提条件:任务必须暴露多个可识别的单元,且工作者对这些单元的覆盖不同。第四个问题同样重要:当输出只有一个单元、当等效单元无法识别、或当端点对每个发射单元收费时,管理者无能为力,而可行性修复会消耗剩余收益。每个边界都源自该操作符,并且是测量而非仅仅承认。
## 2相关工作
### 生成式管理。
多智能体框架暴露可编程的对话和角色结构(Wu等人,2023;Hong等人,2023),编排器在专业工作者之上规划和重新规划(Fourney等人,2024),验证器模型决定分解查询是否需要另一轮(Zhang等人,2026),元智能体可以发明智能体程序(Hu等人,2024)。在每种设计中,模型拥有组装、分配或停止权。UnitBoost询问在工作者拓扑存在后,这些决策中哪些仍需要模型自由度,并回答*模型应提议单元,而代码控制准入、分配和停止*。
### 组合及其天花板。
复合系统通过生成式聚合(Wang等人,2024;Jiang等人,2023)、辩论(Du等人,2023b)、自我反馈(Madaan等人,2023)或模块优化(Khattab等人,2023)进行组合,近期分析显示其局限性:候选方案选择是瓶颈(Maryanskyy等人,2026),共同失败限制了组合收益(Chen,2026),而交互消除有用多样性(Ann等人,2026)。跟踪级合成(Fadnavis等人,2026)和残差混合代理(Xie等人,2025)保持生成式组合器。最接近的确定先例是经典元搜索(Fox和Shaw,1994;Aslam和Montague,2001;Cormack等人,2009),它完全不用模型融合排序列表;这是UnitBoost的无验证器特例和此处的强大基线,但它不包含可行性谓词、无来源要求和无残差轮次。程序演化面临同样的选择:自由模型编辑(Novikov等人,2025)与基于模型的修复结构交叉(Sun和Shi,2026)。
## 3UnitBoost操作符
### 管理契约。
管理者不应仅通过其返回句子的质量来评估。它应暴露其接受的内容、每个单元获胜的原因、检查了哪些约束、下一个调用花在哪里以及循环为何停止。附录A表3陈述了生成式管理者和UnitBoost的相同四项职责。该提议并非使工作者确定性,而是将模型自由度排除在将建议连接为系统状态的控制接口之外。
### 接口。
令任务定义的单元由槽$s$索引,令$n$个候选输出$y_i$中的每一个通过单元映射$U$映射到零个或多个建议$(s,v)$。用$v_s^i$表示候选$i$在槽$s$的值,当其未提议值时使用$v_s^i=\bot$,令$V_s=\{\bot,v_s^1,\ldots,v_s^n\}$,因此留空一个槽始终是一个选项。令$q(s,v)\geq0$对值评分,其中$q(s,\bot)=0$,令$C$是赋值$\mathbf{v}=(v_s)_s$上的谓词,当组装输出可行时等于1。管理者返回
$\operatorname{merge}(y_1,\ldots,y_n)=\operatorname*{arg\,max}_{\mathbf{v}\,\in\,\prod_{s}V_{s}}\sum_{s}q(s,v_{s})\quad\text{subject to }C(\mathbf{v})=1$ (1)
规范的归一化值顺序打破平局,每个非空选择都来自工作者。如果$C$为空,则问题按槽分离,当$C$分解为不相交槽组上的约束时,它在每个组内分离。对于耦合代码单元,我们按分数顺序准入值,同时运行任务的可执行检查。在所有95个保留的ClassEval类中,穷举候选方法组合枚举确认该顺序达到乘积空间最优。该一致性是测量而非保证的,而在耦合密集处,同一接口接受每个槽值集乘积上的精确求解器,代价是枚举。
### 为何它能击败每个选择器。
当$C$为空时,
$\sum_{s}\max_{i}q(s,v_{s}^{i})\ \geq\ \max_{i}\sum_{s}q(s,v_{s}^{i})$ (2)
右侧是相同评分下的最佳完整候选方案。当单一候选在每个槽都达到最大值时,等式成立。因此有用内容不是不等式本身,而是其例外:只有当工作者在不同位置不完整时,管理者才获得收益。所报告测试平台的输出预算不会打破它:在$B$个值预算下,每个槽的前$B$个最大值得分至少与任何候选自身的最多$B$个值一样高。内容上的可行性谓词可能消耗收益,因此有效表述是*单元级收益减去修复成本*。我们测量两者而非假设任一。
### 三个评分层级。
我们保持准入分数$q$的来源明确;它对值进行排名,并非报告的任务端点。预言机层级使用参考标签,是上限,而非方法。可部署层级仅使用系统可用信号:工作者一致性、值在其工作者自身列表中的排名、检索段落是否包含它,以及系统生成和回答的检索支持检查。每个粗略信号桶仅从开发问题中获取其平滑的实证正确率。无验证器层级仅使用一致性,结合经典评分和排名融合规则CombSUM、CombMNZ、Borda和倒数排名融合(Fox和Shaw,1994;Aslam和Montague,2001;Cormack等人,2009)。
### 残差分配。
合并后,管理者形成残差$R_t$,即未填充、不可行或未持有接受正值的槽集合;我们将第三类槽称为*存疑*。轮次$t+1$中的工作者接收单元规格、接受值和局部失败信号,但从不接收另一个工作者的完整解决方案。新值插入同一表,并在方程1下与现有值竞争。相对于输出$z_{t-1}$,准入边际$\delta$使得已占用槽的新值仅在其分数至少为现有值分数加$\delta$时才有资格;为未填充槽提议的值保持资格。然后在现有值和合格值上求解argmax;在第一轮,所有提议值都有资格。称在轮次$t$中新槽的槽为新槽,令$\rho_t$为轮次$t$值落在新槽的份额;一旦$\rho_t$降至阈值$\tau$,循环停止。提升类比的每一项(Friedman,2001)随后都有所指:合并输出是集成,$R_t$是残差,工作者是弱学习器,单元最大化是加法,边际是收缩,残差耗尽是早停。与学习提升不同,不更新模型参数;改进的对象是复合系统的持久输出。算法1给出了完整的推理循环。
算法1 UnitBoost的推理循环。单元映射、分数、可行性谓词、准入边际和停止阈值在保留评估前固定。
1:工作者$\mathcal{W}$,单元映射$U$,分数$q$,谓词$C$,边际$\delta$,轮次$T$,阈值$\tau$
2:单元表$\mathcal{H}\leftarrow\varnothing$;输出$z_0\leftarrow\emptyset$;残差$R_0\leftarrow$整个任务请求
3:for $t=1,\ldots,T$ do
4:$Y_t\leftarrow\textsc{Query}(\mathcal{W},R_{t-1})$
5:for all $y\in Y_t$ do
6:从$U(y)$插入$(s,v,\text{worker},t)$到$\mathcal{H}$
7:endfor
8:$z_t\leftarrow\textsc{ConstrainedUnitArgmax}(\mathcal{H},q,C,z_{t-1},\delta)$
9:$R_t\leftarrow\{s:s$未填充、不可行或相似文章
CoMerge:基于冲突驱动的偏好优化方法用于多任务模型合并
CoMerge是一个基于冲突驱动的偏好优化框架,用于合并多任务LLMs,采用自监督策略来减轻参数干扰,并在如MergeBench等基准测试中实现高性能。
UnityMAS-O:一种基于LLM的多智能体系统的通用RL优化框架
UnityMAS-O 提出了一种针对基于LLM的多智能体系统的通用RL优化框架,将整个工作流视为优化单元,支持角色级别的信用分配和可配置的参数共享,在问答和代码生成任务上展现了显著的性能提升。
通过异构编辑重组克服LLM驱动程序优化中的最薄弱环节效应
介绍了HERO,一种基于LLM的程序优化器,通过生成并重组异构原子编辑来克服最薄弱环节效应,在算法、游戏、智能体及机器人等领域实现更快的收敛速度和更高的分数。
ACE:MoE大语言模型参数高效微调的跨专家适配器整合
ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。