Opti-Q:一种基于约束的多LLM问题规划优化框架
摘要
Opti-Q 是一个受数据库启发的优化器,用于多LLM问答,通过规划执行DAG,在成本、延迟和能量约束下优化答案质量,在基准测试中取得了显著改进。
arXiv:2607.22621v1 公告类型:新
摘要:虽然大型语言模型(LLM)能够实现强大的问答(QA)能力,但非确定性和异构资源概况(成本、延迟和能量)使得预算受限的部署变得复杂。我们提出了 OPTI-Q,一个受数据库启发的、基于成本的优化器,实现了多LLM编排的“先规划后执行”范式。OPTI-Q 将 LLM 调用建模为执行 DAG 中的物理算子,并针对每个问题搜索能够优化答案质量(QoA),同时在用户指定的资源约束下权衡财务成本、延迟和能量的计划。计划可以包括顺序算子(将中间答案作为上下文传递)和并行/混合算子(并发运行模型并合并其输出)。为了在不执行每个候选计划的情况下搜索该空间,OPTI-Q 使用 PERFDB(一个从基准测试和执行轨迹中填充和刷新的统计目录)来估计单个算子和组合子计划的 QoA 和资源成本。利用这些估计,OPTI-Q 执行帕累托前沿搜索,并根据用户偏好选择最终计划。在用户指定预算下的 MMLU-Pro 和 SimpleQA 上,OPTI-Q 在相似成本下将平均 QoA 比基线提高了约 58% 和约 41%,表明数据库风格的规划为多LLM问答提供了更好的质量-资源权衡。
查看缓存全文
缓存时间: 2026/07/28 06:26
# Opti-Q:一种基于约束的多LLM问题规划优化框架
来源:https://arxiv.org/html/2607.22621
Aamir Hamid¹, Bharg Barot¹, Satvik Racharla¹, Tim Finin¹, Primal Pappachan², 以及 Roberto Yus¹
¹马里兰大学巴尔的摩县分校,美国。²波特兰州立大学,美国。
\{ahamid2, bhargvb1, yv04378, finin, ryus\}@umbc.edu, [email protected]
###### 摘要
虽然大型语言模型(LLM)实现了强大的问答(QA)能力,但受限于非确定性和异构资源概况(成本、延迟和能耗),预算化部署变得复杂。我们提出 **Opti-Q**,一个受数据库启发的基于成本的优化器,实现了多LLM编排的“先规划后执行”范式。**Opti-Q** 将LLM调用建模为执行DAG中的物理算子,针对每个问题搜索在用户指定资源约束下平衡财务成本、延迟和能耗的同时优化答案质量(QoA)的计划。计划可以包括将中间答案作为上下文传递的序列算子,以及并行运行模型并合并其输出的并行/混合算子。为了在不执行每个候选计划的情况下搜索该空间,**Opti-Q** 使用 **PerfDB** —— 一个通过基准测试和执行轨迹填充并刷新的统计目录,来估计单个算子和组合子计划的QoA和资源成本。利用这些估计,**Opti-Q** 进行帕累托前沿搜索,并根据用户偏好选择最终计划。在MMLU-Pro和SimpleQA上,在用户指定预算下,**Opti-Q** 在可比成本下将平均QoA相比基线提高了≈58%和≈41%,表明数据库风格的规划能为多LLM问答实现更好的质量-资源权衡。
## I. 引言
大型语言模型(LLM),如GPT-5\[1\]、Llama 3\[2\]和DeepSeek-R1\[3\],已改变了自然语言处理(NLP)\[4\],推动了问答(QA)\[5\]、文本摘要\[6\]和领域特定推理\[7\]的进步。它们的成功推动了各行业的采用,从客服到医疗\[8,9\]。然而,由于非确定性导致的幻觉\[10\]、高计算成本\[11\]、大量能耗\[12\]和延迟权衡\[13\],现实部署仍然具有挑战性。大量工作集中在这些问题上,包括通过高级提示策略(如思维链提示)或大量微调来提高准确性和可靠性\[14\]。然而,一个根本挑战仍然存在:不同LLM在不同问题/任务类型上的表现存在差异\[15\]。此外,最新证据表明,单一高能力LLM并非总是最优;协调的多LLM协作可以在实际任务上超越单个“最佳”模型\[16\]。受机器学习(ML)集成方法\[17\]启发,近期工作探索组合多个LLM以提高可靠性和答案质量\[18,19\],因为跨模型验证有助于缓解幻觉并提升响应质量\[20\]。然而,朴素的执行策略(例如,总是查询所有模型并混合\[21\]其输出,或总是选择固定的“强”模型子集)引入了新的挑战:更高的财务成本和延迟、低效的资源使用,有时甚至答案质量更低。此外,尽管许多系统依赖动态序列编排——后续模型的选择取决于先前模型的输出(例如,通过LangChain风格的链)\[22\]或运行时成本/吞吐量优化\[23\]——但这些决策在未规划下游后果时可能是短视的。例如,在我们的实验中,一个历史问题最好由使用Gemma-3:27B、Qwen-2.5:14B和Phi-4:14B的计划回答(比其他计划高出1.24到1.48倍),而一个体育问题则最好由Gemma-3:27B和Qwen-2.5:14B的简单并行执行解决。这些变化表明,最佳的模型组合和执行策略依赖于具体问题。因此,一个稳健的多LLM问答系统必须针对每个问题动态确定最佳执行计划,同时考虑端到端的成本、延迟、能耗和质量。
数据库系统面临类似问题:相同的声明式查询可以通过许多替代物理计划执行,优化器在执行前使用成本模型和统计数据选择计划\[24\]。在多LLM问答中,针对一个用户问题可能存在许多替代工作流,每个在货币成本、延迟、能耗和答案质量上存在权衡。因此,我们将多LLM编排视为一个基于成本(多目标)的查询规划问题,其中问题作为查询,每个LLM调用是一个物理算子,端到端工作流是一个物理计划,其选择由一个历史性能统计的模型“目录”指导。与经典查询优化不同,多LLM规划必须考虑随机和语义性的算子输出(质量不确定且非单调)、输出相关的下游成本(例如,令牌长度和内容会放大后续延迟/成本/能耗),以及固有的多维度目标(质量-成本-延迟-能耗),并受用户约束。这需要新的成本估计模型和多目标计划选择,超越了传统的单指标成本最小化。
为应对这些挑战,我们引入 **Opti-Q**,一个用于多LLM问答的基于成本优化器,它在发出任何模型调用*之前*选择执行计划,类似于DBMS优化器在执行前选择物理查询计划。如图1所示,**Opti-Q** 生成的计划涉及并行和序列多LLM操作的组合。为了在候选计划中进行选择,我们提出一种技术,在执行前从历史性能统计中估计计划的成本(财务、延迟、能耗)和收益(答案质量),这些统计涉及LLM及其在各类问题上的组合。利用这些估计,**Opti-Q** 通过多目标优化(MOO)在可选用户约束下识别代表竞争目标之间最优权衡的计划。考虑到潜在庞大的计划空间(取决于所考虑的LLM数量和计划结构的复杂性),**Opti-Q** 采用“可插拔优化引擎”,支持多种规划策略,包括动态规划(DP)、爬山算法和非支配排序遗传算法(NSGA-II)来探索候选计划并选择执行。这使得 **Opti-Q** 能够在提交昂贵的LLM调用之前动态平衡性能和资源效率。
本工作的主要贡献包括:
- 多LLM问答规划的成本/收益形式化,以在预算和资源约束下选择工作流。
- 一个统计驱动的优化器,枚举和剪枝序列/并行/混合工作流,并在执行前估计质量和资源成本。
- 一个集成优化器与执行引擎的系统,用于跨开源LLM的实时路由。
我们使用两个问答基准(一个开放式、一个多项选择)评估我们的方法,并与四个最先进的基线进行比较。在两者中,**Opti-Q** 实现了优异的QoA-成本效率,相比最强的预算感知基线,在匹配的每个问题成本(预算水平b=3)下,平均QoA分别提高了≈58%和≈41%。我们进一步分析了LLM多样性、计划复杂性和预算水平对 **Opti-Q** 发现的权衡的影响。
## II. 相关工作
近期数据管理与LLM交叉领域的工作涵盖了大致两个正交方向。第一个方向研究LLM如何辅助数据库查询优化(例如,改进基数估计\[25\]、成本建模\[26\]或物理算子选择\[27\])。该主题侧重于结构化数据上的数据库查询优化,这与我们的设置不同——在后者中,挑战在于选择和组合多个LLM调用以回答自然语言问题,并在质量-成本-延迟-能耗之间权衡。
第二个方向与我们的工作更相关,它将LLM调用视为类似查询工作流中昂贵的、概率性的算子,探讨如何使用系统和优化器原理优化这些AI驱动的工作流。与此正交的是,编排框架如LangChain¹¹和DSPy\[28\]支持多步流程,但将计划结构和物理选择主要留给开发者脚本化,使得优化隐含其中。
LLM调用编排的早期方法采用*级联*,通过递增能力的模型路由请求。FrugalGPT\[29\]是这一范式的典型代表,通过学习预算感知的级联来降低成本同时保持准确率。然而,级联通常施加了大致固定的结构,并可能累积序列延迟;此外,其中间生成会膨胀下游令牌使用(从而增加成本/延迟),使得贪婪的“从便宜开始”策略全局上并非最优。其他集成方法,如LLM-Blender\[21\]和LLM-TOPLA\[30\],通过融合多个输出来提高质量,通常假设额外推理成本是可接受的。
基于这些见解,自适应的*问题时*编排根据输入选择模型。ThriftLLM\[31\]学习在预算内进行每个问题的集成选择,而Shekhar等人\[32\]在推理前预测质量,从而在延迟约束下为摘要任务选择成本有效的模型。这些方法将计算与问题难度对齐,但它们通常(i)优化单个主导目标,和/或(ii)将模型调用视为大致独立的决策,而非考虑异质LLM之间交互的结构化计划。
补充性的近期工作将LLM调用形式化为声明式数据系统中的算子,支持对AI流水线进行优化器风格的推理。Galois\[33\]强调逻辑优化,如下推过滤器以减少昂贵的LLM调用,而PALIMPZEST\[23\]、Abacus\[34\]和Stretto\[35\]等框架开发了基于成本的优化、约束目标和运行时权衡。**Opti-Q** 在这些声明式系统的基础上在两个关键架构维度上有所不同。首先,先前的系统主要通过为给定的声明式程序或工作流选择物理实现来优化记录、文档或多模态语料上的数据处理流水线。**Opti-Q** 则将优化边界移向在线、每问题的规划,针对单个传入问题动态生成和选择序列、并行或混合执行图。其次,虽然多个现有框架通过标量化目标或固定工作流模板处理资源-质量权衡,**Opti-Q** 将QoA、成本、延迟和能耗视为独立的一等目标,并在问题时间显式探索帕累托权衡,以支持用户指定的优先级和资源约束。
## III. Opti-Q 多LLM规划
本节形式化用户问题、LLM和多LLM问题计划。然后,将给定问题在QoA、财务、延迟和能耗约束下选择最优计划的问题陈述为一个多目标优化(MOO)问题。最后,概述我们的方法。
### III-A 多LLM规划建模
**问题模型**。我们将每个用户问题建模为一个元组 \( Q = (p_t, T, F_{\text{max}}, L_{\text{max}}, E_{\text{max}}, \mathrm{QoA}_{\text{min}}, W) \),其中 \( p_t \) 是文本提示,明确表述为一个问题(例如,“谁是欧盟国家中目前最年长和最年轻的总统?”),\( T \) 表示其主题(例如,“政治”)。参数 \( F_{\text{max}}, L_{\text{max}}, E_{\text{max}} \) 和 \( \mathrm{QoA}_{\text{min}} \) 指定用户约束,分别表示最大允许总财务成本(美元/问题)、最大总延迟(秒/问题)、最大能耗(焦耳/问题)和最低可接受QoA²²(在0-1范围内,1为最高)。我们统称这些为 **预算** \( \mathcal{B} \)。权重向量 \( W = (w_F, w_L, w_E, w_{\mathrm{QoA}}) \),其中 \( \sum_i w_i = 1 \),编码了对各目标的相对重要性。重要的是,\( \mathcal{B} \) 定义了*可行性*(候选计划必须满足用户约束),而 \( W \) 仅在规划后用于从帕累托最优集中选择一个计划;在计划搜索期间不用于标量化目标。在实际应用中,用户无需手动指定所有约束。**Opti-Q** 可以暴露预设选项,如“节省成本”、“平衡”、“高质量”、“低延迟”和“节能”,这些预设内部转换为默认边界和目标权重。我们区分两种问题类型:(1)具有*二元正确性*的问题(例如,多项选择或是否问题),其中 \( \mathrm{QoA} \in \{0,1\} \);(2)具有*开放式或自由文本*答案的问题,其中 \( \mathrm{QoA} \in [0,1] \) 反映分级的部分正确性(例如,“John Smith III” vs “J. Smith”)。**Opti-Q** 的实现为两种情况提供了QoA估计器。
**LLM模型**。设 \( L = \{L_1, L_2, \dots, L_n\} \) 为可用的LLM集合。每个 \( L_i \) 由元组 \( (f_i, l_i, e_i, \mathit{qoa}_i, \mathit{Tok}_i, T_i^{\text{out}}) \) 表示,其中 \( f_i, l_i, e_i \) 分别表示调用 \( L_i \) 时的预期财务成本、延迟和能耗(在相似文章
PoQ-Judge:一种面向去中心化LLM推理中成本感知质量证明的多架构评估框架
介绍了PoQ-Judge,一种采用无参考评判模型(TextCNN、MiniLM、DeBERTa)的多架构评估框架,用于去中心化LLM推理中的成本感知质量证明,实现了与地面真值代理的高相关性,同时消除了对参考答案的需求。
面向非常规求解器的检索增强问答中的QUBO优化证据选择
本文提出了一种基于QUBO的方法,用于在检索增强问答中选择证据段落,该方法实现了与基于LLM的选择器相竞争的性能,同时支持使用量子退火器等非常规求解器。
超越直接回答:通过启发式强化学习将教育大语言模型对齐为苏格拉底式引导者
本文提出了HeuristicEdu,一个通过监督预热和带有启发式奖励的GRPO将Qwen2.5-7B对齐为苏格拉底式导师的流程,并在新数据集SocraticEdu上进行评估,展示了改进的脚手架有效性和减少的关键词泄露。
大语言模型搜索代理的推理时预算控制
本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。