何时寻求帮助:分层LLM代理中的贝叶斯自升级
摘要
本文介绍了一种贝叶斯框架,用于分层LLM代理在推理过程中决定何时升级到更强的模型,将其表述为一个最优停止问题,并提供了性能的理论保证。
arXiv:2608.24087v1 公告类型:新
摘要:当前LLM代理系统在推理开始前决定委派(路由器选择模型)或在响应完成后决定(验证器评分并可能重试)。我们研究第三种情况:代理在自身推理过程中认识到不太可能成功,并将控制权转移给更强的模型。我们将生成内委派表述为一个贝叶斯最优停止问题,基于学习的能力后验——代理最终任务成功的在线估计,其充分统计量从标记轨迹中学习,而非从原始熵中读取。我们推导出短视升级阈值的闭合形式,通过动态规划描述最优策略,并证明最优策略是一个时变阈值,对原始信号无形状假设。我们进一步证明了在信号的Chernoff信息率下神谕信念的指数分离,一个由后验收准控制的后悔界,以及一个有限样本保证:使用n个标记的校准轨迹,部署的插件策略的后悔以1/sqrt(n)衰减。一个受控模拟研究证实了理论的每一项预测,包括预测的1/sqrt(n)率。我们还报告了在Qwen2.5-Coder 1.5B->7B代码级联(MBPP,257个任务)上的真实模型验证,确认了三个预先注册预测中的两个:升级前沿在等成本下优于事后路由,且累积能力信念的区分度随生成而提高。
查看缓存全文
缓存时间: 2026/08/26 09:33
# 知晓何时寻求帮助:分层LLM代理中的贝叶斯自升级机制 来源:https://arxiv.org/html/2608.24087 ## 知晓何时寻求帮助:分层LLM代理中的贝叶斯自升级机制 致谢: 版本1.1。版本1(DOI:10.5281/zenodo.21330788 (https://doi.org/10.5281/zenodo.21330788))未报告真实模型结果,而是预注册了评估协议。本版本首次在该Qwen2.5-Coder1.51.5B→77B代码级联模型上执行了该协议(第8节 (https://arxiv.org/html/2608.24087#S8)),证实了其三个预测中的两个;理论结果未发生变化,且所测试的常数阈值实例化未体现最优停止动态规划过程。 Nadeem Shaikh 单位:独立研究员 单位:澳大利亚墨尔本 邮箱:[[email protected]](mailto:) 2026年8月25日 ###### 摘要 当前的LLM代理系统在推理开始*之前*(由路由器选择模型)或响应完成*之后*(由验证器评分并可能重试)决定任务委托。我们研究第三种情形:代理在自身推理过程中识别出自身不太可能成功,并将控制权移交给更强模型的情形。我们的贡献并非代理可委派给其他代理的观察——这一点已广为人知——而是将*生成内*委托形式化为基于代理最终任务成功在线估计的*最优停止问题*。初级代理维护一个*能力后验*:一种抽象的贝叶斯状态,其充分统计量从标注轨迹中*学习*,而非直接读取原始熵值。当继续执行的预期成本超过委托的预期成本时,它便升级。我们以封闭形式推导了短视升级阈值,通过动态规划表征了最优策略,并仅使用单调性(无需任何凹性论证)证明了在条件独立信号模型下,最优策略是一个基于能力后验的时间变化阈值,且对原始信号无需单调似然或其他形状假设。我们进一步证明,预言机信念以信号的Chernoff信息速率分离,并给出了有限样本保证:在长度为T的n条标注校准轨迹下,部署的插入式策略相对于预言机的遗憾界以高概率为O(LtlogK/(nT))(O(Lt√{logK/(nT)}))。我们的核心信息是遗憾界表明超额成本受该后验*校准*程度的控制:更好的校准比更智能的路由器更重要,“自信地错误”的预测是主要的失败模式。在已知数据生成过程的仿真研究中证实了理论的每个预测。预注册协议产生可证伪的预测;在此修订版中,我们报告了在该Qwen2.5-Coder1.51.5B→77B代码级联模型上首次执行该协议的结果,证实了其三个预测中的两个:升级边界在同等成本下优于事后路由,且累积能力信念的区分度在生成过程中逐渐提高。理论结果未发生变化。 关键词:LLM代理;分层推理;模型级联;最优停止;不确定性量化;校准;选择性预测;学习委派。 ## 1 引言 大型语言模型(LLM)部署的经济学日益青睐*分层结构*:一个小型、快速的模型处理大部分流量,而一个更大、能力更强——且成本显著更高——的模型仅在需要时被调用。模型级联和路由器实现了这一理念,并且可以在不牺牲质量的情况下大幅降低推理成本[1 (https://arxiv.org/html/2608.24087#bib.bib1),19 (https://arxiv.org/html/2608.24087#bib.bib19),10 (https://arxiv.org/html/2608.24087#bib.bib10)]。然而,几乎所有此类系统都在推理*之前*(路由器检查查询并选择模型)或完整生成*之后*(验证器对完成的输出评分并可能重试)做出路由决策。这两种选项都无法让工作模型在困难的推理链进行到一半时注意到,它已超出能力范围并应移交控制权。许多系统已允许代理将工作移交给另一个代理或自身:自我反思和评论家/辩论模型、验证器引导的生成和最佳-of-n重排、带后备的推测解码,以及自适应计算和测试时缩放方法都会重新访问或重新分配计算。这些系统所缺少的是一个*有原则的、顺序性*的说明,即*何时*在生成中途停止并委派。 我们并非声称引入了代理委派。我们引入了一种生成内委派的*决策理论*形式化,其中升级是基于最终任务成功在线估计的最优停止问题。我们将该机制称为*自升级*。我们重点而非附带地指出:该框架*不*假设原始不确定性指标是校准的。高熵并非失败,低熵也非正确——模型可能自信地错误。因此,贝叶斯状态是一个*抽象的能力后验*,其充分统计量(从信号历史到成功概率的映射)*从标注轨迹中学习*。每词元熵或下一词元边际仅作为原始证据输入该学习映射,而非后验本身。这一区别使得理论具有意义,并且事实证明是关键:我们的主要结果是该方法的成本受该后验校准程度的支配。 #### 贡献。 1. 1. 公式化。我们将生成内自升级形式化为关于初级代理最终成功的贝叶斯最优停止问题(第3节 (https://arxiv.org/html/2608.24087#S3)),将*学习的*能力后验组件与决策组件分离。 2. 2. 策略与理论。我们以封闭形式推导了短视升级阈值,通过动态规划表征了最优策略,并证明:(i) 能力后验是一个鞅;(ii) 最优策略是一个时间变化的阈值——*仅通过单调性证明,无需凹性论证且对原始信号无单调似然假设*;(iii) 一个将超额成本与后验失准联系起来的遗憾界;(iv) 预言机信念以信号Chernoff信息速率的指数分离;(v) 插入式策略的有限样本遗憾保证,随标注校准轨迹数量n以1/√{n}衰减(第4节 (https://arxiv.org/html/2608.24087#S4)–5节 (https://arxiv.org/html/2608.24087#S5))。 3. 3. 校准作为关键约束。我们将遗憾界提升为设计原则:对于自升级,改进能力后验的校准优于改进决策规则(第5.4节 (https://arxiv.org/html/2608.24087#S5.SS4))。 4. 4. 算法。我们提供了一种流式推理算法和一种用于阈值调度的离线后向归纳过程,以及文本级(而非隐藏状态)的上下文交接(第6节 (https://arxiv.org/html/2608.24087#S6))。 5. 5. 仿真、协议与真实模型验证。在具有*已知*数据生成过程的模型上,我们证实了理论的每个预测(第7节 (https://arxiv.org/html/2608.24087#S7));我们预注册了一个可证伪协议(第9节 (https://arxiv.org/html/2608.24087#S9));并在Qwen2.5-Coder代码级联上首次执行了该协议,证实了其两个预测(第8节 (https://arxiv.org/html/2608.24087#S8))。 ## 2 相关工作 #### 选择性预测与学习委派。 *选择性预测*或带有拒绝选项的分类有着悠久的历史[2 (https://arxiv.org/html/2608.24087#bib.bib2),5 (https://arxiv.org/html/2608.24087#bib.bib5),6 (https://arxiv.org/html/2608.24087#bib.bib6)]。*学习委派*通过将拒绝的输入路由给外部专家并联合学习预测器和委派规则,推广了弃权[17 (https://arxiv.org/html/2608.24087#bib.bib17),18 (https://arxiv.org/html/2608.24087#bib.bib18),24 (https://arxiv.org/html/2608.24087#bib.bib24)]。我们的设定是委派的一个实例,其中“专家”是更强的模型,但有两个现有公式未解决的区别:委派决策是在*单次生成内顺序*做出(而非每个输入一次),且后验的对象是初级模型自身的最终成功而非一个标签。 #### LLM的级联与路由。 FrugalGPT引入了学习型LLM级联,按成本递增顺序查询模型,并在评分器判断答案足够时停止[1 (https://arxiv.org/html/2608.24087#bib.bib1)]。RouteLLM从偏好数据学习路由器[19 (https://arxiv.org/html/2608.24087#bib.bib19)];基于一致性和符合性的级联在廉价模型不一致时升级[10 (https://arxiv.org/html/2608.24087#bib.bib10),23 (https://arxiv.org/html/2608.24087#bib.bib23)];Jitkrittum等人[8] (https://arxiv.org/html/2608.24087#bib.bib8)分析了级联中基于信心的委派何时充分或不充分。这些方法作用于整个响应的粒度,通常在决定前需要至少一次完成的廉价生成(且通常需要多个样本)。相反,自升级在流式传输时使用词元级信号,可以在生成中途停止,以少量簿记开销换取尽早中止注定失败轨迹的能力。 #### LLM中的不确定性量化。 大量文献估计LLM从输出分布的不确定性。语义熵通过语义对采样生成进行聚类,并衡量集群上的熵,给出强烈的幻觉信号[13 (https://arxiv.org/html/2608.24087#bib.bib13),3 (https://arxiv.org/html/2608.24087#bib.bib3)];语义熵探针通过单次前向传播的隐藏状态近似此过程[11 (https://arxiv.org/html/2608.24087#bib.bib11)]。此类工作大多针对*事后*检测已完成的生成。我们将此类信号用作顺序决策的*证据流*,并且我们的框架对所使用的信号类型是无关的:词元熵、下一词元边际、探针输出或语义熵都可以作为每一步的观测e_{t}。 #### 自修订与自适应计算。 另一类工作在单个系统内重新分配或重新访问计算。自适应计算时间让网络学习为每个输入花费多少内部步骤[7 (https://arxiv.org/html/2608.24087#bib.bib7)];早期退出解码如CALM在中间信心足够时停止词元的计算[21 (https://arxiv.org/html/2608.24087#bib.bib21)];推测解码用廉价模型起草并用昂贵模型验证,在不一致时回退[14 (https://arxiv.org/html/2608.24087#bib.bib14)];自我完善通过自我反馈迭代模型自身的输出[16 (https://arxiv.org/html/2608.24087#bib.bib16)];测试时缩放研究如何最优分配额外推理计算[22 (https://arxiv.org/html/2608.24087#bib.bib22)]。这些共享我们的动机——仅在需要时投入更多努力——但它们修订、重排或扩展*同一*模型的计算,而非构建一个向*更强*模型移交的顺序决策,并且通常缺乏与最终任务成功校准估计相关的明确停止规则。相关地,Kadavath等人[9] (https://arxiv.org/html/2608.24087#bib.bib9)表明LLM的自我正确性评估包含真实信号但校准不完美——这正是命题3 (https://arxiv.org/html/2608.24087#Thmproposition3)所述自升级增益得以实现或丧失的领域。 #### 顺序测试。 我们问题的预言机决策核心是有限视界、成本不对称的Wald顺序概率比测试变体,后者持续采样直到似然比退出一个区间[25 (https://arxiv.org/html/2608.24087#bib.bib25)],并且对于对称测试问题是最优的[26 (https://arxiv.org/html/2608.24087#bib.bib26)]。我们明确指出这一点,以便读者定位经典核心:停止数学并非新颖。经典理论未提供的——本文致力于此——是公式化(将委派给更强模型作为停止动作,具有计算和错误成本)、当似然比被*估计*时的分析(第5.4节 (https://arxiv.org/html/2608.24087#S5.SS4)–5.5节 (https://arxiv.org/html/2608.24087#S5.SS5)),以及系统实例化。 #### 最优停止。 决策组件是一个最优停止问题[4 (https://arxiv.org/html/2608.24087#bib.bib4),20 (https://arxiv.org/html/2608.24087#bib.bib20)]:在每一步,停止并委派,或继续并观察。我们使用标准的单调停止论证来确立最优策略的阈值结构。我们的框架——基于对工作模型自身最终正确性的*学习*在线估计的最优停止规则,用于触发向更强模型的升级——将这些要素结合在一起,我们尚未在LLM层次结构中明确见到,尽管我们不对底层停止理论本身提出主张。 ## 3 问题公式化 考虑一个初级代理J和一个高级代理S。给定一个查询x,代理J在T步(词元或推理步骤)上生成一个响应。令Y∈{0,1}为J的*完成*答案正确的潜在事件;记π=P(Y=1)为J在查询群体上的基础能力。在每个步骤t∈{1,...,T},代理发出一个*能力证据*信号e_{t}∈E(原始统计量,如归一化词元熵或下一词元边际)。令F_{t}=σ(e_{1},...,e_{t}),并定义*能力后验*B_{t}=P(Y=1|F_{t})。(1) ###### 假设1(条件独立性)。 以Y=y为条件,信号(e_{t})_{t≤T}独立同分布,密度为f_{y},且f_{0},f_{1}具有公共支持集和有限的对数似然比λ(e)=log(f_{1}(e)/f_{0}(e))。实际上λ是注1 (https://arxiv.org/html/2608.24087#Thmremark1)中学习的统计量,并非封闭形式的熵变换。假设1 (https://arxiv.org/html/2608.24087#Thmassumption1)是建模理想化;实际词元信号是相关的且非平稳。我们采用它以获得透明的更新,并在第10节 (https://arxiv.org/html/2608.24087#S10)讨论其放宽。在假设1 (https://arxiv.org/html/2608.24087#Thmassumption1)下,信念演变为简单的对数几率递归。 ###### 引理1(信念更新)。 令ℓ_{t}=log(B_{t}/(1-B_{t})),ℓ_{0}=log(π/(1-π))。则ℓ_{t}=ℓ_{0}+∑_{s=1}^{t}λ(e_{s}),且B_{t}=σ(ℓ_{t}),其中σ(z)=(1+e^{-z})^{-1}。 ###### 证明。 由贝叶斯规则和条件独立性,P(Y=1|F_{t})/P(Y=0|F_{t})=(π/(1-π))∏_{s=1}^{t}f_{1}(e_{s})/f_{0}(e_{s});取对数得递归,对对数几率取逆得B_{t}=σ(ℓ_{t})。∎ #### 成本与动作
相似文章
知道何时提问: 分层语言代理的自我门控澄清
本文提出ActionRating,一种将澄清置于代理的动作空间内,与导航共享一个顺序标尺的公式,实现了两种信息寻求模式(强制性和机会性)。在分层分类法基准测试中,使用9个LLM的实验表明,机会性澄清提高了准确性和信息寻求效率。
Bayesian-Agent:后验引导的LLM代理技能进化框架
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。
@dair_ai: 一个LLM代理真的能构建它无法看到的环境模型吗?这项工作使这个问题可评分。一个代理…
一篇研究论文提出了‘智能体自动机学习’来评估LLM代理是否能通过交互推断隐藏的世界模型,发现性能随着任务复杂度的增加而急剧下降,并且推理模型优于非推理模型,但仍然存在困难。
上下文、推理与层次结构:对抗性POMDP中复合LLM智能体设计的成本-性能研究
在对抗性POMDP(CybORG CAGE-2)中对复合LLM智能体设计进行了一项受控研究,系统性地在五个模型系列中变化上下文、推理与层次结构。主要发现:程序化状态抽象每token产生巨大回报,无推理工具的层次结构实现了最佳绝对性能,并且上下文工程比深度推理更具成本效益。
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。