CogniConsole:将推理时控制外化为可靠LLM交互的一种形式抽象
摘要
本文介绍了CogniConsole,一种将LLM推理时控制外化的架构抽象,通过受控探针证明增加结构脚手架可降低输出方差和失败率,挑战了可靠性仅源自模型能力的假设。
arXiv:2607.08774v1 公告类型:新
大型语言模型(LLM)系统的可靠性通常被视为模型能力的函数。我们通过证明可靠性显著受\emph{推理时控制}影响来挑战这一观点——推理时控制是决定任务框架和上下文选择的计算层。我们引入\emph{CogniConsole},一种架构实例,将此控制外化为一个结构化接口,结合程序化协调与有界基于提示的推理。通过在多步骤交互环境中进行\emph{可控性导向探针}($N=489$),我们证明增加结构脚手架——从非结构化到完全结构化——\textbf{在固定模型架构下系统性地降低了输出方差和失败率}。我们的结果表明,许多观察到的失败模式,如上下文漂移和不一致的约束遵循,源于控制规定不足而非能力不足。这项工作为将推理时控制视为一等抽象提供了实证基础,为设计和评估LLM系统开辟了新方向,超越单纯的规模扩展。
查看缓存全文
缓存时间: 2026/07/13 07:51
# CogniConsole:将推理时控制外部化为一种形式化抽象,以实现可靠的大语言模型交互 来源:https://arxiv.org/html/2607.08774 Vanessa Figueiredo 计算机科学系,里贾纳大学 里贾纳,萨斯喀彻温省,加拿大 [email protected] & Wilter Franceschi¹¹footnotemark:¹²²footnotemark:² Orbital Sea 里贾纳,萨斯喀彻温省,加拿大 [email protected] ###### 摘要 通常认为,大语言模型(LLM)系统的可靠性取决于模型能力。但我们对这一观点提出质疑,通过论证可靠性实际上受到**推理时控制**——即支配任务框架和上下文选择的计算层——的显著影响。我们引入了**CogniConsole**,这是一种架构实例,它将这种控制外部化,形成一种结合程序化协调与受限提示推理的结构化接口。通过在多步交互环境中使用**面向可控性的探针**(\(N=489\)),我们证明了在固定模型架构下,增加结构支撑——从非结构化到完全结构化——能够系统地降低输出方差和失败率。我们的结果表明,许多观察到的失败模式,例如上下文漂移和约束遵守不一致,源于控制层的不充分规范,而非模型能力不足。本文为将推理时控制视为第一类抽象提供了实证基础,为设计、评估LLM系统开辟了超越单纯缩放的新方向。 ## 1 引言 现代语言模型研究的一个核心假设是,可靠性是模型能力的函数。当大语言模型(LLM)出现幻觉、不稳定或不一致时,通常的解释是规模不足、训练数据不完善或对齐不完全 [2 (https://arxiv.org/html/2607.08774#bib.bib40), 4 (https://arxiv.org/html/2607.08774#bib.bib77), 6 (https://arxiv.org/html/2607.08774#bib.bib76), 14 (https://arxiv.org/html/2607.08774#bib.bib75)]。这一假设驱动了一个主导范式:通过让模型变得更大、训练更好、更具对齐来改进模型。 我们认为这种框架是不完整的。在实践中,与LLM的交互表现出一种不同的模式:同一模型在提示结构、上下文顺序或交互历史发生微小变化时,可能展现出截然不同的行为 [16 (https://arxiv.org/html/2607.08774#bib.bib78), 18 (https://arxiv.org/html/2607.08774#bib.bib79)]。即使是非常强大的模型,尤其是在长上下文和多步设置中,仍然敏感、不稳定且难以调试 [8 (https://arxiv.org/html/2607.08774#bib.bib114), 11 (https://arxiv.org/html/2607.08774#bib.bib141), 19 (https://arxiv.org/html/2607.08774#bib.bib41), 21 (https://arxiv.org/html/2607.08774#bib.bib140)]。尽管规模有所提高,这些失败依然存在,这表明可靠性不仅仅是模型知道什么,还取决于如何引导模型做出决策。 这指向了一个缺失的抽象。在学术和工业系统中,出现了一致的设计模式:提示定义了角色、编码了推理过程、施加了约束,并充当可执行的策略 [12 (https://arxiv.org/html/2607.08774#bib.bib117), 20 (https://arxiv.org/html/2607.08774#bib.bib142), 19 (https://arxiv.org/html/2607.08774#bib.bib41)]。基于代理的系统将任务分解为更小的单元,而结构化提示引入了中间推理步骤。尽管目前这些实践是分开应用的,但它们隐含地在预训练模型之上构建了一个推理时控制层。然而,该层仍然是非正式的、未充分规范的,并且在很大程度上缺乏理论化。 我们认为,许多观察到的失败模式(例如,不稳定、上下文敏感性和缺乏可重复性)是控制层缺陷的结果,而非模型能力的限制。在当前的系统中,控制通常嵌入在整体式提示中,多个任务、推理策略和决策规则被放在一起 [15 (https://arxiv.org/html/2607.08774#bib.bib123)]。因此,模型必须在概率性的下一个词生成过程中内部仲裁竞争目标,导致推理轨迹的变异性。 从根本上讲,有效的控制源于提示结构与程序化逻辑之间的协调交互。没有良好结构提示的程序化逻辑会使模型约束不足,而单独的提示仍然脆弱且容易漂移。因此,我们将推理时控制概念化为一类混合系统,其中结构化程序定义了决策空间,而提示在其中实例化受限的推理。 我们将其形式化为一种视角转变:从以模型为中心解释失败,转向以控制为中心解释行为。基于这一观点,提示设计成为一种管理推理如何展开的架构机制。 为了使这一观点具体化,我们引入了**CogniConsole**,它是推理时控制的一个架构实例。**CogniConsole** 作为一个存在性证明,表明控制可以被视为一个明确的、结构化的对象。它将交互分解为任务范围的组件,并通过诸如行为角色、显著输入、决策协议和输出契约等规范来约束推理。这种架构使得控制结构能够与提示实现分离,从而允许我们改变提示设计,同时保持底层控制骨架不变。通过这样做,它展示了如何将控制从整体式提示中外部化并系统地应用。 本文提出了这样一个概念:推理时控制构成了现代LLM系统中一个未建模的计算层。明确这一层为理解、设计和评估语言模型行为开辟了一个超越单纯缩放的新方向。 ## 2 当前LLM控制范式中的失败模式 尽管在提示设计、代理框架和模型缩放方面取得了快速进展,但当前的LLM系统表现出了反复出现的、系统性的失败模式 [1 (https://arxiv.org/html/2607.08774#bib.bib143), 10 (https://arxiv.org/html/2607.08774#bib.bib144)]。我们认为这些失败是未建模推理时控制层的症状。在实验LLM的过程中,我们开始注意到以下模式,这些模式促使我们将推理时控制视为一个缺失的层。 ### 2.1 控制归因 LLM研究中一个主要的假设是,可靠性失败(例如,幻觉、不稳定、不一致)主要源于模型能力不足、训练数据不完善或对齐不完全 [3 (https://arxiv.org/html/2607.08774#bib.bib105), 6 (https://arxiv.org/html/2607.08774#bib.bib76)]。在这种观点下,提高可靠性主要在于缩放模型、细化训练目标以及提高数据质量。 虽然这些方法带来了收益,但它们未能解决一个关键的观察:即使是最先进的模型也表现出显著的行为差异。输出对提示结构、上下文顺序和交互历史中的微小变化仍然敏感,尤其是在长上下文和多步设置中 [8 (https://arxiv.org/html/2607.08774#bib.bib114), 11 (https://arxiv.org/html/2607.08774#bib.bib141), 16 (https://arxiv.org/html/2607.08774#bib.bib78)]。 我们认为这反映了错误的归因。可靠性不仅仅是模型能力的函数,更是这种能力在推理时如何被约束和组织的函数。在当前的实践中,模型部署时带有一组异质的控制结构,这些结构通过提示、结构化模式、检索机制和程序化编排的组合来表达。在这些系统中,多个指令、目标和信息来源通常共存于一个概率性的下一个词生成过程中 [9 (https://arxiv.org/html/2607.08774#bib.bib86), 7 (https://arxiv.org/html/2607.08774#bib.bib135), 13 (https://arxiv.org/html/2607.08774#bib.bib134)]。这可能导致竞争信号之间的相互作用,即使在底层能力足够的情况下,也会导致推理轨迹的变异性。 这种错误归因因另一种假设而得到加强,即推理结构可以被隐式诱导。一些提示技术将中间步骤外部化,但该过程仍然是统计性的,而非明确受控 [17 (https://arxiv.org/html/2607.08774#bib.bib35)]。因此,推理仍然难以可靠控制,并且仅具隐式状态感知。在多轮设置中,任务状态必须隐式地编码在提示中,增加了上下文漂移和错误积累。 我们将其称为**控制归因问题**:一种系统性的倾向,即将行为不稳定归因于模型限制,而非推理时控制的缺陷。 ### 2.2 整体式提示 通过提示,实践者定义角色、引入推理过程、提供上下文并施加输出约束 [15 (https://arxiv.org/html/2607.08774#bib.bib123)]。这些干预可以揭示潜在的能力,导致一种隐含的假设:更详细的提示会带来更大的控制力。 我们认为,这种假设在复杂性面前会失效。在实践中,提示通常被构建为大型的、整体式的指令块,其中编码了多个任务、异构的推理策略和松散协调的约束 [21 (https://arxiv.org/html/2607.08774#bib.bib140), 22 (https://arxiv.org/html/2607.08774#bib.bib145)]。这种聚合非但没有简化推理,反而引入了不稳定性。 从计算的角度来看,整体式提示定义了一个约束不足的控制结构。模型必须在概率性的下一个词生成过程中内部仲裁竞争目标(例如,选择相关指令、选择推理路径、调解冲突)。因此,措辞、顺序或上下文的微小变化都可能改变推理轨迹并产生不一致的输出 [18 (https://arxiv.org/html/2607.08774#bib.bib79)]。 这种失败并非提示本身固有的,而是其结构所致。虽然提示可以塑造行为,但将多个决策过程共置于一个提示中使得控制变得隐式、不透明且难以调试。模型实际上被要求管理自己的控制流。 我们将其称为**整体式提示问题**:将多个决策过程嵌入到单个提示中,迫使内部仲裁并增加不稳定性。因此,有效的控制需要分解而非积累。结构化任务本质上是多阶段的;隔离决策例程并仅呈现与步骤相关的信息可以减少仲裁并稳定推理。 因此,当前提示实践的限制不在于表达能力不足,而在于缺乏结构。提示已经作为一种控制机制在运作,但如果没有显式的分解,它仍然是一种不可靠的推理时控制形式。 ### 2.3 混合启发式 当前LLM控制范式中的第三个限制是在单个推理上下文中纠缠了根本不同的推理机制。虽然最近的框架引入了结构(例如,思维链、工具使用、代理分解),但它们常常假设异构的推理过程可以在共享提示内隐式协调 [20 (https://arxiv.org/html/2607.08774#bib.bib142), 21 (https://arxiv.org/html/2607.08774#bib.bib140)]。 在实践中,任务经常结合不同的决策过程(例如,离散分类、程序化推理、语义解释和生成式合成),每个过程都在不同的约束下运作。二元决策需要严格的界限,而模糊推理依赖于渐变相似性和模糊容忍度;程序化工作流施加顺序依赖,而生成式任务则优先考虑流畅性和连贯性。 当这些机制被共置于一个提示中时,模型必须同时解决竞争目标。由于LLM通过概率性的下一个词预测运作,它们并不会显式分离这些机制,而是在共享表示空间中跨它们进行插值 [22 (https://arxiv.org/html/2607.08774#bib.bib145)]。这导致了**启发式干扰**,即相互竞争的推理策略影响同一个生成过程,产生不稳定的决策轨迹。增加模型规模并不能解决这个问题,因为在一个过程中协调多个约束的底层要求并未改变。 在实践中,这表现为部分满足多个目标、在不兼容策略之间切换,或者产生看似合理但违反任务约束的输出。在多步交互中,随着早期歧义的传播,这些不一致会加剧 [11 (https://arxiv.org/html/2607.08774#bib.bib141), 16 (https://arxiv.org/html/2607.08774#bib.bib78)]。 我们将其称为**混合启发式问题**:在单个推理上下文中共存执行不兼容的推理机制,导致不稳定行为。因此,可靠的控制需要隔离决策过程,而非聚合它们。每个推理步骤应对应于一个具有清晰边界的单一决策例程,允许严格或模糊的推理在没有干扰的情况下运行。这既保留了灵活性,又将其约束在与任务对齐的决策空间内。 ### 2.4 上下文漂移与持久化机制的失败 当前LLM控制范式中出现的第三种失败模式涉及如何在推理过程中实现持久化。在大多数系统中,状态并非作为一个可查询的结构化对象来维护,而是从提示上下文或检索片段中重建 [9 (https://arxiv.org/html/2607.08774#bib.bib86), 21 (https://arxiv.org/html/2607.08774#bib.bib140)]。因此,持久化与上下文被混为一谈。 模型并非接收关于系统知道什么或决定了什么的表示,而是接收一个序列化的令牌历史,并必须通过统计重建来推断状态。由于LLM在有限的上下文窗口内运作,这个过程本质上是有损的,因为信息被选择性地保留、截断或未经显式控制地重新引入 [11 (https://arxiv.org/html/2607.08774#bib.bib141)]。 我们将此描述为**上下文漂移**:跨轮次的状态一致性退化。随着交互的增长,早期的决策可能部分丢失、被覆盖或不一致地重新解释。模型必须反复推断上下文的哪些部分对应于相关的状态,从而在多步推理中引入不稳定性。 现有的持久化策略加剧了这个问题。上下文积累会增加令牌负载并模糊相关性,而基于检索的方法依赖于相似性启发式,可能返回语义相关但操作上无关的信息 [5 (https://arxiv.org/html/2607.08774#bib.bib146), 9 (https://arxiv.org/html/2607.08774#bib.bib86)]。检索增强系统通过将存储与提示解耦来提高可扩展性,但它们运作在访问层面而非控制层面,未能解决哪些信息应影响给定决策的问题。 这揭示了一个更深层次的问题:持久化被视为一个存储问题,而非控制问题。系统侧重于保留或检索更多信息,但缺乏机制来确定应该维护什么、何时应该访问以及如何指导推理。因此,增加记忆并不一定能提高可靠性。
相似文章
Consilience: 基于共形校准的隐藏档案多智能体推理通信控制
本文提出了Consilience,一个用于多智能体LLM系统的推理时编排框架,该框架提供共形校准的通信控制,以提高隐藏档案推理任务中的决策准确性和效率。
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。
基于依据的延续:一种用于LLM对话的线性时间运行时验证器
本文介绍了基于依据的延续(Grounded Continuation),一种用于LLM对话的线性时间运行时验证器,它维护一个显式依赖图,以检测下一句话是否得到先前对话的支持,在包括LongMemEval和LoCoMo的基准测试中,相比基线取得了准确率提升。
为大语言模型推理提供高性能且灵活的模型内部可观测性
本文介绍了 DMI-Lib,这是一种高速深层模型检查器,通过将监控与推理热点路径解耦,实现了大语言模型推理的高效内部可观测性。
潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。