FlowEdit:针对涉及冲突的不适定问题的LLM推理流的信息论控制
摘要
FlowEdit 是一个新颖的框架,利用信息论原理来调节LLMs的内部推理流,使其能够针对具有冲突条件的不适定问题在单次生成中输出多个替代回答。实验表明,与领先的专有模型相比,精确集合匹配准确率提升68%,回答信息量提升24%。
arXiv:2607.20500v1 公告类型:新 \n摘要:大语言模型(LLM)在具有可行答案的明确推理任务上表现出色。然而,在开放世界中遇到的问题可能因条件不一致、陈述冲突或需求互不兼容而变得不适定,从而没有有效回答。我们认为,对这类涉及冲突的不适定问题进行推理,需要LLM具备新颖的能力:将隐藏冲突显式化、通过多个推理分支维持竞争假设、并在单次生成中输出替代回答。而所有这些由于LLM中下一个标记预测机制的限制而具有挑战性。为此,我们提出FlowEdit,一个新颖的框架,利用信息论原理来量化和调节LLM的内部推理流,以在有效假设下生成一套完整的替代回答。FlowEdit可以被视为在模型内部推理表示上强制执行一种分支感知的推理过程,通过两个对偶信息论目标:最大化从每个选定假设到分支结果的信息流,同时最小化兄弟分支之间的重叠和条件依赖,以提供多样化、信息丰富且覆盖广泛的回答集合。我们证明,这可以通过边界嵌入满足{\epsilon}-充分性时的可处理变分界来实现,从而优化LLM推理过程中的底层条件互信息。大量实验表明,FlowEdit优于领先的专有模型,精确集合匹配准确率提升68%,总体回答信息量提升24%。我们进一步表明,流调节在标记流中表现为下一个标记熵的重新分布,该熵在每个分支内集中,在流边界处放大,并随问题所需的流数量扩展。
查看缓存全文
缓存时间: 2026/07/24 05:03
# FlowEdit:基于信息论的不适定冲突问题中LLM推理流控制
来源:https://arxiv.org/html/2607.20500
Sizhe Tang
The George Washington University
s\.tang1@gwu\.edu
& Guangyu Jiang
The George Washington University
guangyu\.jiang@gwu\.edu
& Yu Li
The George Washington University
yul@gwu\.edu
& Rongqian Chen
The George Washington University
rongqianc@gwu\.edu
& Ioannis G\. Kevrekidis
Johns Hopkins University
yannisk@jhu\.edu
& Tian Lan
The George Washington University
tlan@gwu\.edu
###### 摘要
大语言模型(LLMs)在存在可行答案的明确推理任务中展现了强劲的性能。然而,开放世界中遇到的问题可能由于条件不一致、陈述冲突或需求互不兼容而变得不适定。这导致了涉及冲突且没有有效回答的不适定问题。我们认为,有效推理此类涉及冲突的不适定问题需要LLMs具备新的能力:使隐藏冲突显式化,在必要时通过多个推理分支维护竞争性假设,并在一次生成中产出替代性答案。由于LLMs中下一词元预测机制的固有限制,这些能力极具挑战性。为此,我们提出**FlowEdit**,一种新颖的框架,利用信息论原理主动量化和调节LLMs的内部推理流,从而在一次生成中产生一组完整的、基于有效假设的替代答案。FlowEdit可以被视为在模型的内部推理表示上强制执行一种分支感知的推理过程,该过程使用两个对偶的信息论目标:最大化从每个选定假设到分支结果的信息流,同时最小化同级分支之间的重叠和条件依赖,从而提供一组多样、信息丰富且覆盖广泛的答案。我们证明,这可以通过在边界嵌入满足ε足够条件下的可处理变分边界来实现,优化LLM推理过程中潜在的条件互信息。大量实验表明,FlowEdit的性能优于领先的专有模型,精确集合匹配准确率提高了68%,同时整体回答信息量提升了24%。我们进一步表明,流调节在词元流中表现为一种结构化的下一词元熵重分布:该熵在每个分支内集中,在流之间的边界处增强,并随问题所需流的数量而扩展。
参见标题图1:FlowEdit概述。对于涉及冲突的不适定问题,下一词元预测会悄无声息地承诺于一个自洽假设,并将答案集坍缩到单条轨迹上(左)。FlowEdit通过两个关于边界表示的对偶信息论目标来调节模型的内部推理流(右)。图中展示了一个涉及冲突的示例。
## 1 引言
大语言模型(LLMs)在多种任务上展现了强劲的性能[29(https://arxiv.org/html/2607.20500#bib.bib37),8(https://arxiv.org/html/2607.20500#bib.bib15),15(https://arxiv.org/html/2607.20500#bib.bib2),40(https://arxiv.org/html/2607.20500#bib.bib9)],其中数学推理[7(https://arxiv.org/html/2607.20500#bib.bib8)]是一项核心能力。当前的方法主要关注那些存在可行答案的明确问题,并训练模型产生单一的推理轨迹,通过思路链蒸馏[33(https://arxiv.org/html/2607.20500#bib.bib1),38(https://arxiv.org/html/2607.20500#bib.bib13)]的步骤级解释或通过基于可验证奖励的强化学习[27(https://arxiv.org/html/2607.20500#bib.bib17),12(https://arxiv.org/html/2607.20500#bib.bib18)]对最终输出进行标量奖励来监督。这在目标明确的问题上已被证明是有效的,此时单一的确定性思路链或逻辑足以达到唯一正确的答案。然而,开放世界中遇到的推理问题常常会变得不适定[41(https://arxiv.org/html/2607.20500#bib.bib19),23(https://arxiv.org/html/2607.20500#bib.bib21),31(https://arxiv.org/html/2607.20500#bib.bib22),18(https://arxiv.org/html/2607.20500#bib.bib23),34(https://arxiv.org/html/2607.20500#bib.bib27)]。缺乏分析内在问题结构、检查潜在缺陷/冲突或调节推理过程展开方式能力的LLMs,在处理不适定问题时表现有限。在多种形式的不适定问题中,本文考虑的是那些因条件不一致、状态冲突或需求互不兼容而没有有效答案的涉及冲突的不适定问题。这类涉及冲突的不适定问题在现实世界决策、运筹学和系统工程等领域中经常遇到[42(https://arxiv.org/html/2607.20500#bib.bib6),24(https://arxiv.org/html/2607.20500#bib.bib4),3(https://arxiv.org/html/2607.20500#bib.bib3)]。尽管近期工作研究了条件缺失[41(https://arxiv.org/html/2607.20500#bib.bib19),31(https://arxiv.org/html/2607.20500#bib.bib22)]和欠明确推理[23(https://arxiv.org/html/2607.20500#bib.bib21),18(https://arxiv.org/html/2607.20500#bib.bib23)]的不适定问题,但这些大多被归结为检测问题(标记或拒绝不适定输入[34(https://arxiv.org/html/2607.20500#bib.bib27),26(https://arxiv.org/html/2607.20500#bib.bib34)])或关于回答置信度的后验推断问题[16(https://arxiv.org/html/2607.20500#bib.bib25),17(https://arxiv.org/html/2607.20500#bib.bib28),20(https://arxiv.org/html/2607.20500#bib.bib20)]。我们表明,对于涉及冲突的不适定问题,当前的LLMs要么完全拒绝输入[31(https://arxiv.org/html/2607.20500#bib.bib22)],要么在多个同等可能的选择中悄无声息地承诺于一个(关于冲突的)假设[23(https://arxiv.org/html/2607.20500#bib.bib21)]。相比之下,我们的目标是通过使隐藏冲突显式化、在必要时分析和维护多个推理分支的竞争性假设,以及在一次生成中产生替代性回答/建议,来实现更具主动性的推理行为。这是具有挑战性的,因为LLMs的下一词元预测机制倾向于对初始承诺的顺序阐述,而非并行维护多个分支[2(https://arxiv.org/html/2607.20500#bib.bib26)]。需要新颖的解决方案来量化和调节LLMs中的多个内部推理流/分支,以便在一次生成中产生完整的、基于有效假设的替代答案集。我们介绍**FlowEdit**,一个训练框架,通过基于信息论的控制作用于语言模型的内部表示和信息流,将这种调节内部推理流和维护竞争性假设的概念操作化。具体来说,我们识别出冲突的存在,并将每个推理流视为由生成轨迹上指定的隐藏状态汇总的对象,从而将强制执行多个推理流/分支的抽象概念转化为对这些表示几何形状的具体要求。一对对偶目标——以条件互信息的形式表达——使得这一要求精确化:每个推理流必须保留维持自身假设并推导出自身结论所需的最大信息,而不同的流在考虑其之前自回归上下文后,应具有最小的重叠(超出共享的通用问题分析范围),因为推理过程是在一次生成中展开的。更精确地说,FlowEdit通过量化选定的LLM内部状态之间的条件互信息来优化最大-最小对偶目标。通过最大化从每个选定假设到分支结果的信息流,同时最小化同级分支之间的条件重叠,FlowEdit在一次生成中提供了多样、信息丰富且覆盖广泛的答案集。我们证明,这一优化可以通过边界嵌入在ε足够条件下的可处理变分边界实现,从而可证明地优化LLM推理过程中潜在的条件互信息。特别是,ε充分性使得选择条件变得有原则而非启发式:针对分析嵌入(而非仅提示嵌入)调节跨流依赖,可证明地将我们希望惩罚的残差冗余与不同流有权利编码的共享结构隔离开来。FlowEdit在涉及冲突的不适定问题上展示了优异的主动推理行为。在三个问题领域和真实分支数K⋆∈{1,2,3,4}上,FlowEdit-Qwen3-4B-Base 在精确集合匹配准确率上比最强的闭源基线提高了68%,信息恢复提高了24%,并且随着K⋆的增长,优势进一步扩大;词元级分析进一步表明,这些提升伴随着下一词元熵的结构化重分布——该熵在每个分支内集中,并在流之间的边界处增强。本文的主要贡献如下:
- • 我们将具有冲突条件的不适定数学推理重新定义为流调节问题,训练模型在一次生成中枚举所有有效解决方案的完整集合,而不是检测并拒绝。
- • 我们从两个条件互信息要求推导出流调节目标,通过在ε充分性条件下的方向对齐边界进行优化,该条件可证明地隔离了残差的跨流依赖。
- • 我们构建了一个包含冲突问题的数据集,涵盖三个领域和真实分支数K⋆∈{1,2,3,4},每个分支附有经过验证的假设-答案对。
- • 我们表明FlowEdit在精确集合匹配上比最强的闭源基线高出68%,在信息恢复上高出24%,并识别出一个词元级熵特征——分支内集中、流边界处增强——从表示层面解释了这些提升。
## 2 相关工作与背景
### 2.1 语言模型的数学推理
关于语言模型数学推理的研究沿着三条路径发展:从冻结模型中引出多步推理的基于提示的方法[33(https://arxiv.org/html/2607.20500#bib.bib1),32(https://arxiv.org/html/2607.20500#bib.bib7),36(https://arxiv.org/html/2607.20500#bib.bib10),10(https://arxiv.org/html/2607.20500#bib.bib11),4(https://arxiv.org/html/2607.20500#bib.bib12),19(https://arxiv.org/html/2607.20500#bib.bib5)],将步骤级轨迹提炼到较小模型中的监督微调[38(https://arxiv.org/html/2607.20500#bib.bib13),22(https://arxiv.org/html/2607.20500#bib.bib14),11(https://arxiv.org/html/2607.20500#bib.bib16)],以及针对单个标准答案使用可验证奖励的强化学习[27(https://arxiv.org/html/2607.20500#bib.bib17),12(https://arxiv.org/html/2607.20500#bib.bib18),37(https://arxiv.org/html/2607.20500#bib.bib29)]。这三者都共享同一个操作假设:每个问题都是良好定义且存在唯一正确答案的。我们脱离这种点值目标,将涉及冲突的不适定问题的答案视为一组互斥的解决方案,训练模型在单个结构化响应中枚举所有这些方案。
### 2.2 不适定数学推理与拒绝
近期工作考察了LLMs在违反良好定义假设的问题上的行为,通过逻辑陷阱、不合理输入以及缺失或矛盾的条件基准测试[41(https://arxiv.org/html/2607.20500#bib.bib19),23(https://arxiv.org/html/2607.20500#bib.bib21),31(https://arxiv.org/html/2607.20500#bib.bib22),18(https://arxiv.org/html/2607.20500#bib.bib23)],微调模型以输出“不可解”的对齐策略[34(https://arxiv.org/html/2607.20500#bib.bib27)],以及关于不可回答查询的开放域问答的并行努力[39(https://arxiv.org/html/2607.20500#bib.bib33),26(https://arxiv.org/html/2607.20500#bib.bib34)]。尽管方法多样,所有这些工作都将不适定输入框定为检测问题:模型应识别输入为不可解并拒绝,或请求澄清以恢复良好定义。这种框丢弃了数学实践中核心的结构,即涉及冲突的不适定问题通常不是不可解,而是多重可解,其条件的每个自洽子集定义了一个具有不同答案的良好定义子问题。我们脱离检测-拒绝范式,训练LLMs建设性地枚举所有有效的解决方案集;据我们所知,这是首个将涉及冲突的不适定数学推理表述为信息流调节任务,并同时提供训练目标和针对此场景的数据集的工作。数值优化中的并行传统在显式约束层面处理涉及冲突的不适定问题。最大可行子系统问题寻找一个最大基数的、相互不一致线性约束的子集,该子集允许联合解[1(https://arxiv.org/html/2607.20500#bib.bib30),6(https://arxiv.org/html/2607.20500#bib.bib31)],并通过RANSAC[9(https://arxiv.org/html/2607.20500#bib.bib32)]和利用无冲突约束先验知识的随机Kaczmarz方法[28(https://arxiv.org/html/2607.20500#bib.bib39),21(https://arxiv.org/html/2607.20500#bib.bib38)]在大规模上解决。这些方法操作于显式约束矩阵并返回单一解,而我们的设置要求模型从问题陈述中表面化隐式冲突,并在一次生成中枚举所有解集。
## 3 方法论
### 3.1 问题形式化与预备知识
我们将对涉及冲突的不适定数学问题的回答形式化为一个任务:单个模型输出必须并行携带并分离若干推理流,并且我们规定一个回答在信息层面(而非表面词元层面)正确的条件。良好定义的问题被包含为退化情况K⋆(x)=1,此时框架简化为标准的单轨迹推理;因此该形式化是对先前工作中采用的点值目标的严格泛化,而非一个独立的机制。
#### 不适定问题与推理流。
令 x 表示问题陈述,C(x)={c₁,…,cₘ} 为 x 中陈述的条件。如果没有问题变量的赋值能同时满足每个 cᵢ,但 C(x) 的严格子集是联合可满足的,则称 x 为*不适定*。假设 z⊆C(x) 是一个自洽的条件子集,Z⋆(x) 收集那些在自洽子集中按包含关系最大的子集,它们诱导出一个具有唯一解的良好定义子问题。令 K⋆(x)=|Z⋆(x)|,且 yₖ=g(x,zₖ) 为领域解映射 g 下的答案,则真实目标为 Y⋆(x)={g(x,zₖ):zₖ∈Z⋆(x)}={y₁,…,y_K⋆(x)}。相似文章
推理流如何运作?追踪注意力诱导信息流以在LLM中进行定向强化学习
FlowTracer是一个强化学习框架,它利用注意力诱导图来追踪推理流并分配词元级别的信用,从而提升推理任务的性能。
ReasoningFlow: 用于理解LLM推理轨迹的篇章结构
介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。
基于归一化流的潜在推理
提出NF-CoT,一种使用归一化流来建模LLMs中连续思维的潜在推理框架,保留了自回归优势,并以更低的成本实现了更好的代码生成性能。
从推理中探寻真理:一种动态表示编辑框架用于引导LLM轨迹
本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。
重新审视LLM推理中的均匀信息密度假设
本文重新审视了LLM推理背景下的均匀信息密度(UID)假设,引入了一个基于熵的框架来量化信息流的均匀性。在七个推理基准上的实验发现,高质量的推理在步骤过渡上表现出局部均匀性,但在轨迹结构上呈现全局非均匀性,这表明LLM推理与人类交流模式存在根本性差异。