组合坍缩:稳定的事实知识并不蕴含组合推理
摘要
本文介绍了'组合坍缩'这一现象,即语言模型虽然拥有稳定的事实知识,但仍无法将这些知识组合成正确的多跳推理,并提出了一个双门协议,以将组合失败与原子知识不稳定性分离开来。
arXiv:2605.26789v1 公告类型:新
摘要:后训练通常通过聚合基准分数进行评估,这些基准将多跳推理视为单一能力——仿佛一个正确回答更多问题的模型必然更擅长整合事实。我们证明这种假设可能具有误导性:在原子知识统计上无差异的配方,其组合行为却相差超过40个百分点,我们将这一现象称为组合坍缩:系统地无法将稳定已知的事实组装成链条,而聚合指标对此却不可见。我们引入了一个双门协议,将估计目标从聚合的组合性差距转变为基于稳定原子访问的残余组合失败,将后训练收益分解为三个独立通道:原子稳定性、残余组合和关键深度。在一个跨越四种后训练配方、深度2至11的时间事实链基准上,这种分解揭示出后训练目标以聚合指标所掩盖的方向改变组合能力,并表明关于多跳推理改进的声明应附有原子门控制的组合指标。诊断探针进一步表明,测量到的组合失败中有相当一部分反映了生成时的计算约束,而非永久的组合能力缺失。
查看缓存全文
缓存时间: 2026/05/27 09:08
# 稳定的事实知识并不意味着组合推理
来源:https://arxiv.org/html/2605.26789
Zhe Yu2∗ Wenpeng Xing1,2∗ Yunzhao Wei2 Jie Chen3 Hongzhi Wang4 Xuyang Teng5 Meng Han1,2,6
1浙江大学 2浙江大学滨江研究院 3香港浸会大学 4哈尔滨工业大学 5杭州电子科技大学 6GenTel.io
∗共同第一作者
###### 摘要
后训练通常通过聚合基准分数进行评估,这些分数将多跳推理视为单一能力——仿佛模型正确回答的问题越多,它组合事实的能力就越强。我们证明这一假设可能具有误导性:原子知识在统计上无法区分的配方,其组合行为却相差超过 40 个百分点,我们将这种现象称为*组合崩溃*:即系统性地未能将稳定已知的事实组合成链,而这种失败在聚合指标下不可见。我们引入了一种双门协议,将估计目标从聚合的组合性差距转变为在稳定原子访问条件下的残余组合失败,从而将后训练收益分解为三个独立通道:原子稳定性、残余组合和关键深度。在一个包含四种后训练配方、深度 2–11 的时间事实链基准上,这一分解揭示出后训练目标以聚合指标掩盖的方式改变组合能力,并表明关于多跳推理改进的声明应附带原子门控组合指标。诊断探针进一步显示,测量到的组合失败中有相当一部分反映了生成时的计算约束,而非永久的组合无能。
组合崩溃:稳定的事实知识并不意味着组合推理
Zhe Yu2∗ Wenpeng Xing1,2∗ Yunzhao Wei2 Jie Chen3 Hongzhi Wang4 Xuyang Teng5 Meng Han1,2,6
1浙江大学 2浙江大学滨江研究院 3香港浸会大学 4哈尔滨工业大学 5杭州电子科技大学 6GenTel.io
∗共同第一作者
## 1 引言
当语言模型未能回答一个多跳问题——*电话和飞行,哪个先出现?*——时,有两种可能的解释。要么模型不能可靠地知道日期,要么它知道两者但仍无法比较。这两种情况需要不同的修正:更多的事实知识 vs. 更好的组合推理。然而,标准评估实践将它们视为同一回事。该领域通过像 HotpotQA (Yang et al., 2018 (https://arxiv.org/html/2605.26789#bib.bib17)) 这样的数据集上的聚合基准准确率来评估多跳推理:正确回答更多复合问题的模型被认为更擅长组合事实。*组合性差距* (Press et al., 2023 (https://arxiv.org/html/2605.26789#bib.bib1); Dziri et al., 2023 (https://arxiv.org/html/2605.26789#bib.bib2))——即从单跳到多跳准确率的下降——被广泛用于量化组合失败。但这一指标混淆了两种截然不同的失败模式。模型可能正确回答一次子问题而并非*稳定*地访问底层事实,但一次正确回答并不能保证模型能在更长的链中复现该知识。将整个差距归因于“组合失败”会将原子不稳定性的方差混入所谓的推理缺陷中。先前的工作表明,即使事实存在于训练分布中,知识提取也可能系统性失败 (Allen-Zhu and Li, 2023 (https://arxiv.org/html/2605.26789#bib.bib3)),并且多跳失败可以定位于特定的层级时序问题 (Biran et al., 2024 (https://arxiv.org/html/2605.26789#bib.bib4))。最近关于无捷径潜在多跳评估的工作(SOCRATES;Yang et al. (2025 (https://arxiv.org/html/2605.26789#bib.bib18)))表明,即使原子事实已知,组合成功也会因实体类型的不同而显著变化——这强化了在原子置信度之外衡量组合的必要性。这些研究确立了推理失败独立于记忆的存在——这是我们共享的前提。但它们并未提供一种能在评估时清晰分离两种失败模式的测量协议。
这种混淆并非一个微小的测量问题。两个后训练配方,其原子稳定性差异不到两个百分点,但在最浅的非平凡深度上,残余组合失败可能相差超过 40 个百分点。我们将此称为*组合崩溃*:系统性地未能将稳定已知的事实组合成正确的链,这种失败隐藏在聚合指标下,只有在对原子知识进行控制时才显现。
我们引入了一种*双门协议*,将估计目标从聚合差距转变为在稳定原子访问条件下的残余组合失败。在测量模型是否能组合事实之前,该协议首先验证它是否稳定地拥有每个事实(跨同义转述的一致性)并能单独回答每个子问题。通过两道门的错误为*残余组合失败*:模型稳定地知道各部分,已逐一用语言表达出来,但仍然未能将它们组合起来。通过该协议,后训练收益可分解为三个独立通道:Δ_atom(原子稳定性)、Δ_comp(匹配原子下的残余组合)和Δ_depth(残余失败超过 50% 的深度)。
我们在 D4v2 上实例化该协议,这是一个包含 390 个问题的时序基准,涵盖深度 2–11 的四个任务族。该基准覆盖时序事实链(日期、事件、因果顺序);超出时序推理的领域通用性仍待探索,并通过上下文探针和跨领域试点进行初步检验(§4 (https://arxiv.org/html/2605.26789#S4))。我们评估了 7–13B 规模、涵盖四种后训练配方的六个开放权重模型——基础模型、RLHF (Ouyang et al., 2022 (https://arxiv.org/html/2605.26789#bib.bib6))、SFT 推理轨迹蒸馏和原生结果验证 RL——并运行了一个受控的相同基础 Hu et al. (2022 (https://arxiv.org/html/2605.26789#bib.bib13)) LoRA 干预(SFT-答案、SFT-轨迹、Shao et al. (2024 (https://arxiv.org/html/2605.26789#bib.bib12)) GRPO),将训练目标与基础模型混淆变量隔离。三个发现浮现。第一,基础模型被原子知识过滤,而非组合——其原子门在任意深度上都允许 <5% 的实例通过。第二,在匹配的原子稳定性下,根据训练目标的不同,深度 2 上的残余失败范围从 0% 到 47%,并且在相同数据和计算资源下,结果验证 RL 的表现远超 SFT 蒸馏。第三,在某个组合深度上训练能消除该深度的大部分残余失败差距,但对相邻的留出深度只产生弱迁移。启用链式思维推理可将残余失败减少 3–5 倍(§6 (https://arxiv.org/html/2605.26789#S6)),将许多瓶颈定位在生成时的计算,而非静态知识表示。我们的贡献包括:(i) 一个双门协议,提供更干净的组合测量(扣除原子知识后);(ii) 一个三通道分解,使后训练配方能在对等基础上进行比较;以及 (iii) 一个受控因果干预,隔离后训练特有的组合通道,且深度迁移有限。我们并不声称揭示了后训练的本质;相反,我们提供了一个测量协议,在匹配原子下暴露了不同配方间先前隐藏的变异。
## 2 相关工作
**衡量组合性差距。** Press et al. (2023 (https://arxiv.org/html/2605.26789#bib.bib1)) 形式化了组合性差距,即从单跳到多跳准确率的下降;Dziri et al. (2023 (https://arxiv.org/html/2605.26789#bib.bib2)) 展示了 Transformer 在多跳组合上的性能随链长下降。Yang et al. (2025 (https://arxiv.org/html/2605.26789#bib.bib18)) 引入了绕过表面捷径的潜在多跳探针(SOCRATES),显示即使原子事实已知,组合成功也因实体类型显著变化。这些框架共享一个混淆:单跳基线并未验证事实是否*稳定*可访问——一次正确的子问题答案并不能保证模型在相同事实嵌入链中时能复现该知识。我们的双门协议增加了一个每事实稳定性过滤器,将瞬态检索与稳定知识分离,将群体层面的校正转化为每个案例的合格性测试。
---
**图 1:用于测量残余组合失败的双门协议。**
一个多跳问题被分解为原子事实和对齐的子问题。
I. **原子稳定性**验证每个原子在跨同义转述中的稳定且正确访问。
II. **子问题正确性**验证每个子问题在单独回答时是否正确。
III. **残余组合失败**衡量在通过两道门后,原始多跳问题是否仍然回答错误。
这分离了组合错误与不稳定的知识访问,并支持三通道分解为 Δ_atom、Δ_comp 和 Δ_depth。
**后训练与推理。** RLHF (Ouyang et al., 2022 (https://arxiv.org/html/2605.26789#bib.bib6))、SFT 推理轨迹蒸馏 (Wei et al., 2022 (https://arxiv.org/html/2605.26789#bib.bib16); DeepSeek-AI et al., 2025 (https://arxiv.org/html/2605.26789#bib.bib8)) 和结果验证 RL (Shao et al., 2024 (https://arxiv.org/html/2605.26789#bib.bib12)) 是改进推理的主要范式。先前的工作通过聚合基准分数评估这些配方,这混淆了知识获取与推理改进。我们的三通道分解显示这些配方独立地改变原子稳定性和残余组合:原子稳定性在从基础到指令的跳跃后趋于饱和,而残余组合在匹配原子下跨配方变化 40 个以上的百分点。这种分解与训练目标正交:它提供了一个测量视角,而非建模主张。
**计算与组合。** Biran et al. (2024 (https://arxiv.org/html/2605.26789#bib.bib4)) 将多跳失败定位于层级的时序——模型编码了两个事实但处理第二个过晚。Allen-Zhu and Li (2023 (https://arxiv.org/html/2605.26789#bib.bib3)) 表明,即使事实在训练分布中,知识提取也会系统性失败,而训练中的 CoT 数据可以弥合差距。我们的 CoT 诊断(§6 (https://arxiv.org/html/2605.26789#S6))补充了这些发现:在推理时启用 CoT 可恢复 70–75% 的门通过失败,将许多残余失败定位于生成时的计算而非永久表示缺陷。结合补丁实验(附录 I (https://arxiv.org/html/2605.26789#A9))——该实验发现提示结束表示中信息可忽略——这些结果将瓶颈指向生成过程本身。
## 3 方法
图 1 (https://arxiv.org/html/2605.26789#S2.F1) 总结了流水线。一个组合实例是一个主问题 q,其答案需要 k 个原子事实 a1, ..., ak(深度)。每个原子携带 mi 个同义转述探针以及一个子问题 si,匹配该原子在链中出现的方式。一个实例*通过原子门*当且仅当每个原子在所有同义转述中都被一致回答(使用 Press et al., 2023 (https://arxiv.org/html/2605.26789#bib.bib1) 的一致性匹配器);它*通过子问题门*当且仅当每个 si 在单独回答时都正确。我们的主要量是*残余组合失败率*:通过门的实例中主答案仍然错误的比例。根据构造,它上界了纯粹的组合失败——格式伪影、干扰注意力以及贪婪轨迹退化可能抬高测量值而不反映真正的组合无能(我们在 §7 (https://arxiv.org/html/2605.26789#S7) 中量化了这个裕度)。
给定一个配方 R 和一个匹配的比较器 R′(原子稳定性相差 2 pp 以内),我们将后训练收益分解为三个通道:
Δ_atom(R) = s(M_R) − s(M_R′),
Δ_comp(R) = f(M_R ∣ gate) − f(M_R′ ∣ gate),
Δ_depth(R) = d50(M_R) − d50(M_R′),
其中 s 是原子稳定性,f 是残余组合失败,d50 是 f 首次超过 50% 的深度。当原子稳定性匹配时,Δ_comp 隔离了纯粹的组合收益;Δ_comp 与 Δ_depth 的差距随后使我们能够区分训练数据效应与模型结构效应。
##### 基准。
D4v2 包含 390 个主问题和 2,490 个原子子问题,由四个任务族构建:一个深度 2 的配对排序控制族,以及三个覆盖深度的族(temporal_rank、temporal_successor、temporal_interval_decoy),深度 d ∈ {4,6,8},其中 temporal_interval_decoy 额外采样中间事实计数(d=7,9,11;每类 n=30)。任务族在所需的链结构上不同——排序一组事件、按时间前进、消除重叠间隔——因此相同深度的情况并非难度可互换。为允许在共享深度箱上进行跨族比较,我们将深度 7 的情况与深度 4 分组,深度 9 与深度 6 分组,深度 11 与深度 8 分组(见附录 B (https://arxiv.org/html/2605.26789#A2) 详细理由和完整细分)。另外三个合成任务族(kinship、numerical、spatial)基于虚构实体构建,构成一个独立的评估套件;如 §4 (https://arxiv.org/html/2605.26789#S4) 所述,它们被排除,因为我们的闭卷协议无法在内部原子知识缺失时评估组合。
##### 配方覆盖与评估。
我们评估了四种后训练配方:基础模型、RLHF、SFT 推理轨迹蒸馏和原生结果验证 RL(RLVR),涵盖 7–13B 规模的六个开放权重模型(检查点见附录 C (https://arxiv.org/html/2605.26789#A3))。所有数字均使用 Press et al. 的一致性匹配器;完整的裁决层级和 vLLM 与 HuggingFace 的交叉验证见附录 K (https://arxiv.org/html/2605.26789#A11) 和 H (https://arxiv.org/html/2605.26789#A8)。推理采用贪心策略(T=0),XML 结构化。
## 4 实验与结果
我们报告三项观察结果,它们排除了最明显的替代解释,并隔离了一个后训练特有的组合通道。第一,原子门完全排除了基础模型,因此我们测量的失败不是知识差距(§4 (https://arxiv.org/html/2605.26789#S4),第 1 段)。第二,两个在原子知识上统计上无法区分的配方在最浅的非平凡深度上产生了截然不同的组合表现(第 2 段)。第三,在固定深度内,任务结构使残余失败变化高达 66 个百分点,因此深度并非主要的困难轴(第 3 段)。图 2 (https://arxiv.org/html/2605.26789#S4.F2) 显示了残余组合失败随链深度的变化,带有 bootstrap 95%相似文章
全息记忆用于知识图谱中的零样本组合推理:失败位置与原因的机制研究
本文研究了全息约简表示在知识图谱中零样本组合推理的应用,发现虽然单跳性能强劲,但组合推理仍因叠加记忆中的检索容量和干扰效应而失败,而非绑定-解绑代数的问题。
链条稳固,答案翻转:对抗压力下推理模型中的轨迹-答案分离
本文识别出推理模型中的一种新型失败模式,称为不忠妥协,即在对抗性多轮对话中,思维链保持事实正确,但最终答案翻转错误,揭示了当前评估方法的局限性。
当思维链更明智时:多轮推理模型中的失败模式
本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。
课程学习推理II:组合泛化
本文从理论上分析了课程学习通过将复杂问题分解为更简单的子问题并组合解决方案,如何显著降低学习模拟顺序计算(半自动机)的样本复杂度——相较于直接方法,在监督微调中实现次多项式监督需求,并在可验证奖励的强化学习中实现指数级更弱的覆盖条件。
具体化命题提示解决大型语言模型中的组合-知识二分法
本文提出了具体化命题提示(CPP)框架,通过显式具体化与问题相关的命题来解决LLMs中的组合-知识二分法,显著提升推理性能,尤其在医学和数学基准测试中。