具体化命题提示解决大型语言模型中的组合-知识二分法
摘要
本文提出了具体化命题提示(CPP)框架,通过显式具体化与问题相关的命题来解决LLMs中的组合-知识二分法,显著提升推理性能,尤其在医学和数学基准测试中。
arXiv:2607.08018v1 公告类型:新
摘要:LLMs常常难以平衡组合性与知识性,我们将这一挑战定义为组合-知识二分法。为解决此问题,我们提出了具体化命题提示(CPP)框架,该框架显式具体化与问题相关的命题。结果表明,CPP显著提升了推理性能,特别是在精确知识至关重要的医学基准测试中,同时在强调演绎推理的数学基准测试中也具有竞争力。额外实验表明,CPP可扩展到各种基础模型和参数规模,是一种弥合基于组合与基于知识的方法之间差距的基本范式。因此,CPP通过为逻辑组织和事实依据推理提供坚实基础,解决了组合-知识二分法。
查看缓存全文
缓存时间: 2026/07/10 06:06
# 具体化命题提示解决大语言模型中的组合-知识二分法 来源: https://arxiv.org/html/2607.08018 Changhun Lee1,2, Minguk Jeon211footnotemark:1, Jongkyung Shin2, Chiehyeon Lim2,3 cl4670@cumc\.columbia\.edu1,chlim@posco\-inc\.com3 \{changhun, rzbsys, shinjk1156, chlim\}@unist\.ac\.kr2 1哥伦比亚大学2UNIST3POSCO Holdings ###### 摘要 LLMs 常常难以在组合性与知识性之间取得平衡,我们将这一挑战定义为组合-知识二分法。为了解决这个问题,我们提出了具体化命题提示(CPP),这是一个明确具体化与问题相关命题的框架。结果表明,CPP 显著提升了推理性能,尤其是在需要精确知识的医学基准测试中表现出色,同时在优先考虑演绎推理的数学基准测试中也具有竞争力。额外的实验表明,CPP 可扩展到各种基础模型和参数规模,是一种弥合基于组合与基于知识方法之间差距的基本范式。因此,CPP 通过为逻辑有序且事实有据的推理提供坚实基础,解决了组合-知识二分法的问题。 具体化命题提示解决大语言模型中的组合-知识二分法 Changhun Lee1,2††thanks:同等贡献††thanks:通讯作者, Minguk Jeon211footnotemark:1, Jongkyung Shin2 和 Chiehyeon Lim2,3 cl4670@cumc\.columbia\.edu1,chlim@posco\-inc\.com3 \{changhun, rzbsys, shinjk1156, chlim\}@unist\.ac\.kr2 1哥伦比亚大学2UNIST3POSCO Holdings ## 1 引言 尽管大语言模型(LLMs)取得了巨大成功(Achiam et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib2); Touvron et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib1); Comanici et al., 2025 (https://arxiv.org/html/2607.08018#bib.bib3)),但在推理能力方面,人类智能与 LLMs 之间仍然存在差距。最近提出的思维链(CoT)提示方法(Wei et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib8); Chowdhery et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib7); Kojima et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib26))显著缩小了这一差距。CoT 提示的核心思想是将原理生成(ling-etal-2017-program)与少样本提示(Brown et al., 2020 (https://arxiv.org/html/2607.08018#bib.bib9))结合起来,以所谓“思考”的格式提供给 LLMs。尽管 CoT 提示可以提升 LLMs 的推理能力(Zhou et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib4); xia-etal-2025-beyond),但它仍然存在关键局限性。例如,它无法在常识和多步推理方面达到人类水平(Sprague et al., 2024 (https://arxiv.org/html/2607.08018#bib.bib10)),在数学以外的领域用处不大(Kambhampati et al., 2024 (https://arxiv.org/html/2607.08018#bib.bib12)),甚至可能损害性能(Wang et al., 2024 (https://arxiv.org/html/2607.08018#bib.bib39); Nakkiran et al., 2025 (https://arxiv.org/html/2607.08018#bib.bib17)),并且其计算成本超过了所带来的性能提升(Sprague et al., 2025 (https://arxiv.org/html/2607.08018#bib.bib11))。此外,由于 CoT 由易产生幻觉的 LLMs 生成,因此存在风险,即 LLMs 利用这些幻觉 CoT 生成错误答案时,会诱导出错误的事后合理化(即精妙的幻觉)(Huang et al., 2025a (https://arxiv.org/html/2607.08018#bib.bib19); cheng-etal-2025-chain; lewis-lim-etal-2025-analysing; Arcuschin et al., 2025 (https://arxiv.org/html/2607.08018#bib.bib18))。 针对这些局限性,研究者提出了先进的 CoT 技术。一种主要方法侧重于组织 LLM 推理的结构。例如,由易到难提示将复杂问题分解为更简单的子问题(Zhou et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib4)),先计划后解决先制定计划再解决问题(wang-etal-2023-plan),思路线索将混乱的上下文分割成可管理的部分(Zhou et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib46)),元提示优先考虑如何思考的结构化模板而非思考什么的具体示例(Zhang et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib20))。另一种方法侧重于检索对 LLM 推理有用的证据。类比提示在解决问题前生成特定于问题的范例或知识(Yasunaga et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib21)),自我知识外显化(SKE)明确生成可验证的知识(Huang et al., 2025b (https://arxiv.org/html/2607.08018#bib.bib14)),系统-2-注意力重新生成与问题相关的上下文(Weston and Sukhbaatar, 2023 (https://arxiv.org/html/2607.08018#bib.bib45))。这两种方法都成功提升了 LLMs 的推理能力。然而,它们主要分化为两个不同的方向——组合性和知识性——分别优先考虑推理结构和有根据的证据。前者因缺乏真值辨别能力而容易产生精妙的幻觉,因此在需要精确知识进行准确推理的临床问题上表现不佳。相反,后者因缺乏逻辑模式而容易产生不规律的演绎,因此在需要谓词逻辑构建推理链的数学问题上表现不佳。为了弥合这一差距,我们提出了具体化命题提示(CPP),这是一个旨在整合这两个轴的框架,其中组合性代表陈述的逻辑模式,而知识性指陈述的真值。在本研究中,我们证明,与其他仅关注组合性或知识性的提示方法相比,CPP 在问答(QA)基准测试中实现了更优的性能。实验涵盖八个数据集,横跨三个 QA 领域:常识、数学和医学。 我们的贡献如下: - • 我们提出了一种简单而强大的方法,称为具体化命题提示(CPP),旨在通过整合组合性和知识性这两个轴来凸显相关命题。 - • 我们证明,在包括常识、数学和医学基准测试的多个 QA 数据集上,CPP 优于或与其他提示方法相竞争。 - • 我们展示了 CPP 在各种基础模型(包括 Llama、Qwen、Phi、Gemma 和 Mistral)上表现一致,并且可扩展到 7B 到 72B 的模型规模。 ## 2 预备知识 在本工作中,我们考虑 LLMs 生成响应 \(\hat{y}\) 来回答问题 \(q\) 的 QA 任务。数据集由真实的问答对组成:\(\mathcal{D}=\{(q_{i},a_{i})\}_{i=1}^{N}\),其中 \(a_{i}\) 表示第 \(i\) 个问题 \(q_{i}\) 的答案。 ### 2.1 基于提示的 QA 任务 大语言模型构建下一个 token 的概率分布:\(\mathcal{M}(y)=\prod_{t=1}^{T}P(y_{t}|y_{t-1})\),并通过自回归采样 token 生成完整句子:\(\hat{y}_{1:T} \sim \mathcal{M}(y)\)。在 QA 任务的上下文中,概率分布扩展为条件分布:\(\mathcal{M}_{\phi}(y|q)=\prod_{t=1}^{T}P(y_{t}|y_{t-1},q,\phi)\),其中 \(q\) 是问题,\(\phi\) 是提示。提示包含描述目标任务的任务指令 \(\mathcal{I}_{\text{task}}\)。QA 任务随后被构建为基于提示的生成过程: \(\hat{a} = \operatorname{extract}(\hat{y}_{1:T}) \quad \text{where} \quad \hat{y}_{1:T} \sim \mathcal{M}(\cdot|\mathcal{I}_{\text{task}}, q)\) 这里,\(\operatorname{extract}(\cdot)\) 是一个解析函数,从 \(\hat{y}_{1:T}\) 中提取与答案相关的内容。 ### 2.2 思维链提示 思维链(CoT)提示是一种新兴技术,通过利用格式化的提示(即“思考”)来增强 LLMs 的推理能力(Wei et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib8); Chowdhery et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib7); Kojima et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib26))。这里的“思考”指的是 LLMs 自行生成的中间推理步骤(xia-etal-2025-beyond)。具体来说,配备 CoT 提示的 LLMs 生成由 \(K\) 个推理步骤组成的 token 序列 \(\hat{y}_{1:t-1}\),然后是响应 \(\hat{y}_{t:T}\): \(\hat{y}_{1:T} = \big[\underbrace{\hat{r}^{(1)},\cdots,\hat{r}^{(K)}}_{=\ \hat{y}_{1:t-1}},\hat{y}_{t:T}\big] \sim \mathcal{M}(\cdot|\mathcal{I}_{\text{task}},\mathcal{I}_{\text{cot}}, q)\) 其中 \(\mathcal{I}_{\text{cot}}\) 是 CoT 指令,通常为“让我们一步步思考”(Kojima et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib26))。该指令引导模型生成思维链(或原理)和最终响应。CoT 提示不仅增强了模型解决复杂任务的能力(Wang et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib25); lyu-etal-2023-faithful),而且还作为可解释的窗口,为模型的推理过程提供了透明性(Wei et al., 2022 (https://arxiv.org/html/2607.08018#bib.bib8); Yu et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib24))。 ### 2.3 基于 DSPy 的提示优化 与依赖手动提示工程的标准提示方法不同,DSPy 自动优化提示(Khattab et al., 2023 (https://arxiv.org/html/2607.08018#bib.bib28); opsahl-ong-etal-2024-optimizing)。DSPy 框架的核心是参数化提示 \(\phi\),即一系列指令(例如 \(\phi=[\mathcal{I}_{\text{task}};\mathcal{I}_{\text{cot}}]\)),并根据验证指标 \(\mathcal{R}\) 对其进行优化。优化过程由“优化器”执行,其目标是找到最优提示 \(\phi^{*}\),使得验证指标在数据分布 \((q,a) \sim \mathcal{D}\) 上的期望值最大: \(\phi^{*} = \operatorname{argmax}_{\phi} \mathbb{E}_{\begin{subarray}{c}(q,a) \sim \mathcal{D} \\ \hat{y} \sim \mathcal{M}_{\phi}(\cdot \mid q)\end{subarray}} \left[\mathcal{R}(\operatorname{extract}(\hat{y}), a)\right]\), 其中 \(\hat{y} \sim \mathcal{M}_{\phi}(\cdot \mid q)\) 是模型输出,\(\operatorname{extract}(\hat{y})\) 表示解析后的答案 \(\hat{a}\),而 \(\mathcal{R}(\hat{a}, a) \triangleq \mathbb{I}[\hat{a}=a]\) 是一个指示函数,如果答案正确则返回 1,否则返回 0。因此,我们获得了生成正确答案的优化模型 \(\mathcal{M}_{\phi^{*}}\)。 具体化命题示例 | QA 领域 | 真阳性 (TP) \((+,1)\) | 肯定事实 | 常识 | 纽约是美国的一个城市 | |---------|-----------------------|----------|------|------------------------| | | 数学 | 三角形内角和为 180° | | | 医学 | 抗生素治疗链球菌性喉炎 | | 真阴性 (TN) \((-,0)\) | 否定谬误 | 常识 | 巴黎不是美国的一个城市 | | | 数学 | 三角形内角和不是 200° | | | 医学 | 抗生素不治疗普通感冒 | | 假阳性 (FP) \((+,0)\) | 肯定谬误 | 常识 | 巴黎是美国的一个城市 | | | 数学 | 三角形内角和为 200° | | | 医学 | 抗生素治疗普通感冒 | | 假阴性 (FN) \((-,1)\) | 否定事实 | 常识 | 纽约不是美国的一个城市 | | | 数学 | 三角形内角和不是 180° | | | 医学 | 抗生素不治疗链球菌性喉炎 |
表 1:命题类别及相应示例。根据命题定义(例如“肯定事实”),命题模型将问题相关的命题具体化(例如“纽约是美国的一个城市”),并传递给答案模型,从而使其基于具体命题给出答案。
## 3 问题陈述
#### 挑战。提升 LLMs 推理能力的主要障碍源于组合-知识二分法。这种二分法导致现有研究明显极化:基于组合的方法(例如由易到难、先计划后解决等)优先考虑组织良好的推理结构以增强组合性,而基于知识的方法(例如类比提示、自我知识外显化等)侧重于有根据的证据以增强知识性。这种极化使得 LLMs 要么容易产生精妙的幻觉,要么容易产生不规律的演绎。具体来说,基于组合的方法因证据不足而有肯定谬误的风险,而基于知识的方法因逻辑推理碎片化而有否定事实的风险。
#### 公式化。我们工作的主要目标是通过解决组合-知识二分法来提升 LLMs 在 QA 任务中的推理能力。为此,我们专注于具体化问题背后的命题。具体来说,我们制定了一个命题分类法,系统地将陈述的逻辑模式(即组合性)与陈述的真值(即知识性)对齐。这里,逻辑模式将命题的语法定义为肯定 (+) 或否定 (-),而真值决定该命题是事实 (1) 还是谬误 (0)。基于此分类法,我们将命题类别定义如下:
1. (1) 真阳性 \((+,1)\) (肯定事实):正确包含真实信息。
2. (2) 真阴性 \((-,0)\) (否定谬误):正确排除虚假信息。
3. (3) 假阳性 \((+,0)\) (肯定谬误):错误包含虚假信息。
4. (4) 假阴性 \((-,1)\) (否定事实):错误排除真实信息。
表1 (https://arxiv.org/html/2607.08018#S2.T1) 提供了按类别划分的具体化命题的定义和示例。更多细节请参考附录 A (https://arxiv.org/html/2607.08018#A1)。
## 4 方法
参见说明
图 1:具体化命题提示(CPP)框架概览。CPP 框架包含三个阶段:(1) 命题生成,将相关命题具体化为四个类别(TP、TN、FP、FN)以揭示潜在推理路径;(2) 原理与答案生成,生成的命题引导模型得出最终答案;(3) 提示优化,使用 DSPy 优化器基于命题质量和答案准确性的总奖励联合更新提示。
在本节中,我们提出具体化命题提示(CPP),一种简单而强大的提示技术,旨在增强 LLMs 的推理能力。该方法根据命题类别系统地具体化与问题相关的命题。图1 (https://arxiv.org/html/2607.08018#S4.F1) 描述了 CPP 框架的三个阶段。在第一阶段,相似文章
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
大语言模型数学问题求解中可执行推理约束下的表示鲁棒性
本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
通过推理空间压缩的结构化理由蒸馏
本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。