约束优先推理:一种利用答案空间约束进行数学问题求解的免训练协议

arXiv cs.CL 论文

摘要

该论文提出了约束优先推理(CFR),一种免训练的两阶段提示协议,在求解前提取答案空间约束,并检查中间及最终结果是否符合这些约束,从而在竞赛基准测试中提升了数学问题求解性能。

arXiv:2608.05254v1 公告类型:新 摘要:大型语言模型可以推导出看似合理的数学对象,但仍可能违反显式要求——例如,遗漏模约简、返回非整数,或使用错误的编码答案格式。我们引入了约束优先推理(CFR),一种免训练的两阶段提示协议:阶段1提取并总结问题所蕴含的约束,阶段2在求解过程中对照该总结检查中间结果和最终结果。Routed-CFR仅在纯文本正则路由器检测到限制性线索时激活两阶段协议;否则使用直接思维链(CoT)。在AIME、CMIMC、BRUMO和AIMO_AMC上,该方法在多个基座模型上改进了直接CoT。我们进一步报告了约定控制路由实验、匹配提示基线、问题级配对检验、解码鲁棒性、约束质量审计、总token核算以及OlympiadBench评估。这些分析将CFR定位为一种针对性的测试时干预,其收益取决于可恢复的约束和可靠的阶段1提取,而非作为数学推理的通用替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:50

# 一种无需训练的协议,用于在数学问题求解中利用答案空间约束 Source: https://arxiv.org/html/2608.05254 Hongbo Ma1,∗, Bangji Yang2,∗, Yunqian Selina Cheng1,∗, Jiajun Fan2, Hanwen Zhang1, Ge Liu2,† 1Tsinghua University2University of Illinois Urbana\-Champaign ∗Equal contribution†Corresponding author ###### 摘要 大型语言模型可以推导出一个看似合理的数学对象,却仍可能违反显式要求——例如,省略模约简、返回非整数,或使用错误的编码答案形式。我们提出Constraint\-First Reasoning(CFR),一种无需训练的两阶段提示协议:阶段1提取并总结问题蕴含的约束,阶段2在求解时,将中间结果和最终结果与该总结进行核对。Routed\-CFR仅在纯文本正则表达式路由器检测到限制性线索时激活两阶段协议;否则使用直接思维链(CoT)。在AIME、CMIMC、BRUMO和AIMO\_AMC上,该方法在多个骨干模型上提升了直接CoT的性能。我们进一步报告了约定受控的路由实验、匹配的提示基线、问题级配对检验、解码鲁棒性、约束质量审计、总令牌统计以及OlympiadBench评估。这些分析将CFR定位为一种针对性的测试时干预,其收益依赖于可恢复的约束和可靠的阶段1提取,而非作为通用数学推理的替代品。 约束优先推理:一种无需训练的协议,用于在数学问题求解中利用答案空间约束 ## 1引言 竞赛数学问题将约束嵌入自然语言中:“求NN除以1000的余数”、“有多少个正整数满足...”、“将答案表示为p\+qp\+q,其中pp和qq互质”。这些约束定义了*可行答案区域*——所有可能值中一个既小又结构化的子集。忽略这些约束的求解器可能在底层推理正确的情况下,仍然给出违反规定要求的答案。 为什么约束违反如此频繁?我们识别出三个根本原因。第一,*注意力稀释*:在长推理链中,早期的约束信息可能在模型得出最终答案之前逐渐消失(Liu et al., 2024 (https://arxiv.org/html/2608.05254#bib.bib28))。第二,*隐式编码*:在解题轨迹上训练的模型会隐式处理约束——它们可能在求解中途注意到模条件,或在后置步骤检查整数约束——但这种隐式处理在分布偏移下会失效。第三,*格式歧义*:带有编码答案格式的问题(“求m\+nm\+n,其中gcd⁡(m,n)=1\\gcd(m,n)=1”)需要多步后处理,而模型经常跳过或错误应用这些步骤。 参考图1:竞赛数学中的限制性词汇线索。较大的词对应我们的路由器所强调的线索类型,包括整数答案格式、整除性和模条件、边界、极值算子、精确性要求以及计数限制。这些线索启发CFR:在求解之前,先识别任何有效答案必须满足的条件。 当前的推理模型,训练用于生成扩展思维链(DeepSeek\-AI, 2025 (https://arxiv.org/html/2608.05254#bib.bib4); OpenAI, 2024 (https://arxiv.org/html/2608.05254#bib.bib5)),隐式地处理约束。模型可能会遵循一个看似合理的推导,同时直到最后都让答案限制保持隐式;显式约束跟踪的设计目的正是让这些限制在求解过程中始终可见。我们提出Constraint\-First Reasoning(CFR),一种无需训练的协议,使约束处理变得显式且系统化。关键见解是:*在求解之前提取约束,而不是之后*。这反映了人类竞赛实践:经验丰富的参赛者会在尝试解题之前先确定所需的答案形式(Pólya, 1945 (https://arxiv.org/html/2608.05254#bib.bib29))。前置约束识别确保求解器在整个推理链中保持对答案空间要求的意识。 CFR以两个阶段运行: 1. 1\. 约束提取与提示总结:从问题陈述中提取答案空间约束(域、模、奇偶性、边界、格式)和问题结构约束(如不变量或分支条件),然后总结其对求解的意义。 2. 2\. 约束引导求解:在提取的约束下求解,并在每个主要步骤将中间结果与约束规范进行核对。 我们进一步引入Routed\-CFR,它前置一个基于正则表达式的路由器,检查问题文本是否包含限制性词汇线索。没有此类线索的问题绕过该流水线,直接进行标准思维链推理。这个纯粹的语法路由器在生成开始之前决定是否使用完整流水线。 我们的实验使用表1 (https://arxiv.org/html/2608.05254#S4.T1)和表3 (https://arxiv.org/html/2608.05254#S5.T3)作为主要经验证据。详细的统计、路由器和误差分析在附录中报告。它们揭示了清晰且可解释的模式: - •在纯文本路由器下,表1 (https://arxiv.org/html/2608.05254#S4.T1)显示所有四个评估骨干模型在AIME/CMIMC平均增益上均为正;幅度随阶段1的可靠性而变化。 - •表3 (https://arxiv.org/html/2608.05254#S5.T3)在单一评估协议下将CFR与匹配的规划、验证、仅格式和令牌匹配提示替代方案进行比较。 - •附录报告了在移除AIME路由约定并针对多重比较进行校正后的合并问题级分析。 - •表3 (https://arxiv.org/html/2608.05254#S5.T3)明确了准确率\-成本权衡:路由减少但不消除两阶段协议的推理开销。 ### 1\.1评估协议与方法标签 除非另有明确说明,正文中的每个准确率都是pass@1在四次独立运行上的平均值(avg@4)。每次运行对每个问题产生一个答案;我们对于比较中的所有方法使用相同的解码设置、答案提取器和评分脚本。这些主要结果中不使用自洽性、多数投票、best\-of\-kk选择或答案格式过滤。对于配对分析,先对每个问题内的四次pass@1结果取平均,因此统计推断的单位是问题而不是单次生成。附录H (https://arxiv.org/html/2608.05254#A8)保留了一个明确标注的pass@4探索性比较,该比较不与主要的pass@1声明合并或用于支持这些声明。 我们使用Routed\-CFR表示纯文本路由器后接两阶段流水线,使用CFR (always\-on)

相似文章

基于约束锚定的推理轨迹

arXiv cs.AI

提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。

大型模型优势所在:约束引导推理的首要地位

arXiv cs.CL

本文介绍了AdvCluster,一个自动化框架,用于识别和分类大型语言模型相对于小型模型在数学、物理、化学和编程基准测试中的推理优势。研究发现,大型模型在约束引导推理方面表现更佳——识别和组织约束以排除不可行路径并验证中间步骤。

Flow Reasoning Models: 通过迭代自我精化扩展推理能力

arXiv cs.AI

Flow Reasoning Models (FRMs) 为离散流模型在结构化推理任务上引入了一个训练和测试时扩展框架。通过使用 self-verification 和 self-conditioning,FRMs 在 Sudoku 和 Zebra 谜题上达到了近乎100%的求解率,而所需的迭代次数远少于之前的基准模型。