模仿游戏:当LLMs通过代码中心推理数据合成学会像程序一样推理

arXiv cs.CL 论文

摘要

MIMIC是一个框架,它使用可执行代码为LLMs合成推理轨迹,通过代码工具奖励增强其确定性推理,并在推理基准测试中取得改进的性能。

arXiv:2609.16076v1 公告类型:新 摘要:大型语言模型(LLMs)在编程任务上表现出色,但在自然语言的确定性、细粒度推理方面经常失败,严重依赖语义近似而非稳健的符号执行。为弥合这一差距,我们提出了MIMIC,一个利用可执行代码作为推理数据合成严格介质的框架。MIMIC通过叙事融合、代码引导测试合成和动态代码仪器化,从根本上将算法转化为可验证的推理轨迹。关键地,这些显式的中间执行状态自然形成了代码工具奖励(CIR),为强化学习提供了密集、高保真的过程监督,无需外部奖励模型。广泛评估显示,通过SFT和GRPO在合成数据集上训练的模型取得了显著、一致的提升。我们的方法在一般推理、复杂数学基准测试和细粒度确定性任务中显著提高了准确性,表明可执行代码的程序严谨性能有效解锁和增强LLMs的泛化推理能力。我们的代码和数据可在 https://github.com/zjy1298/MIMIC 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:43

# 模仿游戏:当大语言模型通过以代码为中心的推理数据合成学会程序化推理  
来源:https://arxiv.org/html/2609.16076  

张金阳 廖伟斌  
单位:北京大学计算机科学学院  
邮箱:[[email protected]](mailto:[email protected])  
鲍柯钦 李思航 王少博  
单位:阿里巴巴集团 通义团队 | 上海交通大学 EPIC 实验室  
叶沐阳  
单位:浙江大学计算机科学与技术学院  
丁泓鑫  
单位:北京大学计算机科学学院  
方越  
单位:北京大学计算机科学学院  
唐天一 黄飞 杨可欣††thanks:通讯作者。工作完成于张金阳在阿里巴巴集团通义团队实习期间。  
任行章 刘第河  

#### 摘要  
大型语言模型(LLMs)擅长编程任务,但常常在需要确定性、细粒度推理的自然语言任务中失败,高度依赖语义近似而非稳健的符号执行。为弥合这一差距,我们提出MIMIC框架,该框架利用可执行代码作为推理数据合成的严格媒介。MIMIC通过叙事融合、代码引导测试合成与动态代码插桩,从根本上将算法转化为可验证的推理轨迹。关键的是,这些明确的中间执行状态自然形成了**代码插桩奖励(CIR)**,为强化学习提供了无需外部奖励模型的高保真过程监督。大量评估表明,通过SFT和GRPO在我们的合成数据集上训练的模型实现了显著且一致的性能提升。该方法显著提高了通用推理、复杂数学基准测试和细粒度确定性任务的准确性,证明可执行代码的程序化严谨性能有效释放并增强LLMs的通用推理能力。我们的代码和数据已开源至:https://github.com/zjy1298/MIMIC  

## 1 引言  
> “不善于计算的人仍可能成为一流数学家,但对数学完全没有感觉的人最多只能成为伟大的计算者。” —— 诺瓦利斯  

见图注图1:LLMs的悖论:尽管它们擅长复杂的编程逻辑,却常在基础的确定性自然语言推理任务上失败。MIMIC通过利用可执行代码生成减轻幻觉的推理轨迹来弥合这一鸿沟。  

大型语言模型(LLMs)Xu等人(2025)(https://arxiv.org/html/2609.16076#bib.bib53);Liao等人(2025)(https://arxiv.org/html/2609.16076#bib.bib52);Zhang等人(2026b)(https://arxiv.org/html/2609.16076#bib.bib68);Ding等人(2025)(https://arxiv.org/html/2609.16076#bib.bib72)已在形式化环境中展现出卓越能力,常在竞赛编程基准和代码合成任务中超越人类基准水平Liu等人(2024)(https://arxiv.org/html/2609.16076#bib.bib55);Hurst等人(2024)(https://arxiv.org/html/2609.16076#bib.bib54);Zhang等人(2025a)(https://arxiv.org/html/2609.16076#bib.bib67)。然而,一个显著的悖论持续存在:能够编写复杂动态规划解决方案的相同模型,在需要基本、细粒度符号保真度的自然语言任务中却常失败Zhou等人(2024)(https://arxiv.org/html/2609.16076#bib.bib57);Yu等人(2024b)(https://arxiv.org/html/2609.16076#bib.bib58)。它们在任何简单程序都能完美执行的确定性操作上遇到困难,例如比较数值9.9和9.11Huang等人(2026)(https://arxiv.org/html/2609.16076#bib.bib56);Zhang等人(2026a)(https://arxiv.org/html/2609.16076#bib.bib69)、跟踪顺序状态转换,或计算单词中某个字符的精确出现次数(如图1(https://arxiv.org/html/2609.16076#S1.F1)所示)。这种不对称性表明,当前LLMs的“推理”能力主要由近似的语义模式匹配驱动,而非内化的符号执行Dziri等人(2023)(https://arxiv.org/html/2609.16076#bib.bib50);Mirzadeh等人(2025)(https://arxiv.org/html/2609.16076#bib.bib51)。尽管主流研究方向试图在自然语言领域内增强推理能力(例如通过思维链提示或验证器)以提升编码能力Chen等人(2022a)(https://arxiv.org/html/2609.16076#bib.bib47);Wei等人(2022)(https://arxiv.org/html/2609.16076#bib.bib48);Chen等人(2024)(https://arxiv.org/html/2609.16076#bib.bib49);Liao等人(2026b)(https://arxiv.org/html/2609.16076#bib.bib71),但反向路径——利用模型强大的*编码*能力来提升其*通用推理*能力——仍待深入探索Yang等人(2025b)(https://arxiv.org/html/2609.16076#bib.bib40)。其基本前提是,已通过验证的可执行代码本身蕴含了LLMs在自然语言推理中所缺乏的严谨、逐步逻辑推演。  

与先前主要研究如何将代码或执行信号转移到推理的工作不同,我们认为竞赛编程问题的表面形式本身会导致捷径记忆化,使模型回忆编程模板而非执行可迁移的自然语言推理。这促使MIMIC作为一个去偏差框架被提出:它移除编程特定提示,同时保留底层可执行的推理过程。然而,将竞赛编程知识转化为通用推理训练数据带来了巨大挑战。我们初步调查表明,简单地向模型提供原始编程问题会触发表面的“记忆幻觉”。Janiak等人(2025)(https://arxiv.org/html/2609.16076#bib.bib60);Sun等人(2026)(https://arxiv.org/html/2609.16076#bib.bib59)模型并非通过逻辑进行推理,而是识别竞赛编程任务的结构化格式,并试图从其预训练语料库中重构记忆化的代码模板,从而绕过实际的推理过程Guo等人(2024)(https://arxiv.org/html/2609.16076#bib.bib61);Wang等人(2026)(https://arxiv.org/html/2609.16076#bib.bib70)。此外,标准的数据合成流程通常依赖更强的LLMs来构造推理轨迹,这不可避免地在中间步骤注入静默的事实错误和计算幻觉Gomez-Villa等人(2022)(https://arxiv.org/html/2609.16076#bib.bib62)。这引出了我们的主要研究问题:**如何系统地将可执行代码的确定性、程序化严谨性提炼到自然语言推理轨迹中,同时防止模型通过记忆化的编码模式绕过推理?**  

为解决此问题,我们提出MIMIC(从机器执行的插桩代码中挖掘智能),这是一个端到端的合成框架,旨在弥合“编码→推理”的鸿沟。MIMIC通过严格分工保证计算正确性:逻辑由语言模型阐述,但计算由确定性代码执行保证。具体而言,我们的框架通过三个核心方法创新解决上述挑战:  

1. **通过叙事融合防止捷径记忆化**:为打破触发回忆的编程问题表面模式,MIMIC从源问题中移除所有程序化痕迹,并将其核心数学逻辑与多样化的真实语料库融合。这将算法挑战转化为自包含、现实的自然语言考试题目。  
2. **通过代码引导合成确保泛化覆盖**:MIMIC不依赖盲目随机采样,而是直接分析已通过代码的控制流边界,以合成针对性的对抗性和引导随机测试用例。这确保生成的推理场景深入探测逻辑分支,而非表面规模。  
3. **通过轨迹锚定的思维链消除幻觉**:为生成可验证的推理轨迹,MIMIC使用语义探针对已通过代码进行动态插桩。执行此插桩代码会产生确定性的中间状态序列。然后,自然语言思维链严格锚定于这些明确的执行痕迹,确保每个量化声明都基于计算现实。这些中间状态进一步作为强化学习中*过程级奖励信号*的自然来源,提供比二元结果奖励更密集的监督,而无需单独的奖励模型。  

通过解决这些结构性问题,MIMIC生成了高质量、减轻幻觉的推理数据,系统性地提升了LLMs在通用推理和数学基准测试中的表现,展示了代码理解与自然语言推理之间深刻的双向对齐。  

总之,我们的主要贡献有三方面:  
- •**概念洞见**:我们指出了LLMs强大形式化编码能力与自然语言推理失败之间的关键差距。我们揭示了“记忆幻觉”,并展示了确定性代码执行如何成为真正推理的可靠锚点。  
- •**方法论**:我们提出MIMIC将代码转化为减轻幻觉的推理轨迹。此外,我们引入了**代码插桩奖励**,利用执行检查点为强化学习提供密集的过程级监督。  
- •**实证有效性**:大量评估表明,在我们合成数据上训练的SFT和GRPO模型在多样化的数学、通用推理和细粒度符号基准测试中均取得了显著、一致的提升。  

## 2 相关工作  
#### 合成推理数据与可验证奖励训练。近期工作通过增强、大规模整理或问题生成研究合成推理数据,主要集中在数学领域Yu等人(2024a)(https://arxiv.org/html/2609.16076#bib.bib30);Luo等人(2023)(https://arxiv.org/html/2609.16076#bib.bib31);LI等人(2024)(https://arxiv.org/html/2609.16076#bib.bib16);Toshniwal等人(2024)(https://arxiv.org/html/2609.16076#bib.bib33);Ding等人(2024)(https://arxiv.org/html/2609.16076#bib.bib34);Muennighoff等人(2025)(https://arxiv.org/html/2609.16076#bib.bib45);Ye等人(2025)(https://arxiv.org/html/2609.16076#bib.bib46)。相关工作还构建了基于规则的可验证逻辑和谜题任务Liu等人(2025)(https://arxiv.org/html/2609.16076#bib.bib66);Chen等人(2026)(https://arxiv.org/html/2609.16076#bib.bib44);Ding等人(2026b)(https://arxiv.org/html/2609.16076#bib.bib73)。同时,来自可验证奖励的强化学习已成为一种有前景的推理方案,范围从纯粹基于结果的RL到使用奖励模型、人工标注、蒙特卡洛估计或搜索进行过程监督Guo等人(2025)(https://arxiv.org/html/2609.16076#bib.bib15);Abel(2019)(https://arxiv.org/html/2609.16076#bib.bib35);Hu等人(2026)(https://arxiv.org/html/2609.16076#bib.bib36);Zhang等人(2025b)(https://arxiv.org/html/2609.16076#bib.bib28);Zheng等人(2024a)(https://arxiv.org/html/2609.16076#bib.bib27);Wang等人(2024a)(https://arxiv.org/html/2609.16076#bib.bib29);Ding等人(2026a)(https://arxiv.org/html/2609.16076#bib.bib74);Liao等人(2026a)(https://arxiv.org/html/2609.16076#bib.bib75)。然而,先前工作通常依赖数学验证器或单独训练的过程奖励模型,而我们使用程序作为可执行预言机,同时提供黄金输出和可验证的中间信号。  

#### 代码与推理。另一条独立的工作线使用代码来支持推理Yang等人(2025b)(https://arxiv.org/html/2609.16076#bib.bib40),要么作为推理时工具Gao等人(2023)(https://arxiv.org/html/2609.16076#bib.bib37);Chen等人(2022b)(https://arxiv.org/html/2609.16076#bib.bib38);Lv等人(2024)(https://arxiv.org/html/2609.16076#bib.bib39),要么作为编程基准中的评估基础Chen等人(2021)(https://arxiv.org/html/2609.16076#bib.bib11);Austin等人(2021)(https://arxiv.org/html/2609.16076#bib.bib12),或作为输入-输出推理任务的来源Gu等人(2024)(https://arxiv.org/html/2609.16076#bib.bib13);Bao等人(2025)(https://arxiv.org/html/2609.16076#bib.bib63)。近期工作也使用算法问题、执行监督或合成可验证数据来提升推理Bao等人(2025)(https://arxiv.org/html/2609.16076#bib.bib63);Chen等人(2025)(https://arxiv.org/html/2609.16076#bib.bib64);Jung等人(2025)(https://arxiv.org/html/2609.16076#bib.bib65);Liu等人(2025)(https://arxiv.org/html/2609.16076#bib.bib66);Chen等人(2026)(https://arxiv.org/html/2609.16076#bib.bib44)。**相比之下,我们不使用原始或轻度转换形式的算法问题作为监督。而是将其可执行逻辑移植到自然叙事中,减少编程特定偏差,同时保留可验证的推理结构。**  

#### 部分简单任务上的推理失败。近期基准测试显示,LLMs在对确定性程序和人类而言微不足道的任务上仍然薄弱Malek等人(2025)(https://arxiv.org/html/2609.16076#bib.bib32),包括基本字符串操作、字符级推理和基于文本的迷宫导航Wang等人(2025)(https://arxiv.org/html/2609.16076#bib.bib24);Uzan和Pinter(2026)(https://arxiv.org/html/2609.16076#bib.bib26);Dao和Vu(2025)(https://arxiv.org/html/2609.16076#bib.bib25)。一些研究将这些失败部分归因于分词导致的符号单元与模型处理单元之间的不匹配Zhang等人(2024)(https://arxiv.org/html/2609.16076#bib.bib42);Singh和Strouse(2024)(https://arxiv.org/html/2609.16076#bib.bib41);Fu等人(2024)(https://arxiv.org/html/2609.16076#bib.bib43)。**这一差距激发了我们的研究设置:我们针对代码上简单但推理上脆弱的任务,并使用基于程序的监督来改进它们。**  

## 3 方法论  
见图注图2:MIMIC框架概览。它通过四阶段流程将原始算法问题转化为可验证的推理数据:(1)问题分类与数学核心提取,(2)通过叙事融合进行问题合成,(3)代码引导的测试合成与叙事输入融合,以及(4)轨迹锚定的思维链(CoT)合成。  

### 3.1 框架概述与符号定义  
我们形式化定义了提出的框架MIMIC的组件。设$\mathbb{P}$表示原始竞赛编程问题的域。每个问题$p \in \mathbb{P}$参数化为元组$p = (\mathcal{S}_p, \mathcal{I}_p, \mathcal{O}_p, f_p)$,其中$\mathcal{S}_p \in \Sigma$表示通用文本空间$\Sigma$内的原始自然语言问题陈述,$\mathcal{I}_p$是有效输入空间,$\mathcal{O}_p$是目标输出空间,$f_p: \mathcal{I}_p \to \mathcal{O}_p \in \mathbb{F}$表示已通过代码(AC),代表通用程序空间$\mathbb{F}$内的真实确定性执行映射。  

为将原始算法元组$p$转化为稳健、减轻幻觉的自然语言推理对集合,MIMIC执行一个顺序的四阶段流程(见图2(https://arxiv.org/html/2609.16076#S3.F2)):  
(1)问题收集与数学核心提取,(2)通过叙事融合进行问题合成,

相似文章

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

学习如何让大语言模型进行推理

OpenAI Blog

OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。