@jxmnop:有些关于开放权重模型蒸馏的非常有趣的传闻(Kimi、Qwen、M…

X AI KOLs Timeline 论文

摘要

一位研究者讨论了关于中国实验室从 Claude Code 和 Codex 逆向工程出推理轨迹以改进开放权重模型的传闻,并分享了一篇关于 Trace Inversion 模型的论文,该模型可以从输出中重建推理轨迹。

有一些关于开放权重模型(Kimi、Qwen、Minimax 等)蒸馏的非常有趣的传闻,而且它们与我的博士研究密切相关 叙事 [推测]: • 好的蒸馏依赖于推理轨迹,这些轨迹通常对用户隐藏 • 中国实验室在2026年初发现了如何从 Claude Code 和 Codex 逆向工程推理 • 他们因此能够收集到大量*包含推理轨迹*的长期任务数据 • 这一越狱导致了我们在过去几个月享受到的新的开源模型浪潮 我不确定这有多真实,但推理的可提取性似乎是开放模型未来面临的一个巨大不确定性 我尤其好奇拥有推理的重要性有多大。这一点(加上 Anthropic 关于蒸馏攻击的言论)表明推理链对于蒸馏模型能力至关重要。 我们的研究(http://arxiv.org/abs/2603.07267)发现了不同的情况:如果你训练一个高质量的推理逆向模型,通常很容易从前沿模型的输出中重建出有用的轨迹。 弄清楚如何近似前沿模型的推理轨迹,可能会成为开放权重模型的一个生存性问题。
查看原文
查看缓存全文

缓存时间: 2026/08/11 03:39

最近有一些非常有趣的传言,涉及开放权重模型(Kimi、Qwen、Minimax 等)的蒸馏,而且它们和我的博士工作高度相关。这个叙事(推测性的)是这样的:

• 好的蒸馏依赖于推理轨迹,而这些轨迹通常对用户隐藏
• 中国实验室在 2026 年初弄清楚了如何从 Claude Code 和 Codex 逆向工程出推理过程
• 他们因此收集到了大量带有推理轨迹的长时程数据
• 这种越狱带来了过去几个月我们一直享受的新一波开源模型

我不确定这有多真实,但推理可提取性似乎是一个围绕开源模型未来的巨大不确定性。我很好奇拥有推理过程到底有多重要。这一点(加上 Anthropic 关于蒸馏攻击的言论)表明,推理链对于蒸馏模型能力至关重要。我们的研究(http://arxiv.org/abs/2603.07267)发现了不同的东西:如果你训练一个高质量的推理反转模型(reasoning inverter),通常很容易根据前沿模型的输出重建出有用的轨迹。搞清楚如何近似前沿模型的推理轨迹,可能会成为开放权重模型的一个事关存亡的问题。


如何在没有推理轨迹的情况下窃取推理

Source: https://arxiv.org/html/2603.07267

摘要

许多大语言模型 (LLMs) 在生成答案时会使用推理,但不会透露其完整的推理轨迹(即思维链),而是只输出最终答案和简短的推理摘要。为了证明隐藏推理轨迹并不能阻止用户“窃取”模型的推理能力,我们引入了*轨迹反转(Trace Inversion)*模型,该模型仅根据目标模型暴露的输入、答案以及(可选)推理摘要,生成详细的合成推理轨迹。我们证明:(1) 轨迹反转模型合成的轨迹与真实推理轨迹(如果有的话)有很高的重叠度;(2) 在反转轨迹上微调学生模型能显著提升其推理能力,并使得从专有的、黑盒的大语言模型中进行蒸馏成为可能。

图 1:针对 GPT-5.4 mini 的轨迹反转示例。仅根据来自商业黑盒模型的输入、最终答案和推理摘要,轨迹反转就能合成一条详细的推理轨迹,可用于对学生模型进行监督微调。

1 引言

具备显式推理能力的大语言模型 (LLMs) 在数学、编程和科学分析任务上表现良好。通过监督微调、指令微调和强化学习进行训练后,这些模型会生成多步内部推理轨迹(即思维链),并最终得到答案 (wei2022chain, (https://arxiv.org/html/2603.07267#bib.bib40); ouyang2022training, (https://arxiv.org/html/2603.07267#bib.bib31); chen2025skip, (https://arxiv.org/html/2603.07267#bib.bib7))。在推理时,这些轨迹将复杂问题分解为中间步骤。在训练时,它们有助于能力迁移。在教师模型生成的逐步推理轨迹上微调学生模型,可以迁移教师模型的大部分推理能力,其效果显著优于仅基于最终答案的微调 (hinton2015distilling, (https://arxiv.org/html/2603.07267#bib.bib15); gou2021knowledge, (https://arxiv.org/html/2603.07267#bib.bib9); shridhar2023distilling, (https://arxiv.org/html/2603.07267#bib.bib35); chen2025skip, (https://arxiv.org/html/2603.07267#bib.bib7))。

暴露完整的思维链会带来潜在的知识产权风险。例如,在 2026 年 2 月,Anthropic 指控几家竞争实验室进行了大规模蒸馏活动,据称这些活动从 Anthropic 的推理模型中获取数据并用于训练 (anthropic_distillation_2026, (https://arxiv.org/html/2603.07267#bib.bib2))。此外,推理轨迹可能包含敏感的系统提示词、安全策略或私人上下文信息 (green2025leaky, (https://arxiv.org/html/2603.07267#bib.bib10); deepseek_exploit, (https://arxiv.org/html/2603.07267#bib.bib16); zhou2025hidden, (https://arxiv.org/html/2603.07267#bib.bib45))。为降低这些风险,商业 API 通常只显示简短的推理摘要和最终答案 (openai_reasoning_docs, (https://arxiv.org/html/2603.07267#bib.bib29); gemini_thoughts_docs, (https://arxiv.org/html/2603.07267#bib.bib8); anthropic_extended_thinking, (https://arxiv.org/html/2603.07267#bib.bib1))。这背后的假设是:用摘要替代详细思维链,既能保留推理模型的实用优势,又能防止能力窃取。

在本文中,我们挑战了这一假设。我们引入了*轨迹反转(Trace Inversion)*框架,它仅根据推理模型暴露的最终答案以及(可选)压缩摘要(图 1)来合成详细的推理轨迹。我们的反转模型生成的轨迹与真实轨迹非常相似(例如,对于 DeepSeek-R1 轨迹,词元长度恢复率达 81%,词元重叠 F1 分数为 52.76,即使反转模型是在一个弱得多的替代模型上训练的)。最重要的是,即使黑盒教师模型不透露其推理过程,并且比学生模型和反转模型都更强,反转轨迹也能“教”学生模型如何推理。在数学、科学推理和编程基准上,基于反转轨迹微调的模型优于基于 (a) 替代推理轨迹或 (b) 其他模型的答案和推理摘要微调的模型。这表明隐藏思维链并不能阻止用户窃取模型的推理能力。

例如,用从 gpt-5.4-mini-2026-03-17(GPT-5.4 mini)——一个更强大的商业黑盒模型——的答案和摘要中反转出来的轨迹微调 Qwen-2.5-7B-Instruct(由较弱的 DeepSeek-R1-Distill-Qwen-1.5B 执行反转),在 JEEBench 上达到 31.6% 的准确率;而用 R1-Distill 自身的推理轨迹微调则只有 19.7%。用基于 DeepSeek-R1 的反转模型从 GPT-5.4 mini 反转出的轨迹微调 Llama-3.1-8B-Instruct,在 MATH500 上达到 52.4% 的准确率;而用 GPT-5.4 mini 的推理摘要和答案微调则只有 16.4%。在某些情况下,用反转轨迹微调甚至比用真实轨迹取得更好的性能(真实轨迹可能包含回溯和死胡同,而反转轨迹通常是比较干净的向前推理)。

2 背景与相关工作

推理模型。 许多现代大语言模型依赖显式的多步推理。思维链(CoT)提示表明,引出中间推理步骤能大幅提升在算术、逻辑和符号基准上的表现 (wei2022chain, (https://arxiv.org/html/2603.07267#bib.bib40); kojima2022large, (https://arxiv.org/html/2603.07267#bib.bib19))。后续工作表明,当模型被引导生成连贯的中间步骤而不仅仅是最终答案时,准确率和鲁棒性都会有所提升 (wang2022self, (https://arxiv.org/html/2603.07267#bib.bib39))。指令微调和强化学习(RL)可以纳入面向推理的目标 (ouyang2022training, (https://arxiv.org/html/2603.07267#bib.bib31); bai2022training, (https://arxiv.org/html/2603.07267#bib.bib4)),例如在 DeepSeek-R1 (guo2025deepseek, (https://arxiv.org/html/2603.07267#bib.bib13)) 和 OpenAI 的 o 系列 (openai_o1_system_card, (https://arxiv.org/html/2603.07267#bib.bib28)) 等模型中。QwQ-32B 和 s1 等相关模型进一步表明,RL 能使较小的模型接近大型基础模型的推理表现 (qwen2024qwq, (https://arxiv.org/html/2603.07267#bib.bib36); muennighoff2025s1, (https://arxiv.org/html/2603.07267#bib.bib27))。

语言模型中的信息泄漏。 黑盒语言模型可以通过其输出泄漏有关训练数据和推理时输入的信息。这包括训练数据提取(模型通过生成内容泄露记忆的训练输入)(carlini2021extracting, (https://arxiv.org/html/2603.07267#bib.bib5)),以及成员推断(判断特定数据点是否包含在模型的训练数据中)(shokri2017membership, (https://arxiv.org/html/2603.07267#bib.bib34)),包括上下文学习场景 (mattern2023membership, (https://arxiv.org/html/2603.07267#bib.bib25); wen2024membership, (https://arxiv.org/html/2603.07267#bib.bib41))。另一条研究线关注推理时输入的信息泄漏。模型反演根据黑盒模型的输出来推断输入信息 (morris2024language, (https://arxiv.org/html/2603.07267#bib.bib26))。提示词反演是其中一种特殊情况,只有部分输入(例如系统提示词)是保密的,可以通过对抗性查询 (zhang2024effective, (https://arxiv.org/html/2603.07267#bib.bib44)) 或提示词反演方法 (zhang2024extracting, (https://arxiv.org/html/2603.07267#bib.bib43); yang2024prsa, (https://arxiv.org/html/2603.07267#bib.bib42)) 提取出来。

模型蒸馏与能力窃取。 模型蒸馏将能力从教师模型迁移到学生模型。在合作场景中,学生模型可以全部或部分访问教师模型,目标是匹配其输出或预测分布 (hinton2015distilling, (https://arxiv.org/html/2603.07267#bib.bib15))。在对抗性场景中,攻击者试图通过有限的外部访问从已部署模型中迁移能力。这种能力窃取最初是在图像分类器上研究的 (tramer2016stealing, (https://arxiv.org/html/2603.07267#bib.bib37); orekondy2019knockoff, (https://arxiv.org/html/2603.07267#bib.bib30)),后来被扩展到语言模型 (krishna2019thieves, (https://arxiv.org/html/2603.07267#bib.bib20); wallace2020imitation, (https://arxiv.org/html/2603.07267#bib.bib38))。这种攻击通常在黑盒访问条件下进行,攻击者只能观察到模型的输出,无法访问其内部状态、参数或训练数据。

蒸馏和能力窃取的有效性很大程度上取决于教师模型可提供的信息。在学生模型上使用教师生成的推理轨迹(而不仅仅是最终答案)进行训练,能在推理任务上带来显著提升 (wei2022chain, (https://arxiv.org/html/2603.07267#bib.bib40); shridhar2023distilling, (https://arxiv.org/html/2603.07267#bib.bib35))。相关变体包括部分推理监督,或跳过中间步骤以平衡成本与性能 (chen2025skip, (https://arxiv.org/html/2603.07267#bib.bib7))。我们关注的是教师模型的推理轨迹无法从模型 API 获得的现实场景。

3 威胁模型

问题设定。 考虑一个黑盒受害者模型 (V):给定输入 (x \in \mathcal{X}),它在内部生成推理轨迹 (t \in \mathcal{T}),并由此得到最终答案 (y \in \mathcal{Y})。用户只能收到 (y),以及(可选)一条简短的推理摘要或“气泡” (b^{\star} = C(t) \in \mathcal{B}),且满足 (|b^{\star}| \ll |t|)。这一设定与商业推理模型的 API 一致。

攻击者的目标。 攻击者的主要目标是通过利用对更强推理模型 (V) 的黑盒访问,来提升自己的模型 (S) 的推理能力,同时无法直接访问 (V) 的内部推理过程,并且只能使用下面列出的公开可用资源。为此,给定 (V) 输出的元组 ((x, y)) 或 ((x, b^{\star}, y)),攻击者旨在合成与所观察到的元组逻辑一致的推理轨迹 (\hat{t})。这些轨迹无论是否与受害者真实的内部推理匹配,其目的都是支持在 ((x, \hat{t}, y)) 上对 (S) 进行有效微调。

攻击者的辅助模型。 攻击者可以使用自己的替代推理模型 (V’)、压缩模型 (C’)、反转模型 (I) 和学生模型 (S)。这些模型可以是公开的,也可以是攻击者私有的。唯一的要求是攻击者能够微调反转模型 (I) 和学生模型 (S)。替代推理模型 (V’) 应能生成完整的推理轨迹 ((t’, y’)),用于训练反转模型。通常,(V’) 比受害者模型弱得多(例如,在我们的实验中,R1-distill 对比 GPT-5.4 mini)。我们假设攻击者能够访问受害者 (V) 使用的真实压缩方法 (C)(例如,GPT 模型如何生成推理摘要并不公开)。为了“模拟”摘要生成,攻击者使用一个推理压缩模型 (C’),在固定提示模板 (\pi) 下将替代轨迹 (t’) 映射为摘要 (b’ = C’(t’; \pi)),无需额外微调。随后,攻击者训练一个反转模型 (I),从 (V) 可观察到的输入-输出对 ((x, y)) 以及(如果有的话)摘要 (b^{\star}) 中合成推理轨迹,并利用这些轨迹微调学生模型 (S)。

公开推理数据集。 攻击者可以使用各类推理任务输入 (x) 的公开数据集 (\mathcal{D})(如数学、代码和逻辑题),例如 OpenThoughts-114k (guha2025openthoughtsdatarecipesreasoning, (https://arxiv.org/html/2603.07267#bib.bib12))。我们用它们作为输入来源,用于 (1) 查询替代推理模型以获得其轨迹,(2) 查询受害者模型以获得答案和摘要,供轨迹反转模型使用。

4 反转方法

轨迹反转是一个三阶段攻击流程(图 2)。我们考虑一个摘要设置(受害者模型暴露一条简短的推理摘要)和一个更严格的无摘要设置(只能获得最终答案)。每种设置需要单独的反转模型。

4.1 阶段 1:训练反转模型

训练数据。 攻击者从公开推理数据集中采样输入 (x’),将其提交给替代模型 (V’),得到轨迹 (t’) 和答案 (y’),从而得到数据集 (\mathcal{D}_1 = {(x’, t’, y’)})。为了模拟商业 API,每条替代轨迹 (t’) 可选地通过模型 (C’) 压缩成摘要 (b’ = C’(t’; \pi))(见附录 B)。由此分别得到摘要设置和无摘要设置的数据集 (\mathcal{D}_2^{\text{sum}} = {(x’, b’, y’, t’)}) 和 (\mathcal{D}_2^{\text{nosum}} = {(x’, y’, t’)})。我们使用自己的压缩模型,是因为黑盒受害者模型实际使用的摘要方法未知,因此无法用来生成训练所需的(轨迹,摘要)对。

训练目标。 在摘要设置中,反转模型 (I_{\text{sum}}(x, y, b) = \hat{t}) 被训练为最大化其输出与真实轨迹 (t’) 匹配的似然:

[ \mathcal{L}{\mathrm{inv}}^{\text{sum}} = \mathbb{E}{(x’, y’, b’, t’) \sim \mathcal{D}2^{\text{sum}}} \left[ -\log p{I_{\text{sum}}}(t’ \mid x’, y’, b’) \right] ]

相似文章

从专有LLM API中窃取推理痕迹

Hacker News Top

本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。

新技巧揭示AI模型的内心想法

Wired

研究人员发现了一种通过API从前沿AI模型中提取隐藏推理痕迹的方法,暴露了个人信息泄露风险,并使大规模蒸馏攻击成为可能。研究结果还表明,美国模型的推理能力可能被蒸馏到中国模型Kimi K3中,但尚无定论。

Claude与GPT的隐藏推理被解码,这很有趣

Reddit r/LocalLLaMA

最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。

窃取专有LLM API中的推理痕迹

Simon Willison's Blog

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。