DAIS:面向复杂推理的依赖感知中间问答监督
摘要
介绍DAIS,一种训练时框架,将思维链推理转化为依赖条件化的中间问答记录,为复杂推理提供更好的监督。在政策合规基准测试上,相比基线实现了高达5.6%的准确率提升。
arXiv:2607.19088v1 公告类型:新
摘要:思维链(CoT)监督暴露了中间推理过程,但平面的推理目标通常优化单一推理序列,并且对于局部结论如何支持后续决策提供的监督有限。我们引入了依赖感知的中间问答监督(DAIS),这是一种训练时框架,将经过筛选的教师推理转换为阶段级问答记录。每个中间记录预测一个局部答案,该答案以该决策所需的前一状态为条件,而最终答案记录保持原始任务格式;因此评估仅使用原始输入和可选上下文。在GDPR、AIACT、MedQA和FOLIO数据集上,结合多个Qwen骨干网络,DAIS在最终答案平均准确率上优于仅答案、平面思维链和独立问答基线。在政策合规基准测试上,相比最强的非DAIS基线,它实现了最大5.6%的提升,平均提升4.2%。控制消融实验表明,有效的前一状态条件化贡献超过了更长的目标或额外的中间文本,支持将依赖条件化的中间问答作为标准最终答案推理的轻量级辅助监督信号。
查看缓存全文
缓存时间: 2026/07/22 08:25
# DAIS: 面向复杂推理的依赖感知中间问答监督
来源: https://arxiv.org/html/2607.19088
余旺†1, 范明\*1, 张西成1, 李志勇1, 王志虎2, 徐才月2, 胡大海2, 刘婷1
1西安交通大学 2华为技术有限公司
###### 摘要
思维链(CoT)监督提供了中间推理过程的解释,但扁平的推理目标通常只优化单一推理序列,而对于局部结论应如何支持后续决策的监督有限。我们提出依赖感知中间问答监督(DAIS),这是一种训练阶段的框架,将经过筛选的教师推理过程转换为阶段级QA记录。每条中间记录在前一步所需状态条件下预测局部答案,而最终答案记录保持原始任务格式;因此,评估仅使用原始输入和可选上下文。在GDPR、AIACT、MedQA和FOLIO四个基准上,使用多个Qwen骨干模型,DAIS在最终答案准确率上优于仅答案监督、扁平思维链和独立QA基线。在政策合规基准上,相比最强非DAIS基线,最大提升达5.6%,平均提升4.2%。控制实验表明,有效的前置状态条件提供了超越更长目标或额外中间文本的增益,支持依赖条件中间问答作为标准最终答案推理的轻量辅助监督信号。
# DAIS: 依赖感知中间问答监督用于复杂推理
余旺†1, 范明\*1, 张西成1, 李志勇1, 王志虎2, 徐才月2, 胡大海2, 刘婷1
1西安交通大学 2华为技术有限公司
††脚注: † 工作完成于华为技术有限公司实习期间。
††脚注: \* 通讯作者
## 1 引言
参见图注
图1: 传统监督目标与DAIS的对比。仅答案SFT只提供最终标签,扁平CoT-SFT模仿单一推理过程,而DAIS将推理过程重构为依赖条件中间QA记录,用作辅助训练监督。最终答案记录保持原始任务格式,因此评估可以使用标准的直接最终答案推理。
大型语言模型(LLM)在广泛推理任务上展现出强大性能。这些进展的关键因素之一是在生成最终答案之前使用中间推理。思维链(CoT)提示和监督鼓励模型生成显式推理过程,已成为引发此类推理行为的标准技术(Wei 等,2022 (https://arxiv.org/html/2607.19088#bib.bib28); Kojima 等,2022 (https://arxiv.org/html/2607.19088#bib.bib13))。后续工作通过自一致性、任务分解和工具增强推理进一步改进了这一范式(Wang 等,2022 (https://arxiv.org/html/2607.19088#bib.bib27); Zhou 等,2022 (https://arxiv.org/html/2607.19088#bib.bib33); Press 等,2023 (https://arxiv.org/html/2607.19088#bib.bib22); Yao 等,2022 (https://arxiv.org/html/2607.19088#bib.bib31))。尽管有这些提升,扁平的推理监督对所学内容的控制有限。如图1 (https://arxiv.org/html/2607.19088#S1.F1)所示,仅答案SFT只监督最终标签,而CoT-SFT添加了中间文本但将其作为单一序列优化。这种格式没有将局部目标或前置状态支持关系表示为条件变量,因此CoT的提升可能与目标长度、风格、步骤标记或答案模板模仿纠缠在一起。中间监督方法通过推理过程监督(Wei 等,2022 (https://arxiv.org/html/2607.19088#bib.bib28); Kojima 等,2022 (https://arxiv.org/html/2607.19088#bib.bib13))、分解(Zhou 等,2022 (https://arxiv.org/html/2607.19088#bib.bib33); Press 等,2023 (https://arxiv.org/html/2607.19088#bib.bib22))和过程监督(Uesato 等,2022 (https://arxiv.org/html/2607.19088#bib.bib26); Lightman 等,2024 (https://arxiv.org/html/2607.19088#bib.bib18))使推理步骤更显式,有时结合推理时搜索或验证。这里,我们关注标准SFT,其中中间目标通常是扁平推理过程、有序步骤或没有前置状态条件的局部记录。这促使我们将教师推理过程重新组织为带有前置状态支持上下文的局部QA记录,同时保留直接最终答案推理。关键挑战是如何利用这些依赖关系作为训练信号,而不将其变为推理时的需求。为此,我们提出依赖感知中间问答监督(DAIS)。
DAIS将筛选后的教师生成CoT推理过程转换为阶段级问答记录。每条中间记录针对从推理过程中提取的局部子任务,后续记录基于选定的早期子任务答案进行条件,这些答案作为当前决策的支持上下文。原始最终答案记录被单独保留,并保持标准任务格式。因此,DAIS可以使用普通监督微调进行训练,并通过直接最终答案提示进行评估。这种设计与推理时分解方法互补。DAIS在评估时不需要控制器、搜索过程、外部验证器、黄金中间状态或架构更改。它探究的是依赖条件中间目标是否为标准最终答案预测提供更好的监督微调信号。
我们在四个推理基准上评估DAIS,涵盖政策合规、医学问答和逻辑推理,使用四种代表性骨干模型。实验表明,DAIS一致提升了最终答案准确率。值得注意的是,在AIACT上,DAIS相对于最强非DAIS基线获得了最高5.6%的提升,在政策类基准上平均提升4.2%。这些结果表明,连接中间监督和依赖感知推理可以带来显著增益,尤其是在最终决策依赖于正确使用早期推理状态来评估适用规则和约束的领域。
我们的贡献如下:
- • 我们提出DAIS,一种训练阶段的依赖条件中间监督框架,将教师CoT推理过程转换为阶段级QA记录。
- • 我们提供一个轻量级SFT数据构建流程,保留标准直接最终答案推理设置。
- • 我们在四个基准和多个Qwen骨干模型上展示,有效的前置状态条件在最终答案准确率上优于仅答案、扁平CoT、独立QA、仅顺序、长度匹配和状态损坏等控制方法。
## 2 相关工作
参见图注
图2: DAIS数据构建概览。教师CoT推理过程被分解为子任务,归一化为数据集级模式,并转换为阶段级QA记录。后续中间记录接收序列化的前序子任务输出作为上下文,而最终答案记录保持原始最终任务记录,不接收构建的中间状态。
#### 思维链、推理过程监督与蒸馏。草稿板和思维链(CoT)方法提示或训练模型在生成答案前暴露中间计算(Nye 等,2021 (https://arxiv.org/html/2607.19088#bib.bib21); Wei 等,2022 (https://arxiv.org/html/2607.19088#bib.bib28))。后续工作通过零样本提示、自一致性、推理过程自举、合成监督和蒸馏改进了这一范式(Kojima 等,2022 (https://arxiv.org/html/2607.19088#bib.bib13); Wang 等,2022 (https://arxiv.org/html/2607.19088#bib.bib27); Zelikman 等,2022 (https://arxiv.org/html/2607.19088#bib.bib32); Hsieh 等,2023 (https://arxiv.org/html/2607.19088#bib.bib8); Magister 等,2023 (https://arxiv.org/html/2607.19088#bib.bib19))。这些研究表明中间文本和教师生成的推理过程可以提升推理能力,但大多数监督目标仍然是线性推理过程后跟最终答案。
#### 分解与结构化推理。基于分解的方法将复杂问题分解为子问题、搜索结构、工具调用或可执行程序(Zhou 等,2022 (https://arxiv.org/html/2607.19088#bib.bib33); Press 等,2023 (https://arxiv.org/html/2607.19088#bib.bib22); Khot 等,2022 (https://arxiv.org/html/2607.19088#bib.bib12); Yao 等,2023 (https://arxiv.org/html/2607.19088#bib.bib30); Besta 等,2024 (https://arxiv.org/html/2607.19088#bib.bib2); Yao 等,2022 (https://arxiv.org/html/2607.19088#bib.bib31); Gao 等,2023 (https://arxiv.org/html/2607.19088#bib.bib6))。它们在推理时提供结构化的推理过程,通常依赖于提示策略、外部工具或对中间状态的显式探索。
#### 过程监督与推理忠实度。验证器和过程监督方法针对完整解决方案或中间推理步骤训练评估器或奖励模型(Cobbe 等,2021 (https://arxiv.org/html/2607.19088#bib.bib3); Uesato 等,2022 (https://arxiv.org/html/2607.19088#bib.bib26); Lightman 等,2024 (https://arxiv.org/html/2607.19088#bib.bib18))。关于推理过程和可解释NLP的相关工作研究了证据选择、推理质量以及解释的忠实度(Lei 等,2016 (https://arxiv.org/html/2607.19088#bib.bib16); DeYoung 等,2020 (https://arxiv.org/html/2607.19088#bib.bib5); Jain and Wallace,2019 (https://arxiv.org/html/2607.19088#bib.bib10); Turpin 等,2023 (https://arxiv.org/html/2607.19088#bib.bib25); Lanham 等,2023 (https://arxiv.org/html/2607.19088#bib.bib15))。先前的工作在激励监督的同时也告诫不要将中间文本解释为忠实推理;因此,DAIS评估依赖条件监督是否提升了最终答案的准确性,而不声称中间解释是忠实的。
## 3 方法
我们提出DAIS,一个从教师生成的CoT推理过程中构建训练数据的依赖感知中间监督框架。如图2 (https://arxiv.org/html/2607.19088#S2.F2)所示,DAIS收集教师推理过程,将其分解为局部子任务,归纳出数据集级子任务模式,并将每个实例转换为一组阶段级QA记录。
### 3.1 问题设定
我们考虑监督推理任务的训练实例 \((x_i, c_i, y_i)\),其中 \(x_i\) 是任务输入,\(c_i\) 是可选上下文或证据,\(y_i\) 是黄金最终答案。对于每个训练实例,强教师模型生成一个CoT推理过程 \(r_i\)。教师推理过程仅用于构建监督目标,在测试时不可用。
标准CoT SFT基线在扁平推理过程-答案目标上训练:
\[
\tau_i^{\mathrm{CoT}} = r_i \oplus y_i,
\]
其中 \(\oplus\) 表示序列拼接。这个目标暴露了中间推理文本,但将推理过程视为单一序列,未显式表示局部子问题或中间状态之间的依赖关系。
DAIS则构建一个有序的中间QA状态集合:
\[
T_i^{\mathrm{DAIS}} = [(q_{i1}, a_{i1}), \ldots, (q_{ik_i}, a_{ik_i})].
\]
这些状态被具体化为阶段级SFT记录:第一条记录从 \((x_i, c_i, q_{i1})\) 预测 \(a_{i1}\),后续每条记录从 \((x_i, c_i, q_{it}, a_{i,<t})\) 预测 \(a_{it}\)。最终答案记录定义为 \(I_{iF} = \operatorname{Format}(x_i, c_i)\) 和 \(O_{iF} = y_i\),因此它只使用原始输入和可选上下文。DAIS没有引入新的训练算法或模型架构。所有记录都用标准自回归指令微调目标进行训练。
遵循常规指令微调设置,损失仅应用于每条指令-输入-输出记录的输出侧,输入侧作为条件上下文。对于中间子任务记录,输出是局部答案 \(a_{it}\);对于最终任务记录,输出是黄金最终答案 \(y_i\)。
## 4 实验设置
### 4.1 任务与数据集
我们使用四个复杂推理基准。GDPR和AIACT评估隐私和政策合规推理(Li 等,2025 (https://arxiv.org/html/2607.19088#bib.bib17); Hu 等,2025 (https://arxiv.org/html/2607.19088#bib.bib9))。MedQA评估医学问答(Jin 等,2020 (https://arxiv.org/html/2607.19088#bib.bib11)),FOLIO评估自然语言逻辑推理(Han 等,2022 (https://arxiv.org/html/2607.19088#bib.bib7))。所有任务均通过最终答案准确率进行评估。
### 4.2 对比方法
我们在相同骨干和训练数据下将DAIS与目标格式基线进行比较。Base表示未微调的骨干。Final-SFT仅使用最终答案监督,CoT-SFT在扁平教师推理过程后跟最终答案上训练。IndepQA使用与DAIS相同的中间QA状态,但移除前置状态条件,隔离前置状态支持上下文的影响。DAIS使用完整的依赖条件中间QA目标。
对于GDPR和AIACT,我们还额外报告了CR-Data SFT,即我们的Qwen模型在Li等人(2025 (https://arxiv.org/html/2607.19088#bib.bib17))发布的公开Context-Reasoner SFT数据上微调的结果。由于它使用外部数据源,我们将其视为参考比较而非受控的目标格式消融。
表1: 四个Qwen骨干在四个基准上的准确率。IndepQA移除前置状态条件,CR-Data SFT是策略任务的外部数据参考。粗体表示每列最佳分数;平均值为各骨干的平均值。
| 基准 | 方法 | Qwen2.5-3B | Qwen2.5-7B | Qwen3-4B | Qwen3-8B | 平均值 |
|------|------|------------|------------|----------|----------|--------|
| GDPR | Base | 0.756 | 0.890 | 0.608 | 0.768 | 0.756 |
| GDPR | Final-SFT | 0.788 | 0.904 | 0.626 | 0.770 | 0.772 |
| GDPR | CoT-SFT | 0.752 | 0.896 | 0.630 | 0.770 | 0.762 |
| GDPR | IndepQA | 0.686 | 0.852 | 0.568 | 0.750 | 0.714 |
| GDPR | CR-Data SFT | 0.724 | 0.912 | 0.652 | 0.712 | 0.750 |
| GDPR | **DAIS (Ours)** | **0.798** | **0.954** | **0.656** | **0.786** | **0.799** |
| AIACT | Base | 0.356 | 0.408 | 0.628 | 0.700 | 0.523 |
| AIACT | Final-SFT | 0.364 | 0.404 | 0.632 | 0.724 | 0.531 |
| AIACT | CoT-SFT | 0.360 | 0.408 | 0.636 | 0.726 | 0.533 |
| AIACT | IndepQA | 0.352 | 0.418 | 0.574 | 0.612 | 0.489 |
| AIACT | CR-Data SFT | 0.396 | 0.382 | 0.654 | 0.692 | 0.531 |
| AIACT | **DAIS (Ours)** | **0.472** | **0.486** | **0.658** | **0.738** | **0.589** |
| MedQA | Base | 0.752 | 0.850 | 0.602 | 0.855 | 0.765 |
| MedQA | Final-SFT | 0.738 | 0.845 | 0.732 | 0.848 | 0.791 |
| MedQA | CoT-SFT | 0.752 | 0.849 | 0.758 | 0.858 | 0.804 |
| MedQA | IndepQA | 0.722 | 0.818 | 0.750 | 0.850 | 0.785 |
| MedQA | **DAIS (Ours)** | **0.764** | **0.872** | **0.769** | **0.856** | **0.815** |
| FOLIO | Base | 0.470 | 0.560 | 0.710 | 0.835 | 0.644 |
| FOLIO | Final-SFT | 0.475 | 0.565 | 0.795 | 0.795 | 0.658 |
| FOLIO | CoT-SFT | 0.485 | 0.570 | 0.795 | 0.805 | 0.664 |
| FOLIO | IndepQA | 0.473 | 0.565 | 0.785 | 0.795 | 0.655 |
| FOLIO | **DAIS (Ours)** | **0.500** | **0.580** | **0.815** | **0.840** | **0.684** |
### 4.3 实现与评估
中间QA记录仅从DeepSeek模型(DeepSeek-AI,2026 (https://arxiv.org/html/2607.19088#bib.bib4))生成的训练集推理过程中构建。对于GDPR和AIACT,我们使用预定义的合规导向模式;对于MedQA和FOLIO,我们通过LLM辅助聚类和人工审计归纳出数据集级模式。在DAIS中,后续子任务记录接收序列化的前置状态作为上下文,而最终答案记录保持原始任务。所有同一数据集和骨干的监督变体使用相同的保留训练实例。如果推理过程未通过一致性或答案匹配检查,则该实例对所有变体均被移除。更多细节请参见附录。相似文章
推理一致性扫描:用于审计AI安全评估中思维链有效性的框架
本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。
推理监督的哪些特性与下游模型质量的提升相关?
本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。
DyCon: 通过演化难度建模的动态推理控制
本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。
CausalDS:在数据科学智能体中进行因果推理的基准测试
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
当进一步推理无益时停止:推理模型中的注意力状态自适应生成
本文提出ASAG,一种无需训练的方法,基于注意力分布自适应地停止大型推理模型的推理,在使用DeepSeek-R1-Distill和Qwen3模型的基准测试中,将token使用量减少约40%,同时准确率提升3.2%。