面向金融推理的依赖感知思维链压缩

arXiv cs.AI 论文

摘要

本文提出了HSDN,一种分层语义蒸馏网络,用于压缩金融任务中的思维链推理,在AFAC2025基准测试中实现了91.0%的准确率和68.4%的压缩率。

arXiv:2609.00413v1 Announce Type: new 摘要:思维链提示能改善复杂推理,但其长篇中间痕迹导致显著的推理成本并阻碍在金融环境中的实际部署。我们提出了一种分层语义蒸馏网络(HSDN),用于压缩推理链,同时保持答案准确性和逻辑连贯性。该框架结合了语义分割、依赖图构建、双编码器重要性评分、受限段选择和局部边界重写。仅使用冻结的Qwen3 4B模型进行特征提取和最终答案生成,而压缩过程保持结构化且可解释。在AFAC2025基准测试中,HSDN实现了91.0%的准确率和68.4%的压缩率,在整体得分和推理连贯性方面超越了强大的压缩基线。结果表明,图引导的压缩对于高风险的金融推理任务是有效的。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:02

# 面向金融推理的依赖感知思维链压缩
来源:https://arxiv.org/html/2609.00413
\(2026\)

###### 摘要\.

思维链提示可提升复杂推理能力,但其冗长的中间推理过程带来了显著的推理成本,阻碍了其在金融场景的实际部署。我们提出一种层次化语义蒸馏网络(HSDN),用于在保持答案准确性和逻辑连贯性的前提下压缩推理链。该框架结合了语义分割、依赖图构建、双编码器重要性评分、约束段选择及局部边界重写等技术。仅使用冻结的Qwen3 4B模型进行特征提取和最终答案生成,而压缩过程本身保持结构化且可解释。在AFAC2025基准测试中,HSDN以68.4%的压缩率实现了91.0%的准确率,在综合得分和推理连贯性方面优于强基线压缩方法。结果表明,基于图结构的压缩方法对高风险金融推理任务是有效的。

思维链压缩、金融推理、依赖图、提示压缩、结构化蒸馏、长上下文

††journalyear:2026††copyright:cc††conference:2026 第三届机器学习与智能计算国际会议;2026年4月24–26日;中国郑州††booktitle:2026 第三届机器学习与智能计算国际会议(MLIC 2026),2026年4月24–26日,中国郑州††doi:10\.1145/3829441\.3829513††isbn:979\-8\-4007\-2465\-7/2026/04††ccs:计算方法 自然语言处理††ccs:计算方法 机器学习††ccs:计算方法 知识表示与推理††ccs:信息系统 摘要††ccs:信息系统 决策支持系统## 1\.引言

大型语言模型在多步推理任务上展现出强大性能,而思维链提示已成为提升中间推理质量的标准机制(Weiet al\.,2022 (https://arxiv.org/html/2609.00413#bib.bib1))。该能力在金融应用中尤为宝贵,因为模型必须在严格的正确性要求下整合文本证据、数值计算与合规性解释。然而,较长的推理轨迹会增加延迟、内存使用和服务成本,限制了其在实际系统中的可用性。

近期基于屋顶线分析的Arm CPU协同优化工作,揭示了如何通过混合精度内核和融合注意力机制来应对内存带宽与低精度吞吐量的约束(Zhou,2026b (https://arxiv.org/html/2609.00413#bib.bib16)),这与我们面向效率的设计理念高度相关。该效率挑战与无服务器AI推理密切相关——系统必须在冷启动延迟与保留空闲GPU资源的成本之间取得平衡,这促使了诸如AdaScale(Zhou,2026a (https://arxiv.org/html/2609.00413#bib.bib12))等自适应生命周期管理策略的出现。

零样本推理研究进一步表明,推理质量不仅取决于模型规模,还取决于推理过程中间步骤的组织与呈现方式(Kojimaet al\.,2022 (https://arxiv.org/html/2609.00413#bib.bib2))。近期的多智能体故障排查框架(如PRISM)进一步表明,专业化的角色分解与证据验证能够提升复杂推理工作流的效果(Yanet al\.,2026 (https://arxiv.org/html/2609.00413#bib.bib17))。

现有方法在高风险金融推理方面仍存在重要缺口。直接生成虽高效但常遗漏关键逻辑步骤;完整思维链虽保留细节却冗余冗长;更先进的审慎推理策略虽优化了推理路径搜索,但并未明确解决如何在压缩完整推理链的同时保持依赖结构与数值忠实性(Yaoet al\.,2023 (https://arxiv.org/html/2609.00413#bib.bib3))。在金融场景中,这种遗漏尤为关键——看似次要步骤的缺失可能使后续计算失效,或破坏审计所需的论证链条。为此,我们提出一种层次化语义蒸馏框架,用于以结构化方式压缩推理链。该方法首先将推理过程分割为语义单元,继而构建有向依赖图,通过问题感知表征对各段重要性评分,最后在长度与依赖约束下进行全局最优选择。轻量级的边界重写器在片段移除后恢复语句流畅性,而冻结的大语言模型仅用于语义特征提取和最终答案生成。这种设计构建了一个可解释的压缩流水线,在降低推理长度的同时,保留了金融决策支持所需的逻辑连续性。

## 2\.相关工作

处理长输入的研究大多聚焦于降低完整序列处理成本的全局机制。稀疏注意力架构(如Longformer和BigBird)通过限制或重构注意力模式来提升长文档处理的可扩展性,为高效长上下文建模奠定了坚实基础(Beltagyet al\.,2020 (https://arxiv.org/html/2609.00413#bib.bib4); Zaheeret al\.,2020 (https://arxiv.org/html/2609.00413#bib.bib5))。然而,这些方法主要在词元层面优化表征效率,并未直接解决应保留哪些推理步骤以实现忠实于答案的链式压缩问题。

第二类研究关注细粒度与动态缩减方法,即模型在推理过程中选择性移除不重要词元。TR BERT引入了基于任务相关性的动态词元缩减机制,PoWER BERT则通过渐进式消除低影响词向量来加速推理,同时保持预测质量(Yeet al\.,2021 (https://arxiv.org/html/2609.00413#bib.bib6); Goyalet al\.,2020 (https://arxiv.org/html/2609.00413#bib.bib7))。这些方法展现了自适应压缩的价值,但它们通常基于局部词元显著性操作,未能建模推理片段间显式的逻辑依赖关系——而这在多步金融推理中至关重要。

近期关于动态检索增强生成的研究进一步表明,当静态上下文不足时,选择性工具使用与充分性感知路由可提升鲁棒性(Lianget al\.,2026 (https://arxiv.org/html/2609.00413#bib.bib13))。我们的方法亦与结构化摘要和忠实生成的相关工作有所联系。近期供应链延误预测的混合深度学习研究进一步强调了联合建模时间动态与图结构在运营决策系统中的价值(Xueet al\.,2026a (https://arxiv.org/html/2609.00413#bib.bib18))。一项近期风险感知动态路由框架展示了时空图神经网络如何在大规模物流系统中,支持应对拥堵与需求波动的韧性决策(Xueet al\.,2026b (https://arxiv.org/html/2609.00413#bib.bib15))。

特别是,近期结合金字塔式语义编码、图注意力与语言模型辅助原理蒸馏的混合架构,进一步表明了多粒度特征提取对于复杂威胁叙事的价值(Xu,2026b (https://arxiv.org/html/2609.00413#bib.bib14))。HeterSumGraph展示了图表征如何捕获文档级关系用于抽取式摘要,PRIMERA则通过基于金字塔的预训练提升了长文档摘要性能(Wanget al\.,2020 (https://arxiv.org/html/2609.00413#bib.bib8); Xiaoet al\.,2022 (https://arxiv.org/html/2609.00413#bib.bib9))。针对生成忠实性,FactPEGASUS强调了在重写与压缩过程中保持事实一致性的重要性(Wan and Bansal,2022 (https://arxiv.org/html/2609.00413#bib.bib10))。与这些面向生成的方法互补,成对验证方法(如SENTINEL)能够检测同一源文档的两个候选输出间的细微语义不一致,为评估压缩是否引入操纵性失真提供了有用视角(Xu,2026a (https://arxiv.org/html/2609.00413#bib.bib11))。

## 3\.方法论

思维链推理对于复杂金融推理至关重要,但冗长的推理序列带来了巨大的计算开销。本文提出一种层次化语义蒸馏框架,在压缩冗长推理链的同时保持逻辑完整性,应对金融应用中的独特挑战(如表格数据解读、多步数值计算及监管合规验证)。该框架引入了一个结构化流水线,包含四个核心组件:基于图的依赖解析器,用于构建显式推理拓扑以捕获因果关系并识别可省略内容;双编码器架构,通过问题语义与推理内容间的跨模态注意力对片段重要性评分;动态规划求解器,保证在长度预算与依赖约束下的全局最优片段选择;轻量级序列到序列重写器,确保片段边界连贯性且不引入事实不一致。冻结的大语言模型仅作为语义特征提取器和答案生成器,使核心压缩逻辑保持在可解释的算法组件中。在金融推理基准上的评估表明,该方法能显著缩短推理长度同时保持答案准确性,其基于图的表述方式为高风险应用中的人工验证提供了透明的压缩依据。整体架构如图1所示(https://arxiv.org/html/2609.00413#S3.F1)。

参见图例 图1\.层次化语义蒸馏网络(HSDN)概览。该流水线包含五个阶段:基于BiLSTM\-CRF的语义分割、基于双仿射注意力的依赖图构建、双编码器重要性评分、基于动态规划的约束片段选择,以及采用带复制机制的seq2seq模型进行边界重写。冻结的Qwen3\-4B模型提供语义特征并生成最终答案。
## 4\.算法与模型

### 4\.1\.语义分割

第一阶段将连续推理文本划分为离散语义单元,作为后续处理的原子元素。与常不适当地切断逻辑单元的句子级分割不同,我们训练了一个尊重推理步骤边界的专业边界检测器。

#### 4\.1\.1\.边界检测网络

我们采用结合条件随机场的双向LSTM网络来识别片段边界。给定词元序列c=\(c1,c2,...,cT\)\\mathbf\{c\}=\(c\_\{1\},c\_\{2\},\\ldots,c\_\{T\}\),该网络首先计算上下文化表征:

\(1\)h→t=LSTM→\(ct,h→t−1\)\\overrightarrow\{\\mathbf\{h\}\}\_\{t\}=\\text\{LSTM\}\_\{\\rightarrow\}\(c\_\{t\},\\overrightarrow\{\\mathbf\{h\}\}\_\{t\-1\}\)\(2\)h←t=LSTM←\(ct,h←t\+1\)\\overleftarrow\{\\mathbf\{h\}\}\_\{t\}=\\text\{LSTM\}\_\{\\leftarrow\}\(c\_\{t\},\\overleftarrow\{\\mathbf\{h\}\}\_\{t\+1\}\)
连接表征ht=\[h→t;h←t\]\\mathbf\{h\}\_\{t\}=\[\\overrightarrow\{\\mathbf\{h\}\}\_\{t\};\\overleftarrow\{\\mathbf\{h\}\}\_\{t\}\]同时捕获了前序与后序上下文,这对于检测依赖后续内容的边界至关重要。早期使用单向模型的实验在数值计算前的边界上表现不佳,因为边界的重要性只有从后续计算中才能显现。

每个位置的边界概率通过前馈层计算:

\(3\)et=We⋅tanh⁡\(Whht\+bh\)\+be\\mathbf\{e\}\_\{t\}=\\mathbf\{W\}\_\{e\}\\cdot\\tanh\(\\mathbf\{W\}\_\{h\\mathbf\{h\}\_\{t\}\+\\mathbf\{b\}\_\{h\}\)\+\\mathbf\{b\}\_\{e\}\)其中et∈R2\\mathbf\{e\}\_\{t\}\\in\\mathbb\{R\}^\{2\}代表边界与非边界标签的发射得分。

为确保全局一致的分割,我们应用线性链CRF层来建模标签转移:

\(4\)P\(y\|c\)=1Z\(c\)exp⁡\(∑t=1Tet\[yt\]\+∑t=1T−1A\[yt,yt\+1\]\)P\(\\mathbf\{y\}\\mathbf\{c\}\)=\\frac\{1\}\{Z\(\\mathbf\{c\}\)\}\\exp\\left\(\\sum\_\{t=1\}^\{T\\mathbf\{e\}\_\{t\}\[y\_\{t\}\]\+\\sum\_\{t=1\}^\{T\-1\}\\mathbf\{A\}\[y\_\{t\},y\_\{t\+1\}\]\\right\)其中A∈R2×2\\mathbf\{A\}\\in\\mathbb\{R\}^\{2\\times 2\}是转移矩阵,Z\(c\)Z\(\\mathbf\{c\}\)是通过前向算法计算的配分函数。CRF层防止了连续边界或过长片段这类病态解——这类情况在独立分类中频繁出现。

#### 4\.1\.2\.金融领域适配

金融推理文本带来了独特的分割挑战,需要特定适配。跨多个词元的数值表达式(如百分比变化或货币金额)必须在片段内保持完整。我们通过引入数值跨度检测器来识别连续数值表达式解决此问题:

\(5\)NumSpan\(t\)=1\[∃\(i,j\):i≤t≤j∧IsNumeric\(ci,...,cj\)\]\\text\{NumSpan\}\(t\)=\\mathbb\{1\}\\left\[\\exists\(i,j\):i\\leq t\\leq j\\land\\text\{IsNumeric\}\(c\_\{i\},\\ldots,c\_\{j\}\)\\right\]
在CRF解码时,当NumSpan\(t\)=1\\text\{NumSpan\}\(t\)=1且该跨度从位置t−1t\-1延续时,我们通过设置A\[yt−1,BOUNDARY\]=−∞\\mathbf\{A\}\[y\_\{t\-1\},\\{\\scriptstyle\\text\{BOUNDARY\}\\}]\=\\infty来禁止在检测到的数值跨度内分割。

此外,金融文本常包含不应分割的表格引用和结构化数据提及。我们发现仅扩大上下文窗口是不够的;因此,我们在表格单元格边界检测的辅助任务上预训练边界检测器,该方法能有效迁移至推理文本分割。

### 4\.2\.依赖图构建

将推理链分割为单元S=\(s1,s2,...,sK\)\\mathbf\{S\}=\(s\_\{1\},s\_\{2\},\\ldots,s\_\{K\}\)后,我们构建一个有向无环图G=\(V,E\)\\mathcal\{G\}=\\(\\mathcal\{V\},\\mathcal\{E\}\\),该图显式编码了片段间的逻辑依赖关系。此图作为压缩决策的结构化骨架,确保移除一个片段不会使其依赖项孤立。图2(https://arxiv.org/html/2609.00413#S4.F2)展示了图构建流程。

参见图例 图2\.层次化语义蒸馏网络(HSDN)概览。该流水线包含五个阶段:基于BiLSTM\-CRF的语义分割、基于双仿射注意力的依赖图构建、双编码器重要性评分、基于动态规划的约束片段选择,以及采用带复制机制的seq2seq模型进行边界重写。冻结的Qwen3\-4B模型提供语义特征并生成最终答案。#### 4\.2\.1\.节点表征

每个片段sk成为图中的一个节点。我们通过平均池化冻结语言模型编码器的词元表征来计算节点嵌入:

\(6\)vk=1\|sk\|∑t∈skLLMenc\(ct\)\\mathbf\{v\}\_\{k\}=\\frac\{1\}\{\|s\_\{k\|\}\\sum\_\{t\\in s\_\{k\}\}\\text\{LLM\}\_\{\\text\{enc\}\}\(c

相似文章

通过推理空间压缩的结构化理由蒸馏

arXiv cs.CL

本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。

压缩-蒸馏:面向高效知识蒸馏的推理轨迹压缩

Hugging Face Daily Papers

本文提出在知识蒸馏前对推理轨迹进行压缩,以降低计算成本和推理长度。实验表明存在准确率与效率的权衡:压缩轨迹保留了原始轨迹最多96%的准确率,同时每token效率提升高达18倍。

ThoughtFold: 通过内省偏好学习折叠推理链

arXiv cs.AI

ThoughtFold 提出了一种利用内省偏好学习的框架,旨在减少大型推理模型在思维链推理中的冗余探索,在 DeepSeek-R1-Distill-Qwen-7B 上实现了约 56% 的令牌减少,且准确率无损。

[研究/模型] Flint:无损压缩推理过程

Reddit r/LocalLLaMA

本研究引入了针对推理轨迹的章节感知压缩,训练模型舍弃填充性叙述,同时保留计算和验证片段,在比原始推理少用2-3倍词元的情况下,达到或超越原始准确率。

DAIS:面向复杂推理的依赖感知中间问答监督

arXiv cs.CL

介绍DAIS,一种训练时框架,将思维链推理转化为依赖条件化的中间问答记录,为复杂推理提供更好的监督。在政策合规基准测试上,相比基线实现了高达5.6%的准确率提升。