金融推理的数据中心化后训练:挖掘、蒸馏与可验证学习
摘要
本文介绍了一种数据中心化的流水线,用于通过挖掘推理轨迹、蒸馏指令数据和生成可验证的问答对来对语言模型进行后训练,以增强金融推理能力,展示了在防止灾难性遗忘的同时性能得到提升。
arXiv:2609.10113v1 公告类型:新
摘要:金融文本、教科书和问答对数量丰富,但只有一小部分可以直接用于以推理为中心的后训练。现有的问答对通常缺乏明确的推理、足够的上下文或可靠可验证的答案,而教科书必须首先转化为合成训练示例。我们提出一种数据中心化的流水线,通过挖掘开源推理轨迹、蒸馏金融指令数据以及从金融教育材料生成知识图谱引导的问答对来构建互补语料库。经过语义去重后,三个轻量级序列分类器选择金融相关的示例,拒绝指定不充分的问题,并识别适合使用紧凑基于规则的验证器进行强化学习的任务。对于模型适应,我们研究监督微调和强化学习,同时使用自蒸馏微调和后训练模型合并来防止起始模型中已存在的金融能力损失。我们使用FINESSE-Bench评估适应后的语言模型,报告总体性能以及相对于起始检查点的变化。在选定的比较中,普通SFT使FINESSE-Bench准确率降低3.2-4.0个百分点,而自蒸馏SFT相比相应的起始模型提高了1.0-2.8个百分点。等权合并比其SFT父模型恢复了3.0个百分点,最终比原始模型高0.9个百分点;在困难任务上使用GRPO在自蒸馏SFT后增加0.4个百分点,或直接应用于可验证任务时增加3.0个百分点。这些结果表明,感知保留的适应可以在没有普通SFT后观察到的退步的情况下改善金融推理。
查看缓存全文
缓存时间: 2026/09/10 08:19
# 面向金融推理的以数据为中心的后训练:挖掘、蒸馏与可验证学习技术报告 来源:https://arxiv.org/html/2609.10113 Andrei Kalmykov, Denis Kokosinskii 所属机构:Dmitry Stanishevskii, Dmitry Zmitrovich **摘要** 金融文本、教科书和问答对数量庞大,但只有一小部分可直接用于以推理为中心的后训练。现有的问答对往往缺乏显式推理、充分的上下文或可靠可验证的答案,而教科书则必须先转换为合成训练样本。我们提出了一种以数据为中心的流程,通过挖掘开源推理轨迹、蒸馏金融指令数据,以及从金融教育材料中生成知识图谱引导的问答对,构建互补语料库。经过语义去重后,三个轻量级序列分类器用于筛选金融相关样本、拒绝上下文不足的问题,并识别适合基于紧凑规则验证器进行强化学习的任务。在模型适配方面,我们研究了监督微调和强化学习,同时采用自蒸馏微调和后训练模型合并,以防止丢失起始模型中已有的金融能力。我们使用FINESSE-Bench评估适配后的语言模型,报告整体性能及其相对于起始检查点的变化。在选定的比较中,普通SFT使FINESSE-Bench准确率下降3.2–4.0个百分点,而自蒸馏SFT则比相应的起始模型提升1.0–2.8个百分点。等权合并比其SFT父模型恢复3.0个百分点,并比原始模型高0.9个百分点;对困难任务的GRPO在自蒸馏SFT后增加0.4个百分点,或在直接应用于可验证任务时增加3.0个百分点。这些结果表明,具有保留意识的适配可以在不出现普通SFT后常见性能退化的情况下,提升金融推理能力。 ## 1 引言 大型语言模型(LLMs)在自然语言理解、通用指令遵循和多步推理方面的能力日益增强,但将其部署在垂直领域,尤其是金融领域,仍然具有挑战性。一个有用的响应可能需要专业术语、数值准确性、跨文本和表格的证据整合,以及一个可审计的结论。这些要求暴露了朴素领域适应的两个弱点。首先,现有的公共金融指令数据集对专业概念和推理模式的覆盖有限;可用的示例可能还包含重复的模板、缺失的上下文和质量参差不齐的答案。这既激发了挖掘额外推理轨迹的需求,也激发了从金融教育材料中合成问题的需求。其次,在狭窄数据集上进行直接微调虽然可以提升某些金融任务的表现,但可能会降低起始模型中已有的金融能力——这是一种灾难性遗忘现象。 近期关于金融推理的研究表明,领域适应不仅取决于训练算法,还取决于如何为每个后训练阶段构建、验证和筛选示例[10, 13, 1]。我们的工作围绕同样的核心观察,开发了一个互补的、面向生产的流程:不同的后训练阶段需要不同的数据质量概念,这些概念应该被明确建模,而不是被简化为单一的不透明质量分数。 我们将数据整理组织为三个二元决策。*金融相关性*决策支持从大型通用推理集合中进行高召回率的挖掘。*缺失上下文*决策移除那些无法根据所给信息回答的提示,这种问题在合成数据中尤其常见。*可验证性*决策识别那些答案可接受紧凑数值、选择题或基于模式检查的问题,因此适合使用基于规则的奖励进行强化学习。每个检测器都实现为基于紧凑Qwen3-Embedding主干模型[18]的序列分类头,允许比使用生成式判断更经济地筛选数十万个候选样本。 整理后的语料库包含三个互补部分。首先,我们从Glaive Reasoning v1 20M[6]中挖掘长的金融推理轨迹。其次,我们蒸馏并筛选Finance-Instruct-500K[5],保留一组金融相关、自包含且具有显式推理的示例。第三,我们使用GraphGen[3]从金融教育材料中提取结构化知识,并从生成的知识图谱中选定部分生成多样化的问答对,范围涵盖单个事实的问题到需要结合相关概念的问题。在所有来源中,语义去重、语言过滤、重复前缀移除和分类器阈值既降低了冗余,也减少了合成数据的人工痕迹。 我们最终的实验分析考虑了四种适应机制:常规SFT、自蒸馏SFT、模型合并和强化学习。前两者直接注入领域行为;合并则对适应后的模型和起始模型参数进行插值,以恢复微调过程中丢失的金融能力;强化学习则超越了模仿,通过采样替代响应并根据结果层面的奖励信号对其进行优化。本报告重点关注使这些比较可解释的数据和训练决策。 本报告的主要贡献如下: - • 描述了一个可扩展的、分类器辅助的挖掘和筛选流程,其中金融相关性、自包含性和可验证性服务于不同的操作目的。 - • 构建了三个互补的金融后训练集:44,652个挖掘的长推理示例,4,475个蒸馏的Finance-Instruct示例,以及329,828个知识图谱引导的合成示例。 - • 记录了针对金融教育材料的GraphGen适配,以及一个结合了语义、词汇、语言、难度和学习信号的多阶段筛选流程。 - • 表明自蒸馏和后训练合并都能缓解普通SFT导致的金融能力损失。在选定的Qwen3.5-4B结果中,自蒸馏更有效,最终比起始模型在FINESSE-Bench上高出2.8分,而合并为0.9分。 ### 1.1 相关工作 #### 金融推理模型 金融LLM研究已从领域词汇和情感分析,逐步转向多步数值和分析推理。Fin-R1构建了一个金融思维链语料库,并应用SFT后接RL[10]。Fino1评估了通用推理增强向金融文本、表格和方程任务的迁移,并报告了思维链适应和RL在不同任务类型上提供了不均匀的收益[13]。ODA-Fin采用以数据为中心的视角,结合了语义去重、推理合成、长度自适应验证以及用于RL的难度感知选择[1]。这些工作启发了我们对显式数据档案和阶段特定筛选的重视。 #### 金融模型评估 FINESSE-Bench提供了对金融能力的分层评估,涵盖CFA考试题目、技术分析和衍生品交易[15]。我们使用FINESSE-Bench来评估目标语言模型。 #### 推理蒸馏与可验证强化学习 来自更强模型的推理轨迹为较小或不够专业的模型提供了密集的监督。DeepSeek-R1展示了在具有可检查答案的领域,蒸馏长推理行为和使用基于规则奖励的有效性[4]。GRPO通过在一组采样响应内归一化奖励,消除了对学习价值模型的需求[14]。然而,在金融领域,许多问题是开放式的或依赖于缺失的文档。因此,不加区分地应用基于规则的RL可能会奖励格式而非正确性。我们的可验证性与缺失上下文分类器明确识别了紧凑奖励可适用的子集。 #### 知识引导的合成数据 合成问题生成可以扩展领域覆盖范围,但通常产生重复、上下文不足或事实依据薄弱的任务。GraphGen首先分割源文档,并使用合成模型提取实体、关系及其描述,形成细粒度的知识图谱[3]。然后,它将选定的知识组织成受限子图,并使用相同的模型将这些子图转换为问答对。该过程支持关于单个事实的问题,也支持结合或连接多个相关概念的问题。我们将此工作流应用于金融教育材料。由于GraphGen不产生显式推理轨迹,我们随后在生成的问题上运行单独的推理模型,并保留那些推导出的答案通过答案验证的富化示例。 #### 去重与高效过滤 精确字符串匹配可以移除字面上的重复,但会遗漏改写模板和近乎相同的合成任务。因此,我们将基于嵌入的语义去重与确定性规范化和常见前缀过滤相结合。Qwen3-Embedding模型提供多种参数规模的多语言语义表示[18];我们使用8B版本进行语义去重,使用0.6B主干模型进行三个二元过滤器。 ## 2 数据构建 ### 2.1 流程概述 我们从Glaive Reasoning、Finance-Instruct以及使用GraphGen处理的金融书籍中构建了三个互补的数据分支。在每个分支中,都在提示级别进行语义去重。然后,我们在文本规范化后移除精确重复项,并抑制具有异常长共享前缀的提示组。英语检查和三个辅助分类器服务于明确目的:金融分类器选择领域相关示例,缺失上下文分类器拒绝那些无法根据所提供的信息回答的问题,可验证性分类器识别适合紧凑基于规则奖励的示例。 候选来源 → 通过GraphGen处理的金融书籍、Finance-Instruct、Glaive Reasoning ↓ 去重 → 跨来源语义去重、常见前缀去重 ↓ 学习型过滤器 → 金融相关性、缺失上下文、答案可验证性 ↓ 训练数据 → SFT数据、用于RL的可验证任务、用于RL的困难任务 图1:以数据为中心的后训练流程概述。 表1:最终整理的数据集 #### 已发布数据。 我们将评分后的候选池发布为[Fin-Glaive](https://huggingface.co/datasets/whoisjiji/fin-glaive)(645,232个示例)和[Fin-CFA-GraphGen](https://huggingface.co/datasets/whoisjiji/fin-cfa-graphgen)(785,149个示例)。这些发布公开了金融相关性、自包含性和答案可验证性分数,且使用了比构建表1中训练子集更严格的阈值,允许用户为自己的应用选择阈值。源自Finance-Instruct的部分未被再分发。 ### 2.2 共享的语义去重 所有三个来源都使用8B Qwen3-Embedding模型[18]在NeMo Curator工作流[12]中进行提示级语义去重。候选嵌入被分成100个聚类;聚类内对使用余弦距离阈值ε=0.1。该工作流保留最接近聚类中心的代表。我们还移除了具有异常长共享前缀的提示族,这是合成或模板驱动生成中常见的产物,其中示例仅在几个实体或数字上有所不同。 ### 2.3 从Glaive挖掘金融推理 我们使用第3节描述的金融检测器从包含2000万示例的Glaive Reasoning v1集合[6]中挖掘候选提示。初始挖掘遍次产生约70万个金融候选样本。经过语义去重、响应解析和精确提示去重后,剩余645,232个示例。 我们故意应用严格的阈值,因为手动检查发现,较低金融置信度的队列中包含大量相邻领域或通用推理内容。要求p(finance)>0.99将候选池减少到220,707。要求自包含概率高于0.9,剩下111,655。规范化精确去重剩下111,643,重复前缀过滤后剩下93,570。我们仅保留那些提示、推理和最终答案都被fastText语言识别[7]分类为英语的示例,并单独拒绝包含汉字的字符串;93,427个示例通过了这些检查。最后,我们要求在Qwen3.5分词器下,推理轨迹中至少包含1,000个令牌。最终得到的Glaive-Finance语料库包含44,652个长推理示例。 ### 2.4 蒸馏Finance-Instruct Finance-Instruct分支首先保留那些用户提示和答案都被分类为英语的示例,并移除包含汉字的示例。然后我们应用提示级语义去重;最终实现的候选池包含来自Finance-Instruct-500K[5]的287,572个示例。我们手动将数据集的系统提示映射到任务族,并移除非生成式任务族,包括分类、命名实体标注和其他结构化标注任务,剩下214,323个示例。 接下来,我们在p(finance)>0.5的条件下应用金融领域检测器,剩下79,175个示例。常见前缀过滤和联合英语检查将候选池减少到68,312。要求自包含概率高于0.9,剩下20,764个示例。然后我们更严格地应用同样的金融领域检测器,要求p(finance)>0.99,剩下11,809个示例。我们只保留可解析的对话结构,然后将当前的训练产物限制为单轮示例。这产生了4,475个示例。保留的轨迹由DeepSeek-R1-0528[4]生成,温度0.6,top-p 0.95,高推理努力程度,最大完成长度为32,768个令牌。 ### 2.5 来自金融材料的知识图谱引导合成 我们最大的部分将GraphGen[3]适配到涵盖核心领域的CFA课程和备考书籍,如经济学、金融分析、股权、固定收益、衍生品、另类投资、投资组合管理和职业道德。文档被分割成...
相似文章
重新审视后训练中的完整推理轨迹
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。
通过合成数据蒸馏实现高效的金融语言理解
介绍了一种利用合成数据进行蒸馏的金融情感分析框架,将知识从大型教师模型迁移到紧凑学生模型,并采用基于聚类的种子选择方法实现高效的低资源领域适应。
@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……
这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
@dair_ai:关于后训练推理数据的优秀入门指南。(收藏它)这是首批将分散的后……
一份全面的入门指南,综合了150多项关于后训练推理数据的公开研究,围绕四个关键问题组织该领域:数据对象、有用性、构建和扩展。