FinRAG-12B:一种经过生产验证的银行业有据可依问答方案
摘要
FinRAG-12B 是一款针对银行业检索增强生成(RAG)优化的 120 亿参数大语言模型,具备统一训练框架,可提升回答质量、引用依据的可靠性以及校准后的拒绝回答能力。该模型在引用依据方面优于 GPT-4.1,并已部署于 40 多家金融机构,在成本和延迟方面具有显著优势。
arXiv:2605.05482v1 公告类型:新论文
摘要:大语言模型(LLM)正在各个领域迅速得到应用。然而,银行业对其采纳持谨慎态度,原因在于该行业对高准确性、监管合规性以及可验证、有据可依的回复有着严格要求。我们提出了一种统一且数据高效的框架,用于训练有据可依的领域特定大语言模型,该框架在真实部署约束下优化了回答质量、引用依据的可靠性以及校准后的拒绝回答能力。首先,我们描述了一个数据生成流程,仅使用 1.43 亿 tokens 的数据,便结合了 LLM-as-a-Judge 过滤、引用标注和课程学习。由此产生的 120 亿参数模型在引用依据方面表现出高质量,优于 GPT-4.1,与未微调的基础模型相比,仅在引用方面存在轻微权衡。其次,我们提出了一种校准拒绝机制:通过在 22% 的无法回答示例上进行训练,实现了 12% 的“我不知道”拒绝率,相比基础模型不安全的高达 4.3% 的拒绝率有显著改善,同时避免了 GPT-4.1 的过度拒绝(20.2%)。第三,我们展示了一种从数据策展到量化服务的全流程方法论。该系统已部署在 40 多家金融机构,使查询解决率提升了 7.1 个百分点(p < 0.001)。此外,与 GPT-4.1 相比,该模型响应速度快 3 到 5 倍,成本低 20 到 50 倍。
查看缓存全文
缓存时间: 2026/05/08 08:19
# FinRAG-12B:一种经过生产验证的银行领域基于事实依据的问答配方 来源: https://arxiv.org/html/2605.05482 Denys Katerenchuk<sup>1</sup>, Pablo Duboue<sup>2</sup><sup>††</sup>, Keelan Evanini<sup>3</sup><sup>1</sup>, David Gondek<sup>1</sup><sup>1</sup>, Nithin Govindugari<sup>1</sup>, Olivier Allauzen<sup>1</sup>, Joshua Baptiste<sup>1</sup>, David J More<sup>1</sup>, Joshua Schechter<sup>1</sup> <sup>1</sup>Kasisto, New York, NY <sup>2</sup>Textualization, Vancouver, Canada <sup>3</sup>NBME, Philadelphia, PA denys\.katerenchuk@kasisto\.com, pablo\.duboue@gmail\.com, kevanini@nbme\.org ###### 摘要 大语言模型(LLMs)正在各个领域迅速得到采用。然而,在银行业的采用面临阻力,原因是对高准确性、合规监管以及可验证和基于事实依据的响应的需求。我们提出了一种统一且数据高效的框架,用于训练基于事实依据的特定领域LLM,该框架在真实部署约束下优化了回答质量、引用依据和校准后的拒绝机制。首先,我们描述了一个数据生成流水线,该流水线结合了LLM-as-a-Judge过滤、引用注释和课程学习,仅使用了1.43亿个令牌。由此产生的12B模型实现了高回答质量,在引用依据方面超越了GPT-4.1,与未调整的基座模型相比,引用质量仅有轻微的权衡。其次,我们提出了一种校准后的拒绝机制:在22%的不可回答示例上进行训练,产生了12%的“我不知道”率,相较于基座模型不安全的4.3%率有显著改善,同时避免了GPT-4.1的过度拒绝(20.2%)。第三,我们展示了一种从数据整理到量化服务的全方位方法论。该系统已部署在40多家金融机构中,查询解决率提高了7.1个百分点($p<0.001$)。此外,与GPT-4.1相比,该模型以20-50倍低的成本提供3-5倍更快的响应。 --- ## 1 引言 大语言模型(LLMs)已经彻底改变了包括客户支持、内容生成和代码合成在内的各种应用中的自然语言处理。然而,由于它们倾向于产生幻觉、表现出过度顺从的行为,以及缺乏与领域特定知识和约束的对齐,它们在受监管的银行业中的采用仍然有限。此外,银行应用程序基于动态且频繁变化的数据运行,例如利率、账户余额和机构政策,这要求模型根据从内部或外部来源检索到的最新信息来依据其响应。这种环境对事实准确性、可追溯性和延迟提出了严格要求。 考虑一个客户向银行的虚拟助手询问关于提前还清抵押贷款的惩罚。系统必须检索最新的政策,正确解释它,并在几秒钟内生成一个基于源文档的响应。如果相关信息不可用,模型必须明确拒绝回答,而不是编造答案,因为不正确的响应可能导致监管和财务风险。实现这种级别的可靠性和响应性需要超越现成的LLMs,转向领域特定的、基于事实依据的系统。 为了解决这些挑战,我们引入了FinRAG-12B,这是一个专为银行业中的检索增强生成(RAG)优化的12B参数LLM。我们提出了一种统一且数据高效的训练框架,该框架共同提高了回答质量、引用依据和校准后的拒绝。我们的方法中心是一个多阶段数据整理流水线,结合了LLM-as-a-Judge过滤、引用注释和课程学习,仅用1.43亿个令牌就实现了73%的引用质量。通过系统的消融实验,我们发现纳入22%的不可回答示例能够实现校准后的“我不知道”响应,显著减少了幻觉,同时避免了对可回答查询的过度拒绝。最后,我们展示了一种从数据整理到量化服务的完整、生产就绪的方法论,该方法论已在40多家金融机构的部署中得到验证。 我们的贡献有三点:(1)一个高质量、数据高效的流水线,用于生成基于事实依据的训练数据;(2)一种基于受控负采样的校准拒绝策略,以减轻幻觉;(3)一个用于在银行业生产RAG系统中训练和部署LLMs的端到端框架。 ## 2 相关工作 近年来,金融自然语言处理(NLP)领域取得了快速发展。BloombergGPT Wu et al. (2023) 在3460亿令牌的专有金融数据上训练了一个50B参数的模型,在情感分析、命名实体识别和问答等任务上取得了强劲的性能。然而,该模型并未公开发布,且该工作未报告部署关键指标,如延迟、推理成本或幻觉率。FinGPT Yang et al. (2023) 证明了参数高效微调(例如,LoRA)可以在低成本下在金融情感分析上取得竞争性结果,但主要关注分类任务,而非带有引用要求的生成式RAG。早期的工作如FinBERT Araci (2019) 确立了领域适应性的重要性,显示在金融语料库上的持续预训练可以提高下游性能。 检索增强生成(RAG)已成为一种标准方法,通过将模型输出建立在外部知识源上来提高事实性 Lewis et al. (2020)。虽然RAG减少了幻觉,但它引入了新的失败模式:模型可能忽略检索到的上下文,依赖无关的段落,或生成没有支持的声明。Liu et al. (2024a) 进一步显示,LLMs在长上下文中表现出位置偏差,不成比例地关注输入开头和结尾的令牌。我们通过训练期间的随机上下文放置来缓解这个问题,从离散右梯形谐波衰减分布的混合中进行采样。 越来越多的工作强调在LLM训练中数据质量优于规模。Phi-3 Abdin et al. (2024) 证明,在精心过滤的数据上训练的小型模型可以匹配或超越在嘈杂语料库上训练的大型模型。同样,Zhou et al. (2023) 显示,少量高质量指令示例足以进行对齐。后续工作探索了原则性的数据选择策略,包括成对质量排序 Wettig et al. (2024)、基于损失的示例选择 Xia et al. (2024) 和最佳数据混合 Ye et al. (2024)。这些发现激励了我们多阶段训练流水线,该流水线按不同质量和来源的数据顺序排列,而不是均匀混合所有来源。 对于参数高效训练,我们建立在LoRA Hu et al. (2022) 和DoRA Liu et al. (2024b) 的基础上,它们学习低秩权重更新以适应大型模型,而无需完全微调。DoRA通过方向分解扩展了LoRA,提高了训练稳定性,同时减少了内存开销。先前的工作还显示,整理的数据集可以优于更大的未过滤语料库 Gunasekar et al. (2023);我们通过数据整理期间的基于LLM的质量过滤实现了这一见解。 课程学习已被证明可以通过按难度递增的顺序呈现训练示例来提高泛化能力 Bengio et al. (2009)。在领域适应设置中,Gururangan et al. (2020) 显示,在领域特定语料库上的持续预训练可以提高下游任务性能。我们采用两阶段课程:第一阶段使用开源数据使模型适应一般金融语言,第二阶段使模型专门针对专有银行交互。这种设计也增强了可重复性,因为第一阶段可以使用公开可用的数据集复制。 与先前的工作不同,我们将数据整理、依据和拒绝校准整合到一个统一的框架中,该框架针对受监管环境中的真实世界部署进行了优化。 ## 3 系统架构 ### 3.1 基座模型选择 基座模型的选择对于平衡性能和部署约束至关重要。我们需要强大的指令跟随能力,同时具有低幻觉率以及延迟和成本方面的效率。在调查了诸如Phi-4 14B和Qwen3 14B等模型后,我们选择了Gemma 3 12B-IT Gemma Team et al. (2024),因为它提供了具有竞争力的指令跟随性能、128K上下文窗口和宽松的商业许可,同时保持计算效率。 ### 3.2 训练数据流水线 训练数据质量是LLM性能的主要决定因素,特别是在银行业这样的高风险领域。虽然金融机构拥有大量数据,但其中很多数据是嘈杂的、过时的,或包含个人可识别信息(PII),限制了其可用性。为了解决这个问题,我们设计了一个多阶段数据整理流水线,优先考虑质量而非规模。最终语料库由98,648个样本(1.43亿个令牌)组成,来自开源和专有数据的组合,经过多个质量控制阶段过滤和处理。整个训练数据集显示在表1中。每个数据集都需要后处理,以确保数据与我们的要求一致。 **表1:训练数据组成。** 第一阶段使用开源数据(RAG-v1, CommonCrawl)。第二阶段添加专有银行对话和来自SEC文件的合成QA。 #### 3.2.1 RAG-v1 我们从 `glaiveai/RAG-v1` 数据集中整理了43,581个样本,这是一个专为检索增强生成设计的合成数据集。每个样本包括一个问题、支持文档和一个引用的答案。我们应用JudgeLM Zhu et al. (2023) 来过滤低质量响应(分数<5),确保一致的监督质量。 #### 3.2.2 合成SEC QA 纯粹合成QA生成流水线通常遭受与真实用户查询的分布不匹配、重复伪影以及对难度和依据的有限控制 Zhang et al. (2024)。为了解决这些限制,我们提出了一种风格条件化的、多阶段QA生成流水线,该流水线基于金融SEC文件(10-K和10-Q),产生了16,773个高质量训练样本。 为了使合成数据与真实世界条件一致,我们设计了一个五阶段生成流水线: 1. 我们使用语义边界(当可用时)或其他固定窗口将每个SEC文件(10-K, 10-Q)分割成语义长度的块(400-600个令牌)。这确保每个示例反映了真实RAG系统中检索到的上下文的粒度,同时保留局部连贯性。 2. 对于每个段落,我们通过提示条件生成四个难度级别(简单、中等、困难、专家)的问题。难度通过所需的推理深度进行操作:简单问题针对明确的事实,中等问题需要轻度综合,困难问题涉及多句子推理,专家问题需要隐含推理或领域知识。我们观察到,简单和中等难度的问题最接近真实用户查询,因此在训练期间赋予它们最高的采样权重。 3. 为了减少分布不匹配,我们使用基于经验查询分布的少样本提示重新表述生成的问题。具体而言,我们控制(i)查询风格(例如,片段、“how-do-I”、“what-is”)、(ii)长度(从对数正态分布中采样)和(iii)正式程度。这将冗长的、疑问式的LLM输出转换为简洁的、类似用户的查询(例如,将“抵押贷款批准所需的最低信用分数是多少?”转换为“min credit score for mortgage”)。 4. 答案使用原始问题及其对应的黄金段落生成,并明确指示将所有声明建立在提供的上下文中。我们在生成期间强制执行引用式输出,确保每个答案都可追溯到特定的源范围。这一步为基于依据的生成建立了监督,而不是参数回忆。 5. 为了模拟真实的检索噪声,我们注入3-7个来自主题相似文档的干扰段落。黄金段落随机交错在干扰项中,位置从离散右梯形谐波衰减分布的混合中抽取。这使得模型接触到不同的上下文位置,并训练它识别和依据正确证据中的响应,而不是依赖位置启发式方法。 与单次生成相比,该流水线显著提高了与真实查询分布的一致性,将问题类型发散减少了10倍(JS: 0.434 → 0.041),并匹配平均查询长度(8.85 vs. 9.91个单词)。它还增加了词汇多样性和领域覆盖范围(表2)。这些结果突出了共同建模依据和查询分布对于有效RAG训练的重要性。 **表2:单次与多步QA生成流水线在词汇、问题类型、语义、多样性和领域指标上的评估。** ↑= 越高越好,↓= 越低越好。 #### 3.2.3 CommonCrawl金融子集 由于用户数据受到严格的隐私约束,我们采用了一种混合方法来构建训练集,而不暴露个人可识别信息。首先,我们训练一个随机森林分类器来识别与银行相关的内容。接下来,我们提取不包含PII且出现超过 $n$ 次的真实用户问题,防止记忆罕见且可能敏感的查询。最后,我们将这些问题与分类器交叉引用,以检索相关段落。由此产生的20,499个样本的数据集建立在真实世界的使用基础上,同时符合隐私要求。 为了在不暴露敏感数据的情况下纳入真实世界信号,我们从CommonCrawl构建了一个符合隐私的数据集。我们训练一个分类器来识别与银行相关的内容,提取频繁出现的非PII用户查询,并检索对齐的段落。我们应用了与第3.2.2节类似的多阶段处理策略,包括上下文依据,以确保与合成QA流水线的一致性。这产生了20,499个样本,这些样本捕捉了真实世界的使用模式,同时保持了严格的隐私约束。 #### 3.2.4 银行拒绝校准数据
相似文章
面向金融文档问答的代理式检索增强生成
本文介绍了 FinAgent-RAG,这是一个用于金融文档问答的代理式框架,它结合了迭代检索、程序化思维推理和自适应资源分配,以提高准确性并降低成本。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
OCC-RAG:面向忠实问答的最优认知核心
OCC-RAG 引入了一系列紧凑型小语言模型,这些模型针对忠实问答进行了优化,采用新颖的流程来合成多上下文多跳问答数据。该模型在推理和忠实度基准测试中表现出与大型模型相当的竞争性能。
FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。