可以多小?LoRA微调270M-8B模型用于金融交易中的商户信息提取
摘要
本文是一项面向部署的研究,比较了24种模型变体(参数规模从270M到8B)在金融交易字符串中提取商户信息时的LoRA微调效果。作者发现,像Qwen 3.5 4B这样的小型模型可达到96.6%的F1分数,仅比8B基线低0.35个百分点,同时显著降低了延迟和成本。
arXiv:2606.08051v1 公告类型: 新提交
摘要: 金融交易处理需要从嘈杂、简化的银行交易字符串中大规模提取结构化商户信息。我们当前的生产系统是一个LoRA微调的LLaMA 3.1-8B,在该任务上达到了96.95%的F1分数,但部署80亿参数的模型带来了高昂的内存、延迟和成本限制。为了寻找更高效的替代方案,我们开展了一项面向部署的研究,涵盖四个模型家族的24种模型变体:Gemma 3(270M、1B、4B)、Qwen 3.5(0.8B、2B、4B)、Aya(3.35B)和LLaMA 3.1-8B,系统地评估了准确性、推理吞吐量、训练成本和硬件行为,以判断其生产适用性。我们的研究结果表明:(1) 使用LoRA秩为8复现LLaMA 3.1-8B的微调,达到了96.75%的F1分数,仅比秩为32的基线低0.20个百分点;(2) 采用仅JSON提示的Qwen 3.5 4B达到了96.60%的F1分数,仅比8B基线低0.35个百分点,而参数量仅为后者的一半;(3) 0.8B的Qwen 3.5模型达到了94.75%的F1分数,与参数规模大2.5-4倍的模型相当,提供了有吸引力的延迟-准确率权衡;(4) 在大多数模型上,思维链微调通常能提升0.3-1.8个百分点的F1分数,但Qwen 3.5 4B在直接使用仅JSON提示时表现最佳;(5) Qwen 3.5的Think和Nothink训练模板产生几乎相同的结果(F1差异<0.004),表明对于结构化提取任务,显式的推理监督并非必要。我们进一步将所有14个微调后的子8B模型部署为Databricks Model Serving端点,并观察到基准性能可靠地迁移到生产环境,平均F1变化仅为0.8个百分点。唯一的例外是基于Cohere2架构的Aya 3.35B,其在服务条件下F1下降了3-5个百分点。基于这些结果,我们根据准确率和延迟需求提供了部署建议……
查看缓存全文
缓存时间: 2026/06/09 08:54
# 你能做到多小?用于金融交易中商户信息提取的 270M–8B 模型 LoRA 微调
来源:https://arxiv.org/html/2606.08051
Donghao Huang¹,³,Tomáš Drietomský²,Benjamin Barrett¹,Zhaoxia Wang³,\*
###### 摘要
金融交易处理需要从嘈杂、缩写化的银行交易字符串中大规模提取结构化商户信息。我们当前的生产系统是一个经过 LoRA 微调的 LLaMA 3.1-8B,在该任务上达到了 96.95% 的 F1 分数,但部署 80 亿参数模型带来了高昂的内存、延迟和成本限制。为了找到更高效的替代方案,我们进行了一项以部署为中心的研究,涵盖了四个模型家族的 24 个模型变体:Gemma 3(270M、1B、4B)、Qwen 3.5(0.8B、2B、4B)、Aya(3.35B)和 LLaMA 3.1-8B——系统地评估了准确性、推理吞吐量、训练成本和硬件行为,以判断其生产适用性。我们的研究结果表明:(1) 使用 LoRA 秩 8 复现 LLaMA 3.1-8B 微调达到了 96.75% 的 F1,仅比秩 32 基线低 0.20 个点;(2) Qwen 3.5 4B 使用仅 JSON 提示达到 96.60% F1,与 8B 基线相差不到 0.35 个点,而参数量大约只有一半;(3) 0.8B 的 Qwen 3.5 模型达到 94.75% F1,与比它大 2.5–4 倍的模型相当,并提供了有吸引力的延迟-准确性权衡;(4) 思维链微调在大多数模型上通常能提升 0.3-1.8 个 F1 点,尽管 Qwen 3.5 4B 在直接使用仅 JSON 提示时表现最佳;(5) Qwen 3.5 的 Think 和 Nothink 训练模板产生几乎相同的结果(F1 差异 < 0.004),表明显式推理监督对于结构化提取任务并非必需。我们进一步将所有 14 个微调后的 sub-8B 模型部署为 Databricks Model Serving 端点,并观察到基准性能可靠地迁移到生产中,平均 F1 变化仅为 0.8 个点。基于 Cohere2 架构的 Aya 3.35B 是唯一的例外,在服务条件下表现出 3-5 个点的下降。基于这些结果,我们提供了跨准确性要求和延迟要求的部署建议,证明紧凑型模型能够以大约一半的参数量和高达 4 倍的每样本推理延迟降低来支持生产级金融 NLP 工作负载。
## I. 引言
金融交易处理每天产生数十亿条文本字符串,每条字符串以压缩、嘈杂的格式编码了商户身份、位置和交易元数据。一条典型的交易字符串如「VIATOR IT-1558003355 360 3RD ST, STE 400, SAN FRANCISCO 7027495744」必须被分解为十个不同的实体字段,包括商户名称、位置、中介和联系字段(表 I (https://arxiv.org/html/2606.08051#S3.T1))。准确提取对于欺诈检测、商户分类和消费者分析至关重要[23 (https://arxiv.org/html/2606.08051#bib.bib15)]。本研究将商户信息提取定位为万事达卡产品和算法的上游分析组件,这些产品和算法基于万事达卡衍生的交易描述符数据运行。所提出的方法并非用于授权、路由、清算、结算或以其他方式处理万事达卡支付交易;相反,它对现有交易的文本描述符进行操作,以改善商户理解、数据丰富和分析、下游产品质量以及商户情报系统的整体可靠性。
我们当前的生产系统使用一个经过 LoRA 微调的 LLaMA 3.1-8B[5 (https://arxiv.org/html/2606.08051#bib.bib7)],在该任务上达到约 97% 的 F1 分数。然而,部署一个 8B 参数模型引发了实际担忧:高 GPU 内存需求(半精度下 >= 16 GB)、有限的推理吞吐量以及可观的能源成本[18 (https://arxiv.org/html/2606.08051#bib.bib17)]。由于系统每天必须处理数百万笔交易,即使是效率上的微小改进也能转化为显著的运营节省。能力强大的小语言模型(SLM)的增多——Gemma 3[6 (https://arxiv.org/html/2606.08051#bib.bib4)]、Qwen 3.5[15 (https://arxiv.org/html/2606.08051#bib.bib5)]、Aya[16 (https://arxiv.org/html/2606.08051#bib.bib6)]——促使我们进行系统性调查:*维持生产级准确性进行结构化实体提取的最小模型尺寸是多少?*
本文从部署角度回答了这个问题。我们并非关注方法论上的新颖性,而是提供一项全面的实证研究,涵盖四个模型家族的 24 个模型变体、两种提示策略和两种训练模板。我们的贡献包括:
1. 1. 在 LLaMA 3.1-8B 上的 LoRA 秩消融实验显示,秩 8 达到了 96.75% F1——仅比秩 32 基线低 0.20 个点——证明较小的适配器已做好生产准备。
2. 2. 从 0.27B 到 8B 参数的规模分析揭示,Qwen 3.5 4B 将准确性差距缩小到与 8B 基线相差 0.35 个点以内。
3. 3. 证据表明微调期间的思维链提示通常能提升性能,在大多数模型上带来 0.3–1.8 个 F1 点的增益——尽管 Qwen 3.5 4B 是一个显著例外,仅 JSON 提示在该模型上取得了最佳结果。
4. 4. 发现 Qwen 3.5 的混合 Mamba-注意力架构在 0.8B 尺寸上表现出异常强的性能,与 2B–4B 的传统 Transformer 相当。
5. 5. Think 与 Nothink 训练对比显示,使用和未使用推理 token 训练的 Qwen 3.5 模型达到了近乎相同的准确性(F1 差值 << 0.004),而 Nothink 变体提供更快的推理速度。
6. 6. 一项生产服务验证将所有 14 个 sub-8B 微调变体部署为 Databricks Model Serving 端点,显示基准 F1 迁移到生产中时平均下降仅为 0.8 个点——基于 Cohere2 的 Aya 是唯一的异常点。
7. 7. 部署建议涵盖了跨硬件层级的准确性-延迟-成本权衡。
## II. 相关工作
### II-A. 参数高效微调
LoRA[8 (https://arxiv.org/html/2606.08051#bib.bib1)] 引入了低秩适应作为全参数微调的参数高效替代方案,随后被 QLoRA[4 (https://arxiv.org/html/2606.08051#bib.bib2)] 扩展到量化训练,被 AdaLoRA[22 (https://arxiv.org/html/2606.08051#bib.bib3)] 扩展到自适应秩。在实践中,这些方法最常通过开源工具包直接应用,而 LLaMA-Factory[25 (https://arxiv.org/html/2606.08051#bib.bib19)](ACL 2024)是最广泛采用的工具之一:它提供了一个统一的流水线,用于对 100+ 个开源 LLM 和 VLM 进行参数高效微调,支持一系列训练目标(SFT、DPO、KTO、ORPO、PPO),并且通常在新模型发布当天就提供支持。其广泛采用催生了越来越多的后续研究——例如,使用 LoRA 微调 3.5B–72B 开源 LLM 进行中英翻译[11 (https://arxiv.org/html/2606.08051#bib.bib23)],以及结合少样本提示与 LoRA 微调 LLM 进行 Turtle Soup 谜题逻辑推理[10 (https://arxiv.org/html/2606.08051#bib.bib24)]——我们在本研究中采用它作为微调主干。
### II-B. 小语言模型
诸如 Phi-3[1 (https://arxiv.org/html/2606.08051#bib.bib18)]、Gemma 3[6 (https://arxiv.org/html/2606.08051#bib.bib4)] 和 Qwen 3.5[15 (https://arxiv.org/html/2606.08051#bib.bib5)] 等模型在 1–4B 参数范围内展示了强大性能。Qwen 3.5 引入了一种混合架构,结合了 Mamba 状态空间层[7 (https://arxiv.org/html/2606.08051#bib.bib8)] 和 Transformer 注意力[2 (https://arxiv.org/html/2606.08051#bib.bib9)]。具体到面向生产的评估开始显示,小型开源 LM 可以在要求严苛的任务上匹敌大得多的专有模型:例如,在基于 LLM 的代理支付系统中,Gemma 4 E4B 已被证明能匹配 GPT-5.2 完美的工作流保真度得分(ASR),尽管其规模小数个数量级[9 (https://arxiv.org/html/2606.08051#bib.bib25)]。
### II-C. 金融交易中的商户信息提取
传统的命名实体识别(NER)方法依赖于基于 CRF 的序列标注方法[12 (https://arxiv.org/html/2606.08051#bib.bib10),14 (https://arxiv.org/html/2606.08051#bib.bib11)]。近期的研究将信息提取重新定义为一项生成任务[19 (https://arxiv.org/html/2606.08051#bib.bib12),13 (https://arxiv.org/html/2606.08051#bib.bib13)]。金融 NER 任务,例如从嘈杂的银行交易字符串中提取商户信息,由于文本缩写、上下文有限和格式不规范而面临独特挑战[23 (https://arxiv.org/html/2606.08051#bib.bib15),17 (https://arxiv.org/html/2606.08051#bib.bib16)]。思维链提示[20 (https://arxiv.org/html/2606.08051#bib.bib14)] 也被证明能提升结构化预测任务的性能[24 (https://arxiv.org/html/2606.08051#bib.bib21)]。
## III. 方法论
### III-A. 任务定义
给定一个原始银行交易字符串 \(x\),系统生成一个 JSON 对象 \(y\),包含十个实体字段(表 I (https://arxiv.org/html/2606.08051#S3.T1))。每个字段要么是 \(x\) 的子字符串,要么为空。
**表 I:实体字段与数据集特征(8,015 个样本)。**
| 字段 | 出现率 (%) | 唯一值 | 难度 |
| :--- | :--- | :--- | :--- |
| Merchant_Name | 100.0 | 6,411 | 中 |
| State | 68.5 | 57 | 易 |
| City | 46.8 | 1,799 | 中 |
| Street | 31.2 | 2,070 | 中 |
| Dyn._Descriptor | 29.1 | 2,278 | 难 |
| Intermediary | 26.7 | 457 | 中 |
| Phone | 19.6 | 947 | 易 |
| Country | 12.7 | 4† | 难 |
| Zip | 12.0 | 843 | 易 |
| Website | 5.4 | 170 | 易 |
†尽管类别少但频率低。
### III-B. 数据集
数据集包含 8,015 条带标签的银行交易字符串(8,014 条唯一),分为 6,125 个训练样本、668 个验证样本和 1,213 个测试样本。实体字段的出现率高度不平衡(从 Merchant_Name 的 100% 到 Website 的 5.4%)。
### III-C. 模型
我们评估了四个模型家族,所有模型均在本研究中进行了 LoRA 微调:
- • Gemma 3[6 (https://arxiv.org/html/2606.08051#bib.bib4)]:270M、1B、4B(指令调优版,标准 Transformer)。
- • Qwen 3.5[15 (https://arxiv.org/html/2606.08051#bib.bib5)]:0.8B、2B、4B(混合 Mamba-注意力架构,原生支持扩展思维)。
- • Aya[16 (https://arxiv.org/html/2606.08051#bib.bib6)]:3.35B(tiny-aya-global,Cohere2 架构)。
- • LLaMA 3.1-8B[5 (https://arxiv.org/html/2606.08051#bib.bib7)]:8B(指令调优版,标准 Transformer)。使用 LoRA 秩 8 重新微调,以便与生产基线进行直接比较。
我们的生产基线是一个单独训练的 LLaMA 3.1-8B,LoRA 秩为 32(F1=96.95%),作为参考点包含在内。我们还使用我们标准化的流水线对 LLaMA 3.1-8B 以秩 8 进行微调,以便在本研究中将 8B 模型与较小的候选模型进行直接对比。
### III-D. 微调流水线
所有八个模型(包括我们的 LLaMA 3.1-8B 秩 8 微调版本)均使用 LLaMA-Factory[25 (https://arxiv.org/html/2606.08051#bib.bib19)] 在 NVIDIA DGX Spark 上训练——这是一款紧凑型桌面工作站,搭载 GB10 Blackwell 超级芯片,配备 128 GB 统一 LPDDR5x 内存。训练和推理均使用此单设备。这一选择刻意将实验与生产分离。根据安全策略,我们的 Databricks 生产环境(第 V 节 (https://arxiv.org/html/2606.08051#S5))对于哪些基础模型可以拉入工作区有高度限制,并且其内置的 MLflow 微调支持在覆盖新发布的 LLM 架构方面落后于开源生态系统。相比之下,LLaMA-Factory 是一个积极维护的项目,其模型覆盖紧密跟踪新版本。在生产边界之外的独立 DGX Spark 工作站上运行它,使我们能够在不面临策略或工具摩擦的情况下训练、评估和选择任意候选基础模型。这在成本上也显著更低。此处报告的 23 次保留训练运行在 DGX Spark 上总计消耗了 462 GPU 小时的训练时间以及 195 小时的检查点评估时间(每次运行 12 个检查点)——总共 657 GPU 小时的保留计算量。以工作站的制造商建议零售价(MSRP)计算,这种固定成本硬件在几百到几千可计费小时(取决于实例类型和费率)内即可与托管云 GPU 计算成本相抵;仅保留的扫描就已接近该范围,而每次保留条目之前的试错探索则将其倍数放大。只有通过此扫描识别出的每个家族的最佳适配器才会被后续提升为托管服务端点——这是一个两阶段“先实验再部署”的工作流,我们通过第 V 节 (https://arxiv.org/html/2606.08051#S5) 的端点验证确认了其可行性。
关键训练超参数:
- • LoRA:秩 \(r=8\),\(\alpha=16\)(缩放比例 \(\alpha/r=2.0\))
- • 训练:6 个 epoch(2,298 步),学习率 \(10^{-4}\),余弦调度
- • 批次:有效大小 16(4× 梯度累积)
- • 检查点:每 200 步(每个模型 12 个)
### III-E. 提示策略
我们比较了两种提示策略,输出标签相同(完整模板见附录 A (https://arxiv.org/html/2606.08051#A1)):
- **自由思考(FT)**:两步思维链指令——先自由分析,然后应用实体规则并输出 JSON。推理仅在内部进行(不在输出标签中)。提示长度:3,700 字符。
- **仅 JSON(JO)**:直接提取,使用相同规则但无 CoT 指令。提示长度:2,870 字符。
### III-F. 评估协议
我们在所有 12 个保存的检查点上评估每个模型,并报告最佳结果。每个字段的精确率、召回率和 F1 通过精确字符串匹配计算;整体 F1 是所有实体字段的微观平均值。推理吞吐量报告为中位数样本数/秒,在 NVIDIA DGX Spark 上以批次大小 4 和确定性解码(`do_sample=false`,\(T=0\))测量。
## IV. 实验结果
### IV-A. 总体性能
表 II (https://arxiv.org/html/2606.08051#S4.T2) 展示了总体性能。LLaMA 3.1-8B 秩 32 基线达到 96.95% F1。我们的秩 8 LLaMA 3.1-8B 微调版本达到 96.75% F1(FT)和 96.57%(JO)——分别仅比基线低 0.20 和 0.38 个点——证明即使在 8B 规模下,秩 8 适配器也足够了。最佳的 sub-8B 模型是使用仅 JSON 提示的 Qwen 3.5 4B,达到 96.60% F1——与基线的差距仅为 0.35 个点,而参数量只有一半。Gemma 3 4B(FT)和两个 Qwen 3.5 4B Nothink 变体(JO NT, FT NT)以 96.24% 的 F1 并列,不过 Qwen 3.5 4B 变体运行速度快 1.7–1.8 倍。
**表 II:最佳检查点上的总体性能(1,213 个测试样本)。速度(速)为在 NVIDIA DGX Spark 上的中位数样本数/秒。NT = Nothink 模板。‡我们的秩 8 微调(与上方的秩 32 基线相比)。**
### IV-B. 扩展行为
图 1 (https://arxiv.org/html/2606.08051#S4.F1) 显示了 F1 随模型大小的扩展情况。在 Gemma 3 系列内部(270M、1B、4B 使用相同架构),从 270M 到 1B 提升了 +6.58 个点,从 1B 到 4B 提升了 +2.31 个点,在规模超过约 1B 后表现出收益递减。
见图注:图 1:模型大小与最佳 F1 分数的关系。性能呈对数线性提升,在超过 1B 参数后收益递减。
Qwen 3.5 0.8B 模型(使用 FT Nothink 时 F1=94.75%)几乎与 2B 变体(95.18%)相当,并超过了采用传统 Transformer 架构、体积大 25% 的 Gemma 3 1B(93.93%)。我们将此归因于 Qwen 3.5 的混合 Mamba-注意力设计,它将高效的线性时间复杂度序列建模与精确的位置相似文章
用于电信客户服务的小型语言模型PEFT:LoRA配置及能耗分析的比较研究
本文系统性地研究了使用LoRA对Qwen2.5-3B进行参数高效微调用于电信客户支持,比较了16种LoRA配置的传统指标与能耗分析。发现定量与定性性能之间存在分歧。
使用 LoRA 和 NEFTune 对 DeepSeek-R1-8B 模型进行指令微调
本文研究了使用 LoRA 和 NEFTune 对 DeepSeek-R1-8B 进行指令微调用于金融命名实体识别,取得了 0.912 的微平均 F1 值,并优于多个基线模型。
@LangChain: 微调开源模型可以超越或匹配前沿模型。基础 @Alibaba_Qwen 开箱即有良好的提示能力:强…
使用LoRA微调像阿里巴巴Qwen这样的开源模型,可以在错误分类任务上匹配或超越前沿模型性能。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
用于小型语言模型算术微调的结构化合成推理数据
本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。