用于电信客户服务的小型语言模型PEFT:LoRA配置及能耗分析的比较研究
摘要
本文系统性地研究了使用LoRA对Qwen2.5-3B进行参数高效微调用于电信客户支持,比较了16种LoRA配置的传统指标与能耗分析。发现定量与定性性能之间存在分歧。
arXiv:2606.05176v1 公告类型:新
摘要:尽管大型语言模型(LLMs)在自然语言理解和生成方面表现出色,但它们在电信客户支持领域特定约束下的评估和适配仍然有限。此外,数据主权、监管约束以及敏感客户和网络信息的处理,使得在此领域使用外部托管的基础模型变得复杂。
我们提出了一项系统的参数高效微调(PEFT)研究,使用低秩适应(LoRA)应用于Qwen2.5-3B,以构建一个领域特定的对话助手。我们引入了一种基于52个行业特定术语词汇表的组合式合成数据生成方法,通过由Gemini 2.0 Flash驱动的生成管道,生成了约30,000个训练样本,涵盖1,560种不同的故障场景。
我们通过改变超参数和目标模块评估了16种LoRA配置。我们的评估超越了标准指标,融入了能耗分析以及使用GPT-5.2和Claude 4.5 Sonnet作为评判的LLM-as-a-judge框架的定性评估。
结果显示定量与定性性能之间存在明显分歧:取得最低验证损失的模型未必获得最佳的人类对齐排名。最佳验证损失(0.5024)在定性评估中仅排第6-7位,而最差损失(0.6807)却被两位评判一致评为第一。
本工作的贡献包括:(1)一种合成数据集构建的组合方法;(2)对LoRA注入目标模块选择影响的见解;(3)验证损失单独不足以选择会话AI微调配置的证据;(4)可持续LLM部署的能耗-性能权衡分析。
查看缓存全文
缓存时间: 2026/06/05 08:05
# 面向电信客户服务的 SLM PEFT:LoRA 配置比较研究与能耗分析
来源:https://arxiv.org/html/2606.05176
Ilan Jaffeux\-Cheniout Orange, 法国Xavier Marjou Orange, 法国
###### 摘要
虽然大语言模型在自然语言理解与生成方面展现出卓越能力,但它们在电信客户服务领域特定约束下的系统评估与适配,在学术文献中仍相对有限。此外,数据主权、合规要求以及敏感客户与网络信息的保护等问题,进一步加大了在此行业部署外部托管基础模型的复杂性。我们系统研究了基于低秩适应的参数高效微调方法在 Qwen2.5‑3B 上的应用,以开发领域特定的对话助手。我们的方法论引入了一种组合式合成数据集生成方法:利用包含 52 个行业专用术语的词汇表,通过基于 Gemini 2.0 Flash 的生成流水线,生成约 30,000 个训练样本,覆盖 1,560 种不同问题场景。我们对 16 种不同 LoRA 配置进行了全面的实证评估,系统性地调整超参数和目标模块。关键的是,我们将传统性能指标扩展至包含能耗分析,并采用 LLM‑as‑a‑judge 方法(使用 GPT‑5.2 和 Claude 4.5 Sonnet)进行定性评估。我们的发现揭示了一个显著的分歧:验证损失最低的微调配置并未获得最高的定性排名。最佳定量表现者(验证损失 0.5024)在定性排名中仅列第 6‑7 位,而最差定量表现者(损失 0.6807)则被两个与人类对齐的评判者一致评为第一。本文贡献包括:(1) 一种新颖的组合式合成数据构建方法,(2) 针对 LoRA 参数注入的目标模块选择相关性分析,(3) 证明在对话 AI 中,仅凭验证损失不足以在不同微调配置间进行选择,以及 (4) 面向可持续 LLM 部署的系统性能耗‑性能权衡分析。
## 1 引言
在专业工业领域部署语言模型需要应对超越通用自然语言处理的挑战。电信客户服务是一个特别严苛的应用场景,要求精确的技术知识、领域专用术语以及结构化的故障排查流程。微调小语言模型为此类需求提供了实用且高效的解决方案。通过参数高效适配,这些模型可以仅使用数千条领域样本快速完成专业化。这种方法使运营商能够在自有基础设施上部署完全定制化的对话助手,从而保障数据机密性、降低运行延迟,并支持跨广泛技术领域的专业化。
参数高效微调方法,特别是低秩适应 Hu 等人 (2021 (https://arxiv.org/html/2606.05176#bib.bib7)),提供了一条切实可行的路径。LoRA 将可训练的低秩矩阵引入特定模型层,同时冻结预训练参数,从而以最小的计算开销实现领域适配。然而,仍存在几个关键研究问题:当领域特定对话数据稀缺时,应如何构建合成训练数据?对于对话任务,哪些 LoRA 配置能优化性能?定量指标(损失、困惑度)与定性响应质量之间有何关系?不同配置的能耗影响如何?
本文通过在 Qwen2.5‑3B 上的系统性实验来解答这些问题,面向电信支持场景。具体而言,我们评估了同一底层模型的 16 种不同 LoRA 微调配置,在保持架构和权重数量不变的同时改变适配策略。我们的四个关键贡献如下:
- •组合式合成数据集生成:一种结构化方法,将 52 个技术术语按照问题原因和使用场景进行分解,通过基于 LLM 的扩展系统生成 1,560 种不同的问题场景。
- •全面的 LoRA 配置研究:对 16 种配置进行实证评估,变化学习率、批量大小、秩 (16, 32) 以及目标模块集 (2, 4, 7 个模块),结果表明,通过扩大目标模块覆盖范围来增加 LoRA 参数数量,比通过提高 LoRA 秩来增加参数数量,在降低损失和困惑度方面效果更为显著。
- •定量‑定性性能分歧:使用 GPT‑5.2 和 Claude 4.5 Sonnet 进行的 LLM‑as‑a‑judge 评估显示,验证损失较低的微调配置并不一定获得更高的定性排名,而验证损失较高的配置在定性评估中却始终排名更优。
- •能耗感知评估:全面的功耗测量 (284‑1371 Wh) 表明,配置选择会影响 5 倍的能耗差异,通过谨慎选择超参数可以找到性能与效率的平衡点。
本文其余部分组织如下:第 2 节 (https://arxiv.org/html/2606.05176#S2) 回顾相关工作。第 3 节 (https://arxiv.org/html/2606.05176#S3) 描述数据集构建、模型架构和 LoRA 配置。第 4 节 (https://arxiv.org/html/2606.05176#S4) 详述实验设置。第 5 节 (https://arxiv.org/html/2606.05176#S5) 展示定量与定性结果及分歧分析。第 6 节 (https://arxiv.org/html/2606.05176#S6) 总结研究意义和未来方向。
## 2 相关工作
### 2.1 参数高效微调
参数高效微调方法旨在解决适配预训练模型时的计算挑战。LoRA Hu 等人 (2021 (https://arxiv.org/html/2606.05176#bib.bib7)) 将权重更新分解为低秩矩阵,在减少可训练参数的同时保持具有竞争力的性能。其变体包括具有自适应秩分配的 AdaLoRA Zhang 等人 (2023 (https://arxiv.org/html/2606.05176#bib.bib8)),以及将 LoRA 与 4‑bit 量化相结合的 QLoRA Dettmers 等人 (2023 (https://arxiv.org/html/2606.05176#bib.bib9))。其他替代方法包括前缀微调 Li and Liang (2021 (https://arxiv.org/html/2606.05176#bib.bib10)) 和提示微调 Lester 等人 (2021 (https://arxiv.org/html/2606.05176#bib.bib11))。我们的工作聚焦于标准 LoRA,系统研究超参数对对话 AI 性能以及训练期间能耗的影响。
### 2.2 合成数据生成
专业领域的数据稀缺推动了合成数据生成研究。Self‑Instruct Wang 等人 (2023 (https://arxiv.org/html/2606.05176#bib.bib14)) 和 Alpaca Taori 等人 (2023 (https://arxiv.org/html/2606.05176#bib.bib15)) 证明了 LLM 可以通过自生成方式自举指令跟随能力。我们的方法不同之处在于引入了显式的组合结构——将领域知识分解为正交维度,从而在保证多样性的同时实现对问题空间的可控探索。
### 2.3 能效与评估
近期研究记录了训练大规模模型所产生的巨大碳足迹 Strubell 等人 (2019 (https://arxiv.org/html/2606.05176#bib.bib19));Patterson 等人 (2021 (https://arxiv.org/html/2606.05176#bib.bib20)),倡导绿色 AI 实践 Schwartz 等人 (2020 (https://arxiv.org/html/2606.05176#bib.bib22))。然而,能效分析在 PEFT 研究中仍不常见。同时,关于 LLM‑as‑a‑judge 评估的新兴工作 Baysan 等人 (2025 (https://arxiv.org/html/2606.05176#bib.bib31)) 表明,基于模型的评估可以近似人类对响应质量判断。我们的工作独特地将能耗测量和定性评估相结合,以提供超越传统损失和困惑度指标的模型微调配置整体评估。
## 3 方法论
### 3.1 合成数据集生成
公共电信支持数据集稀缺,且运营商特定的日志涉及隐私问题。我们通过结合领域知识工程与基于 LLM 的扩展的结构化合成生成方法来应对这一问题。
#### 3.1.1 领域知识分解
我们从一家主要欧洲电信运营商(Orange)的 52 个技术术语词汇表开始,涵盖网络技术、服务、业务模型、技术组件和基础设施。我们不是进行无结构的生成,而是将问题空间分解为正交维度:
- •技术术语 \(TT\):52 个词汇概念
- •问题原因 \(CC\):每个术语约 10 种常见故障模式(配置错误、干扰、拥塞、设备故障)
- •使用场景 \(LL\):每个术语约 3 种位置/情境(家庭、办公室、公共场所、特定条件)
这种分解产生了一个组合问题空间:
\[
|T| \times |C| \times |L| \approx 52 \times 10 \times 3 \approx 1,560 \text{ 种不同问题场景} \tag{1}
\]
通过将问题分解为三个组成部分,我们促进了生成示例的多样性,防止模型重复产生相似场景。
#### 3.1.2 基于 LLM 的生成流水线
基于上述组合空间,我们使用 Gemini 2.0 Flash DeepMind (2024 (https://arxiv.org/html/2606.05176#bib.bib30)) 生成自然语言示例。该流水线分为两个阶段:
**用户查询生成**:对于每个采样的组合 \((t, c, l)\),我们生成逼真的客户查询,其中包含技术术语 \(t\)、暗示问题原因 \(c\) 并指定场景 \(l\),同时通过语言多样性避免模板化模式。
**专家响应生成**:对于每个查询,我们采用两阶段解决策略生成响应:(1) 自助故障排查,包含 3‑5 个用户可自行操作的可执行步骤;(2) 如果自助服务失败,则建议升级处理,明确提示联系人工支持。
#### 3.1.3 数据集特征
我们生成了 30,000 个对话示例,格式为 JSONL,每个示例包含:(1) **Instruction**:定义助手角色的固定系统提示,(2) **Input**:用户查询,(3) **Output**:专家响应。示例:
```json
{
"Instruction": "作为电信专家,用用户可自行执行的操作来回答网络相关问题。",
"Input": "在这个购物中心,我的 4G 一直断连重连。我必须不断地重置网络。我该怎么办?",
"Output": "在购物中心这样的人流密集区域频繁断网可能由多种因素导致。以下是你可以尝试的方法:\n\n1. 移动到商场内人较少的地方:人流密集地点常出现网络拥塞。\n2. 重启手机:这有时可以解决影响网络连接的临时软件故障。\n3. 切换飞行模式:打开飞行模式约 15 秒再关闭,这将强制手机重新连接网络。\n4. 检查 SIM 卡:确保 SIM 卡正确插入并保持清洁。松动或脏污的 SIM 卡可能导致间歇性连接问题。\n5. 临时切换到 3G/2G(如果可能):虽然较慢,但这些网络可能在该地点不那么拥塞且更稳定。请检查手机设置中的选项。\n\n如果以上步骤无法解决问题,请联系您的移动运营商,因为问题可能源自网络基础设施。"
}
```
该数据集的特点包括:覆盖全部 52 个术语的技术覆盖面;措辞和复杂程度多样的语言多样性;一致的解决结构;以及便于集成到训练流水线中的 JSONL 格式。
### 3.2 基础模型与 LoRA 配置
我们采用 Qwen2.5‑3B Yang 等人 (2024 (https://arxiv.org/html/2606.05176#bib.bib4)) 作为基础模型。3B 参数量级在领域特定微调的表示能力与计算可行性和部署可行性之间取得了平衡。Qwen2.5‑3B 采用标准的仅解码器 Transformer,包含 36 层、2,048 隐藏维度、16 个注意力头、分组查询注意力(GQA)使用 2 个键值头,以及 151,936 个词汇 token。
对于 LoRA Hu 等人 (2021 (https://arxiv.org/html/2606.05176#bib.bib7)),我们引入可训练的低秩矩阵:\(W = W_0 + BA\),其中 \(B \in \mathbb{R}^{d \times r}\),\(A \in \mathbb{R}^{r \times k}\),且 \(r \ll \min(d, k)\) 为秩。可训练参数量:\(r \times (d + k)\),相比于全微调的 \(d \times k\)。LoRA 可以针对不同的 Transformer 模块:
- •注意力投影:查询 (\(W_q\))、键 (\(W_k\))、值 (\(W_v\))、输出 (\(W_o\))
- •前馈层:门控 (\(W_{\text{gate}}\))、上投影 (\(W_{\text{up}}\))、下投影 (\(W_{\text{down}}\))
### 3.3 配置网格
我们系统评估了 16 种配置,变化以下参数:
- •学习率:\(\{5 \times 10^{-5}, 1 \times 10^{-4}, 2 \times 10^{-4}\}\)
- •有效批量大小:\(\{4, 8, 16, 32\}\)(通过每设备批量大小和梯度累积实现)
- •LoRA 秩 \(r\):\(\{16, 32\}\),\(\alpha = 2r\)
- •目标模块:
- –最小 (2 个模块):\(\{q\_proj, v\_proj\}\)
- –中等 (4 个模块):\(\{q\_proj, v\_proj, k\_proj, o\_proj\}\)
- –扩展 (7 个模块):\(\{q\_proj, v\_proj, k\_proj, o\_proj, gate\_proj, up\_proj, down\_proj\}\)
表 1:16 种模型微调变体的超参数设置。
### 3.4 训练协议
**数据准备**:30,000 个示例使用 Qwen 的 tokenizer 进行分词,并加入自定义特殊 token(`<|user|>`,`<|assistant|>`)。每个示例格式化为:
```
<|user|>{Instruction} {Input}<|enduser|>
<|assistant|>{Output}<|endassistant|>
```
我们应用仅对完成部分进行损失掩码,只对助手的响应 token 计算损失,从而将学习聚焦于响应生成而非输入预测。
**数据划分**:95% 训练集(28,500 个示例),5% 验证集(1,500 个示例),固定随机种子 42。
**优化**:AdamW Loshchilov and Hutter (2019 (https://arxiv.org/html/2606.05176#bib.bib26)),权重衰减 0.01,最大序列长度 2,048 token,最大 10 个 epoch,bfloat16 混合精度。
**早停**:监控验证损失的评估步耐心值为 3,保留验证损失最低的检查点。
**评估指标**:交叉熵损失和困惑度(损失的指数值)在验证集上计算。
## 4 实验
### 4.1 实验设置
所有实验在单张 NVIDIA GPU RTX 4090 上进行。训练使用 PyTorch 及 Transformers Wolf 等人 (2020 (https://arxiv.org/html/2606.05176#bib.bib27))、PEFT Mangrulkar 等人 (2022 (https://arxiv.org/html/2606.05176#bib.bib28)) 和 TRL von Werra 等人 (2022 (https://arxiv.org/html/2606.05176#bib.bib29)) 库。微调后的模型每 100 个训练步定期评估,并保留训练过程中表现最佳的版本。早停会在验证损失未能改善时停止训练。相似文章
可以多小?LoRA微调270M-8B模型用于金融交易中的商户信息提取
本文是一项面向部署的研究,比较了24种模型变体(参数规模从270M到8B)在金融交易字符串中提取商户信息时的LoRA微调效果。作者发现,像Qwen 3.5 4B这样的小型模型可达到96.6%的F1分数,仅比8B基线低0.35个百分点,同时显著降低了延迟和成本。
Energy- and Memory-Efficient PEFT Methods for Personalized On-Device SLMs on Consumer GPUs
The paper compares five parameter-efficient fine-tuning methods on four small language models for on-device personalization, finding LoRA+ best for energy efficiency and QLoRA best for memory-limited deployment.
用于通信高效联邦LoRA微调的自适应相位切换
本文介绍了一种用于通信高效联邦LoRA微调的自适应相位切换方法,在保持大型语言模型性能的同时,实现了高达40.5%的通信成本往返节省。
超越LoRA:你能击败最流行的微调技术吗?
探讨LoRA是否是最佳参数高效微调技术,并介绍PEFT库中用于比较方法的工具。
哪种LoRA?多语言指令微调中LoRA技术有效性的实证研究
本文实证比较了多种LoRA变体在多语言指令微调中的表现,发现复杂变体在平衡跨语言迁移与知识保留方面相比基本LoRA并无显著优势。