小语言模型领域适配的可信度成本:跨架构实证研究
摘要
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
arXiv:2608.00042v1 公告类型:新
摘要:小语言模型(SLM)的领域适配已成为在资源受限、高风险环境(包括医疗保健、法律服务和金融分析)中部署高性能 NLP 系统的实用策略。虽然参数高效微调带来的性能提升已被充分刻画,但其对可信度(事实校准和对抗鲁棒性)的影响仍知之甚少。本文首次进行了系统的跨领域、跨架构实证研究,量化了领域适配的可信度成本,涵盖三种 SLM 架构(TinyLlama 1B、Gemma-2 2B、Llama 3.2 1B)、三个领域(医疗、法律、金融)、两种训练数据条件(良性数据和对抗扰动数据)以及四种微调策略(基线 LoRA、Safety-DPO、Dark Experience Replay 和 Task Arithmetic LoRA,即 TA-LoRA)。通过 TruthfulQA MC2(事实校准)和 HarmBench ASR(对抗鲁棒性)对所有 216 种实验配置(使用三个随机种子)进行了可信度评估。主要发现有三点。第一,基线 QLoRA 领域适配在所有模型-领域组合中产生的 TruthfulQA MC2 变化极小(平均 |Delta TQA| < 0.02)。第二,对抗扰动的训练数据持续提升领域适配质量(Delta loss 约 -0.040),且不损害可信度基准。第三,三种安全保持策略均未能降低对抗伤害敏感性:Safety-DPO 基本中性(平均 Delta ASR < 0.001),而 Dark ER 和 TA-LoRA 在安全对齐模型(Gemma-2 2B、Llama 3.2 1B)中分别使平均 HarmBench ASR 增加了 +0.171 和 +0.155,个别配置甚至超过 +0.45。这些结果挑战了基于重放和算术合并的策略能将对齐性迁移到领域适配 SLM 的假设。
查看缓存全文
缓存时间: 2026/08/04 07:37
# 小型语言模型领域适配的可信度代价:跨架构实证研究 来源:https://arxiv.org/abs/2608.00042 查看 PDF(https://arxiv.org/pdf/2608.00042) > 摘要:小型语言模型(SLMs)的领域适配已成为在资源受限、高风险环境(包括医疗保健、法律服务和财务分析)中部署高效 NLP 系统的实用策略。虽然参数高效微调带来的性能提升已得到充分刻画,但其对可信度(事实校准与对抗鲁棒性)的相应影响仍未得到充分理解。本文首次系统性地开展了跨领域、跨架构的实证研究,量化了三种 SLM 架构(TinyLlama 1B、Gemma-2 2B、Llama 3.2 1B)、三个领域(医疗、法律、金融)、两种训练数据条件(良性数据与对抗扰动数据)以及四种微调策略(基线 LoRA、Safety-DPO、Dark Experience Replay 和 Task Arithmetic LoRA,即 TA-LoRA)下领域适配的可信度代价。我们使用三种随机种子,通过 TruthfulQA MC2(事实校准)和 HarmBench ASR(对抗鲁棒性)对全部 216 种实验配置进行了可信度评估。研究得出三个主要发现。第一,基线 QLoRA 领域适配在所有模型-领域组合上产生的 TruthfulQA MC2 变化极小(平均 |ΔTQA| < 0.02)。第二,对抗扰动训练数据一致地提升了领域适配质量(Δ损失约为 −0.040),且未恶化可信度基准。第三,三种安全保持策略均未降低对抗性危害敏感性:Safety-DPO 基本保持中性(平均 ΔASR < 0.001),而 Dark ER 和 TA-LoRA 在安全对齐模型(Gemma-2 2B、Llama 3.2 1B)上分别使平均 HarmBench ASR 提高了 +0.171 和 +0.155,其中个别配置超过 +0.45。这些结果对“基于回放与基于算术合并的策略能够将对齐迁移到领域适配的 SLM”这一假设提出了挑战。 ## 提交历史 来自:Ramesh Babu Paramkusham \[查看电子邮件(https://arxiv.org/show-email/7a55ac4c/2608.00042)\] **\[v1\]** 2026年7月23日(周四)21:54:58 UTC(114 KB)
相似文章
大语言模型可信性无训练方法的系统研究
一项系统性研究,评估了改进大语言模型可信性的无训练方法,将方法分为输入、内部和输出级干预,同时分析可信性、实用性和鲁棒性之间的权衡。
语言模型中的跨架构引导迁移:一项系统性实证研究
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
基于Transformer的语言模型在垂直领域中的应用:架构、应用与批判性评估
对基于Transformer的语言模型的全面综述,涵盖架构、在医疗、金融、法律等垂直领域的应用,以及对计算成本、对齐和数据来源等权衡因素的批判性评估。
大语言模型红队测试框架:以忠实性评估为例
本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。
语言模型中的领域适应与推理框架:基于历史宇宙学的受控实验
本文通过在哥白尼前的语料库上训练,研究领域适应如何重塑语言模型中的解释行为,发现微调对解释框架的转变大于对宇宙学立场的转变。