可复现、许可证感知的CPU可部署安全分类蒸馏方案

arXiv cs.AI 论文

摘要

本文提出一种可复现且符合许可证要求的知识蒸馏方法,用于创建可在CPU硬件上运行的高效大语言模型安全分类器。该方法在降低误报率的同时,实现了与大型模型相当的性能表现。

arXiv:2608.21570v1 公告类型:新文章 摘要:在消费级硬件上为大语言模型部署安全防护层受限于可用的防护机制:当前开放的防护模型参数量在10亿至90亿之间,主要面向图形处理器优化,在中央处理器上每个请求需数秒响应时间。本文提出一种可复现且遵循许可协议的知识蒸馏方案以突破该限制。一个强大的开放防护模型对约97,000条来自24个公共数据集的提示词进行标注,按公共危险分类标准划分为七个安全类别;一系列涵盖词法、浅层、编码器和生成式架构的小型学生模型被训练来复现该标注信号。语料库按许可证边界划分,使得可部署模型与研究模型仅在训练数据上存在差异,由此可量化该限制带来的性能影响。所有模型均在包含6,361条数据的独立黄金基准测试集(涵盖四个切片)上评估,该测试集独立于教师模型进行标注,其中包含一个无害提示词切片用于量化过度防御现象。蒸馏后的小型模型在对抗性文本上与教师模型的置信区间重叠,并在无害提示词上降低了误报率:最小的生成式学生模型误报率为3.8%(80亿参数教师模型为4.8%),而编码器模型在CPU上的分类速度约为每请求24毫秒。类别重平衡是该方案中唯一的关键要素。研究并未声称优于蒸馏防护模型;在干净的参考切片上,教师模型仍保持优势。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:19

# 面向CPU部署的可复现、合规安全分类蒸馏方案
来源:https://arxiv.org/abs/2608.21570  
查看PDF(https://arxiv.org/pdf/2608.21570)

> 摘要:在通用硬件上为大语言模型部署安全层时,受限于现有防护能力——当前开源防护模型参数量介于10亿至90亿之间,主要针对图形处理器优化,且在中央处理器上的每次请求响应时间需以秒计。本文提出了一种可复现、合规的知识蒸馏方案来应对该挑战。由一个高性能开源防护模型对约97,000条来自24个公开数据集的提示进行标注,划分至与公共危害分类体系对齐的七个安全类别;随后训练涵盖词汇、浅层、编码器及生成式架构的小型学生模型群组,以复现该标注信号。数据集按许可证边界划分,使可部署模型与研究模型仅存在训练数据差异,由此可量化限制带来的性能损耗。所有模型在包含6,361条数据、涵盖四个维度的独立黄金基准上进行评估,该基准独立于教师模型标注,并包含用于衡量过度防御的无害提示切片。蒸馏后的学生模型在对抗文本上的表现与教师模型的置信区间重叠,且降低了无害提示的误报率——最小的生成式学生模型误报率为3.8%,而80亿参数教师模型为4.8%;编码器模型在CPU上的单次请求分类时间仅需约24毫秒。类别重平衡是该方案唯一的关键要素。本研究并未声称优于现有蒸馏防护模型;在纯净参考切片上,现有模型仍保持领先。

## 提交历史
作者:Gustavo Voltani Von Atzingen [查看邮件](https://arxiv.org/show-email/9a8e7007/2608.21570) **[版本1]** 2026年8月21日 周五 19:19:12 UTC (252 KB)

相似文章

通过混合策略蒸馏进行推理压缩

arXiv cs.AI

本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。

通过追踪重写保护语言模型免受未授权蒸馏

arXiv cs.CL

本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。