通过小型语言模型实现AI民主化:面向本地部署的结构化基准测试与参数高效微调

arXiv cs.AI 论文

摘要

本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。

arXiv:2607.16202v1 Announce Type: new 摘要:AI民主化主要不在于匹配前沿通用性,而在于能否在普通机构实际能够满足的硬件和治理约束下,选择、审计并专业化有能力的模型。本文通过一个受控评估来研究这一问题,该评估在包含1085个示例、16个主题的多选题基准上测试了9个参数量在135M至3B之间的开放权重语言模型,该基准专为结构化本地部署而设计。基准强调符号精确性、受限格式化、提取以及严格单字母输出协议下的短程语义决策。随后,一个共享的参数高效微调流程在NVIDIA L4级预算下,使用带有DoRA/LoRA风格适配器的4位NF4量化来适配部分模型。在基线评估中,Qwen Coder 3B以75.67%的严格准确率领先,其次是Qwen2.5 1.5B(67.10%)、Qwen3.5 2B(64.98%)和Granite 3.3 2B(64.61%)。在共享的108个示例的保留微调分裂上,适配使Qwen Coder 3B提升了+26.85个百分点,SmolLM2 1.7B提升了+25.92,Qwen2.5 1.5B提升了+19.44,SmolLM2 360M提升了+10.18,SmolLM2 135M提升了+5.55。在排名、主题层面异质性、难度层次、失败构成、效率前沿以及主题条件迁移等方面,同一结论反复出现:一个包含基准构建、跨模型评估和低成本专业化的严谨工作流程已使部分3B以下模型能够作为结构化小众工作负载的本地专家。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:36

# 利用小语言模型实现AI民主化:面向本地部署的结构化基准测试与参数高效微调
来源:https://arxiv.org/html/2607.16202
###### 摘要

AI 民主化的核心问题不在于是否能够达到前沿规模的通用性,而在于能否在普通机构实际能够满足的硬件和治理约束下,选择、审计并专门化有能力的模型。本文通过一项受控实验来研究这一问题:在包含 1,085 个示例、覆盖 16 个主题的多选题基准上,对 9 个参数量在 135M 到 3B 之间的开源权重语言模型进行评估。该基准专为结构化本地部署设计,强调符号精度、约束格式、信息提取以及在严格单字母输出协议下的短跨度语义决策。随后,采用共享的参数高效微调流程,基于 4 位 NF4 量化与 DoRA/LoRA 适配器,在 NVIDIA L4 级别预算下对部分模型进行适配。在基础评估中,Qwen Coder 3B 以 75.67% 的严格准确率领先,其次是 Qwen2.5 1.5B(67.10%)、Qwen3.5 2B(64.98%)和 Granite 3.3 2B(64.61%)。在共享的 108 示例保留微调子集上,适配后 Qwen Coder 3B 提升 +26.85 个百分点,SmolLM2 1.7B 提升 +25.92,Qwen2.5 1.5B 提升 +19.44,SmolLM2 360M 提升 +10.18,SmolLM2 135M 提升 +5.55。综合排名、主题异质性、难度分层、失败构成、效率前沿以及主题条件迁移分析,都反复印证同一个结论:通过构建基准、跨模型评估和低成本专用化这一有序工作流程,部分参数量低于 3B 的模型已经可以作为本地专家,胜任结构化的专业领域工作负载。

## 1 引言

当今关于 AI 民主化的讨论,常常被框定为能否获取日益庞大的前沿模型。然而对于实际部署而言,更关键的问题是更狭窄、更操作性的:缺乏超大规模基础设施的参与者能否构建、评估和治理有用的系统?先前关于算力集中、环境成本和基础模型治理的研究,从技术和社会两个层面说明了这个问题的重要性 [21, 22, 23, 24]。如果只有在集中式训练和服务体制下才能获得模型质量,那么参与在结构上就始终是受限的。反之,如果紧凑的开源模型能够在通用硬件上运行、可进行本地适配,并实现强大的任务性能,那么所有权、隐私权和实验空间将大大拓展。

本文研究后一种可能性。重点不是无限制的开放式对话,而是结构化部署:模型必须返回简短、受模式约束的答案,并且错误代价高昂(因为下游系统期望有效的输出)。典型例子包括轻量级信息提取、标签分配、有界决策支持和规则敏感转换。这正是小语言模型大显身手的场景:运行成本低,通常可在本地托管,且无需完整模型重训即可专业化。

分析分两个阶段进行。首先,在包含 1,085 个示例、涵盖 16 个多项选择任务族的受控基准上,评估了 9 个参数量在 135M 到 3B 之间的开源权重模型。该基准特意融合了符号任务、语义分类、场景决策和格式敏感流程,并采用统一的提示与评分接口。其次,通过共享的参数高效微调流程,利用 4 位量化和 DoRA/LoRA 适配器适配部分模型,从而直接衡量本地专业化对结构化专业工作负载可行性的影响。

核心主张是:AI 民主化应被理解为一个可复现的工作流程,而非单一的模型选择事件。该工作流程是:定义有界用例 → 构建与该用例一致的评估集 → 在固定协议下比较开源小模型 → 使用低成本适配器微调有前途的候选模型 → 仅在模型经审核的能力足够时,将结果模型部署为本地专家。因此,本文的贡献既是实证性的,也是方法论的。

#### 贡献。
- • 一个受控的 16 主题结构化多选题基准,在共享输出契约下强调符号忠实度、模式合规性和紧凑语义推理。
- • 对 9 个参数量在 135M 到 3B 之间的开源权重模型的比较实证研究,使用严格准确率、主题条件分解、难度结构、失败构成和面向部署的效率分析。
- • 一个基于脚本的、在 NVIDIA L4 级别预算下使用量化 DoRA/LoRA 适配器的参数高效微调研究,具有共享的分割边界和确定性的微调后评估。
- • 面向部署的结果解读,将高效的小语言模型定位为本地专家,将参数高效微调定位为将通用紧凑模型转换为专业任务专家的实用机制。

## 2 相关工作

本文处于参数高效适配、开放小模型生态系统以及面向约束部署的评估方法的交叉领域。

#### 参数高效适配。
低秩适配通过将优化限制在低维更新子空间,使得后训练变得可行 [1]。随后,QLoRA 证明了 4 位量化可以在保持适配质量的同时将内存降低到足以在一般硬件上进行微调的程度 [2]。DoRA 通过解耦方向更新和幅度更新进一步改进了这一思路,提高了低秩场景下的稳定性 [3]。本文使用的流程直接继承自这些工作:冻结的量化骨干网络、可训练的低秩适配器,以及仅针对答案跨度的补全监督。

#### 开放小模型生态系统。
紧凑的开源模型家族发展迅速。SmolLM2 强调在多个低于 2B 的规模上进行数据中心的训练 [4]。OLMo2 注重全栈开放性 [5]。Qwen2- 和 Qwen2.5- 系列模型展示了激进的预训练和指令对齐可以产生极具竞争力的紧凑检查点 [6, 7]。TinyLlama、Phi-3 和 MobileLLM 的并行工作强化了更广泛的趋势:小模型的性能前沿正在迅速推进,精心挑选的低于 3B 的模型现在已成为有界任务的实际部署候选 [26, 27, 28]。

#### 面向民主化部署的评估。
对于本地部署,单一数字的基准报告是不够的。格式可靠性、延迟、令牌成本和错误集中度都很重要,因为目标用例不是通用对话,而是集成到低预算系统中的结构化组件。因此,本文将严格正确性、难度条件性能、失败构成和效率前沿作为主要的评估对象,而非辅助性指标。

## 3 基准构建

### 3.1 受控基准设计

基准包含 1,085 行数据,字段包括任务标识符、主题、问题文本、提示模板和标准答案。每个条目都以一个受约束的输出槽结束,指示模型只输出一个选项字母,别无其他。这种设计是刻意的。在结构化部署中,格式与正确性不可分割;在语义上可恢复但格式错误响应在操作上通常不可用。因此,基准将格式有效性编码到评分规则中,而不是将其视为次要的质量维度。

基准生成遵循“类别优先”的流程。选定主题族以覆盖符号精度、信息提取、约束格式、规则执行、轻量级分类和短上下文决策。然后,脚本化生成器在每个族内实例化多样化的题目变体,同时保持恒定的提示接口。最终数据集包含 158 个独特的题干,通过一组固定的指令和选项模板表达。因此,基准是刻意受控的:它足够广泛以产生有意义的模型间差异,但又足够规范,使得低资源实验室能够重现结果并解释失败模式,而不会受提示模板漂移的干扰。

这一设计选择也是实证声明的主要范围条件。该数据集并非作为无约束的自然语言理解基准来呈现。它是一个用于在共享接口下进行模型选择的受控结构工具。因此,所报告的结论对于结构化多选题部署最为有力,应被视为数据集有条件的声明,而非模型优越性的普适主张。

### 3.2 主题清单与标签结构

基准涵盖 16 个主题,并混合了二选一、三选一和四选一的选择空间。表 1(https://arxiv.org/html/2607.16202#S3.T1)总结了主题清单、选项配置、测试能力和代表性任务题干。

表 1:v3 基准的主题设计矩阵汇总:数量、选项空间配置、测试能力及代表性任务题干。

标签结构刻意非均匀。包含 611 个四选项题目、312 个二选项题目和 162 个三选项题目;全局标准答案频率为 A=413, B=353, C=200, D=119。这些属性在操作上至关重要。首先,名义随机正确率因主题而异。其次,如果模型不成比例地输出高频标签,则整体准确率可能微妙地受答案先验偏差影响。因此,评估强调主题解析和难度条件分析,而非依赖单一的语料范围排名。

### 3.3 代表性示例与基准范围

三个示例说明了基准的特性。一个计数题问字母 r 在 strawberry 中出现了多少次,测试在平凡世界知识但非平凡程序精确性上的符号忠实度。一个提取题要求模型选择完全恢复短文中所有电子邮件地址的选项,测试集合级精度而非近似释义。一个场景决策题要求模型根据指定条件判断某人应步行还是开车前往附近的洗车店,测试有界上下文敏感的动作选择。

这些示例在表层形式上刻意简单。目标不是最大化词汇新颖性,而是揭示紧凑模型能否在异构微任务中反复满足严格的接口。这才是许多本地部署的相关需求:不是开放式口才,而是在狭窄决策契约下的稳定合规性。

## 4 模型套件

评估的模型套件包含 9 个检查点,参数范围从 135M 到 3B,旨在覆盖几个活跃的开源模型谱系,以及有意义的训练和对齐先验差异。

#### SmolLM2 家族。
SmolLM2 135M、360M 和 1.7B 指令检查点信息量尤其丰富,因为它们在保持模型家族身份相对恒定的同时改变规模 [4, 8, 9, 10]。其报道的训练配方高度以数据为中心,相对于参数数量具有非常大的令牌预算,以及包括监督微调和偏好优化的后训练对齐阶段。在本研究中,它们直接测试了精心训练能在多大程度上推动紧凑模型执行结构化任务。

#### Qwen 家族。
Qwen2.5 1.5B-Instruct、Qwen2.5-Coder 3B-Instruct 和 Qwen3.5 2B 代表套件中性能最强的紧凑模型 [6, 7, 12, 13, 14]。其记录的架构堆栈包括 RoPE、SwiGLU、RMSNorm 和分组查询注意力变体等特性。面向代码的 3B 模型与本基准特别相关,因为结构化多选题任务奖励紧凑精确输出、规范格式和局部符号精度——所有这些特性很可能通过代码重预训练混合得到强化。

#### 补充基线。
StableLM Zephyr 3B、Granite 3.3 2B-Instruct 和 OLMo2 1B-Instruct 贡献了架构和对齐的多样性 [5, 11, 15, 16]。Zephyr 提供了一个面向聊天的指令基线,具有不同的偏好优化谱系;Granite 贡献了一个面向企业的强大紧凑指令模型;OLMo2 提供了一个完全开放、格式可靠性高的 1B 级参考。综合来看,这些模型为 SmolLM2 和 Qwen 家族提供了有用的对比,有助于识别哪些行为是家族特定的,而非纯粹由规模驱动。

## 5 材料与方法

### 5.1 基础推理与评分

基础评估使用确定性推理框架。对于每个问题 q 和模型 m,流程构建模型特定的提示表示,生成一个简短补全,保守地归一化输出,并记录正确性、格式有效性、完成状态、生成的令牌数和延迟。解码有意简单,因为用例是结构化分类而非创造性生成;随机性只会混淆跨模型比较。

严格正确性在题目级别定义。令 c_{m,q} ∈ {0,1} 表示语义正确性,f_{m,q} ∈ {0,1} 表示格式有效性。得分指示器为

a_{m,q} = 1[c_{m,q}=1 ∧ f_{m,q}=1],

模型级严格准确率为

A_m = (1/N) ∑_{q=1}^{N} a_{m,q}.

这个评分规则有意严格。它反映了部署假设:格式错误的输出在操作上不能与正确的单字母答案互换。

分析层还计算每个主题的准确率 A_{m,t} 和题目难度。难度直接根据评估表操作化,定义为题目失败的模型比例:

d(q) = 1 - (1/M) ∑_{m=1}^{M} a_{m,q},

其中 M=9(基础基准中的模型数)。因此 d(q)=1 对应全模型失败,d(q)=0 对应全模型成功。

### 5.2 分析视角

绘图和表格化阶段从相同的长格式评估表中衍生出几个互补的视角。主题异质性通过模型-主题热力图总结。难度结构通过语料范围直方图和关于 d(q) 的主题条件箱线图总结。错误构成将输出划分为正确、错误但格式正确、格式失败和不完整响应。模型间结构通过主题分布排名的 Kendall-τ 相关性总结。部署权衡通过雷达图、准确率-成本空间的帕累托前沿以及完整响应成本分布总结。

选择这些视角是因为它们回答不同的部署问题。全局排名回答哪些模型总体最强。主题异质性回答局部较弱的模型在特定主题上是否仍然可行。难度分层回答增益是集中在简单题目还是真正有争议的题目上。帕累托和成本分析回答准确率提升是否能在成本敏感决策规则下存活。

### 5.3 微调协议与计算目标

微调瞄准 NVIDIA L4 级别配置 [20],并非作为限制性产物,而是作为民主化计算的一个代表性层级:可访问的云会话和准消费级加速器预算,而非多节点训练集群。单个主题

相似文章

小型语言模型的训练与无限API推理

Reddit r/artificial

一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。