三进制语言模型中的能力分层性能退化

arXiv cs.AI 论文

摘要

本文研究分析了三元量化语言模型中的能力分层退化现象。研究表明,尽管事实知识出现显著衰退,但常识推理能力和下游任务适应性仍得以保持,这使得该类模型在高效边缘部署中具有实用价值。

arXiv:2608.28809v1 公告类型:新 摘要:极低比特推理为更小模型与受限部署提供了路径。三元语言模型将权重限制在 $\{-1,0,+1\}$,逼近 $\log_2 3 \approx 1.585$ 比特/权重的极限。对于预训练模型而言,实际问题不仅在于权重能否量化,更在于哪些能力得以保留以及模型是否仍适用于适配。我们通过将 Qwen3.5-0.8B(752M 参数)转换为三元权重来探索这一问题,使用了 72.4M 词元的量化感知训练(QAT)。生成的模型 Cloe 在 29 项基准测试、表征诊断和下游微调中进行了评估。证据显示衰减呈非均匀性。线性探针从全精度教师表征中恢复了 43.76% 的 MMLU 答案,但仅从 Cloe 中恢复了 26.19%(接近随机水平),表明专业事实性信息有所损失。然而 Cloe 在十项任务中保持了可测量的性能,平均达到教师模型性能的 77.1%。关键的是,微调将 Cloe 在 SST-2 上的表现提升至 89.8%(相当于匹配教师模型的 95.6%),并在 XSum 上实现 79.4% 的教师保留率。我们将性能衰减归因于量化引发的信息损失与有限 QAT 预算导致的恢复不完全。同时我们指出了一个评估陷阱:标准答案字母评分法失效(Cloe 在 98.6% 的 MMLU 问题中输出 "A"),必须采用续写评分法。最终,三元转换尚不适合作为通用替代方案,但作为任务特定模型的紧凑基底仍具有价值。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:40

# 1 引言
来源:https://arxiv.org/html/2608.28809
三元语言模型的能力分层退化 CLOE V1.1 \- OneBit AI

Qwen3\.5\-0\.8B→\\rightarrow QAT →\\rightarrow三元模型 Cloe。一项关于一个752M752\\text\{\\,\}\\mathrm\{M\}参数预训练语言模型在三元转换下的能力、表示、可学习性与部署研究。

Anirudh Malik \| Poojith Devan \| M Sparsh Mehra

核心结论。主要发现并非三元化会产生一个能力全面减弱的语言模型。相反,其退化是能力分层的:专家级事实知识和语言建模质量显著下降,而多种形式的常识判断、表示能力以及下游任务的可学习性仍保持可测量水平。在Cloe明显能区分候选答案的十项基准测试中,其表现保留了全精度教师模型的平均77\.1%。在特定任务微调后,它在SST\-2任务上达到了相同微调教师模型的95\.6%,在XSum任务上达到79\.4%。工程研究进一步显示了一个634\.7 MB的打包模型产物,其预填充/解码吞吐量高于测量的潜在表示,而运行时内存仍是单独的制约因素。

关键词:三元量化,1\.58\-bit模型,量化感知训练,小型语言模型,能力保留,表示学习,模型压缩,边缘AI,高效推理

###### 摘要

极低比特推理为更小的模型产物和更受限的部署提供了途径。三元语言模型将权重限制为\{−1,0,\+1\}\\\{\-1,0,\+1\\\},接近每个权重log2⁡3≈1\.585\\log\_\{2}3\\approx 1\.585比特的信息论极限。然而,对于一个现有的预训练模型而言,实际问题不仅是权重能否被量化,而是*哪些能力在转换后得以保留*,以及所得模型是否仍可作为下游适配的有效基础。

我们通过将一个752M752\\text\{\\,\}\\mathrm\{M\}参数的预训练模型Qwen3\.5\-0\.8B转换为三元权重来研究这个问题,使用了72\.4M tokens的量化感知训练数据。由此产生的模型Cloe在29项基准测试中进行了评估,并通过表示级诊断、匹配的下游微调和部署测量进行检验。证据显示了一种非均匀的退化模式。线性探针从全精度教师模型的最终层表示中恢复了43\.76%的MMLU答案,但从Cloe中仅恢复了26\.19%,接近25%的随机水平,这支持了专家级事实信息已大量丢失而非仅仅隐藏在受损输出通道之后的解释。与此同时,Cloe在十项任务上保留了可测量的性能,在该可解释子集上的平均表现相当于教师模型的77\.1%。对于特定应用部署更为重要的是,微调使Cloe在SST\-2上的性能从61\.9%提升至89\.8%,相当于匹配的微调教师模型的95\.6%,而在XSum上达到79\.4%的教师保留率。由于可用的QAT预算仅限于72\.4M tokens,我们将观察到的退化保守地归因于量化诱导的信息损失和不完全恢复的组合,而非仅仅是三元化。

我们还发现了一个评估陷阱:标准的答案字母评分最初报告了22\.97%的MMLU准确率,因为Cloe在98\.6%的问题上输出了“A”。因此,在整个可解释性评估中使用了续写评分和多数类防护。因此,该研究主张对极端量化采取能力感知的观点:三元转换可能不适合作为通用预训练模型的直接替代,但作为应用特定模型的紧凑、可适配基底仍有价值。

语言模型的部署经济学越来越受到移动、存储和执行模型权重的成本影响。降低数值精度是减少参数张量承载信息的最直接方式之一。三元模型通过将权重限制为\{−1,0,\+1\}\\\{\-1,0,\+1\\\}将这一理念推向极端,其理论信息含量为每个权重log2⁡3≈1\.585\\log\_\{2}3\\approx 1\.585比特\[3 (https://arxiv.org/html/2608.28809#bib.bib3)\]。

研究领域已经确立模型可以在这种低比特约束下进行原生训练\[2 (https://arxiv.org/html/2608.28809#bib.bib2),3 (https://arxiv.org/html/2608.28809#bib.bib3)\]。更具操作难度的问题是当一个*已预训练*的模型被推入这一范围时会发生什么。这种区分对从业者很重要,因为预训练模型包含了大量积累的、事实的、语言的和任务相关的结构。如果这些结构无法在转换中存活,那么更小的检查点并不一定意味着更有用的模型。

因此,本工作采取了一种刻意的诊断视角。我们没有将结果简化为一个单一的综合基准分数,而是提出了四个相互关联的问题:

1. 1\.能力:哪些行为在三元化后得以保留?
2. 2\.表示:任务表现不佳是由表示崩溃引起的,还是由特定存储信息的丢失引起的?
3. 3\.可学习性:压缩后的模型是否仍能通过监督适配获得新任务?
4. 4\.部署:打包的表示在存储和推理测量中实际带来了什么?

这比单一的“量化后准确率”数字能提供更有用的工程图景。

为何这对AI产品重要。通用模型和应用特定模型有不同的要求。通用模型必须保留广泛的知识。应用特定模型则可以根据它能否高效地表示和执行特定产品所需的能力来评判。因此,*知识保留*与*任务可学习性*之间的区别在商业上是相关的:它决定了极端压缩是否应被视为纯粹的破坏性压缩,还是应被视为通向紧凑专用模型的可能途径。

## 2 研究定位与相关工作

关于三元语言模型的先前工作大致可分为原生低比特训练和预训练模型转换\[4 (https://arxiv.org/html/2608.28809#bib.bib4),7 (https://arxiv.org/html/2608.28809#bib.bib7),8 (https://arxiv.org/html/2608.28809#bib.bib8),9 (https://arxiv.org/html/2608.28809#bib.bib9),10 (https://arxiv.org/html/2608.28809#bib.bib10)\]。BitNet b1\.58确立了使用三元权重训练语言模型的可行性。最近的方法如CAT\-Q、PTQTP、ScaleQ\-1\.58和Ternary Mamba研究了如何将预训练模型转换或适配到低比特范围。Falcon\-Edge代表了另一个方向:原生1\.58\-bit预训练模型,而非转换现有的全精度检查点\[11 (https://arxiv.org/html/2608.28809#bib.bib11),12 (https://arxiv.org/html/2608.28809#bib.bib12)\]。

这种区分对于定位本研究非常重要。本文的贡献*不是*声称是一个新的最先进三元量化器。相反,该工作使用QAT创建一个受控的三元转换,然后探究哪些信息、行为和可适配性得以保留。

表1:相对于项目文献中主要方向的定位。研究/方向|模型范围|核心方法|主要重点
---|---|---|---
BitNet b1\.58|原生三元|直接在低精度下训练|展示了三元训练和推理的可行性。
CAT\-Q|预训练转换|校准/训练后转换|展示了预训练模型可以被带入三元操作。
PTQTP|预训练转换|双三平面表示|改进了PTQ设置中三元权重的表示。
ScaleQ\-1\.58|预训练转换|使用附加生成信号的校准|探索了更强的训练后三元转换。
Ternary Mamba|预训练转换|分组量化+蒸馏/QAT|在精神上最接近转换现有模型并报告保留率。
Falcon\-Edge|原生低比特|原生1\.58\-bit预训练|展示了完全避免转换的替代策略。
本工作|预训练转换|QAT三元化+能力诊断|表征转换后丢失了什么、保留了什么,以及下游可学习性是否仍然存在。

表1 (https://arxiv.org/html/2608.28809#S2.T1)中的比较定义了本文的核心区别。转换方法通常通过询问结果模型是否保留了基准性能来评估。在这里,我们还额外询问了失败的基准结果是反映了缺失的信息、受损的输出通道、表示崩溃,还是可以通过特定任务训练修复的失败。这使得该研究更接近于一种*能力表征*,而非传统的量化排行榜条目。

## 3 模型与三元转换

### 3\.1 基础模型

Cloe源自Qwen3\.5\-0\.8B,具有约752M752\\text\{\\,\}\\mathrm\{M\}参数\[13 (https://arxiv.org/html/2608.28809#bib.bib13)\]。该模型包含24个Transformer层,其中18个线性注意力层和6个全注意力层。其隐藏层大小为1024,头维度为256。词汇表包含248,320个条目,嵌入层和语言模型头是绑定的。

表2:Cloe转换的核心配置。属性|值
---|---
基础模型|Qwen3\.5\-0\.8B
参数|752M752\\text\{\\,\}\\mathrm\{M}
Transformer层|24
注意力结构|18线性注意力+6全注意力
隐藏层大小|1024
头维度|256
词汇表|248,320
三元线性层|186/186
每个三元层的不同权重值|恰好3个
测量的三元熵|1\.5821 比特/权重
理想三元熵|1\.5850 比特/权重
累计QAT tokens|72\.4M

表2 (https://arxiv.org/html/2608.28809#S3.T2)中的数值确立了该转换不仅仅是一个量化启发式的近似。每个目标线性层都经过验证,确实包含恰好三个不同的权重值,且测量的熵值为1\.5821比特/权重,非常接近理论的三元极限。这一区别很重要,因为否则模型可能被描述为“三元”,但在其计算的某些部分仍保留了连续值权重。

### 3\.2 三元参数化

每个目标线性层使用绝对平均缩放和直通估计器\[14 (https://arxiv.org/html/2608.28809#bib.bib14)\]。有效的量化可以表示为

s\\displaystyle s=mean⁡\(\|W\|\),\\displaystyle=\\operatorname\{mean\}\(\|W\|\),\\(1\)Q⁡\(W\)\\displaystyle Q\(W\)=round⁡\(clamp⁡\(Ws,−1,1\)\)s,\\displaystyle=\\operatorname\{round\\}\\left\(\\operatorname\{clamp\\}\\left\(\\frac\{W\}\{s\},\-1,1\\right\)\\right\)s,\\(2\)Weff\\displaystyle W\_\{\\mathrm\{eff\\}\}=W+λ\(Q⁡\(W\)−W\)detach\.\\displaystyle=W+\\lambda\\left\(Q\(W\)\\-W\\right\)\_{\\mathrm\{detach\\}\}.\\(3\)
在推理时,λ=1\\lambda=1。在进行低精度矩阵乘法之前,对激活值应用RMSNorm\[15 (https://arxiv.org/html/2608.28809#bib.bib15)\]。

预训练BF16权重→绝对平均缩放→三元投影→QAT + STE→Cloe \{−1,0,\+1\}\\\{\-1,0,\+1\\\},权重网格在前向传播中被强制执行,186/186个目标线性层已验证。图1:用于获取Cloe的转换流程概览。
### 3\.3 三元执行路径的验证

低比特系统中一个潜在的实现故障是,检查点可能包含量化机制,而实际前向传播却默默地使用了潜在的全精度权重。因此,项目验证了所有186个目标层的加载量化状态。重构的权重与精确的三元网格仅相差约1\.8×10−61\.8\\times 10^\{\-6}相对尺度的浮点舍入。设置λ=0\\lambda=0并运行潜在权重会产生乱码,直接验证了被评估的模型依赖于三元路径。

解释。此验证弥合了量化实验中常见的可复现性差距:报告的行为归因于量化计算,而非偶然保留的全精度路径。

### 3\.4 重要的计账区别

“1\.58\-bit模型”这一短语指的是三元权重表示本身,而不一定是完整的检查点。248,320个token的嵌入表仍然是BF16的,并且与语言模型头绑定。因此,在项目报告中,整个检查点在磁盘上约为6\.47比特/参数,而非整个模型字面上的1\.58比特/参数。

这一区别在全文中被保留,因为它区分了*权重表示结果*与*全模型存储结果*。

## 4 评估框架

评估围绕一个简单原则设计:一个低比特模型不应仅仅因为原始基准数值高就被宣布有能力。相反,低数值也不应自动被解释为底层能力消失的证据。

表3:评估工具及其回答的问题。工具|测量内容|包含原因
---|---|---
续写评分|候选答案的可能性|避免依赖答案字母输出通道。
多数基线|平凡的类别选择性能|检测因标签不平衡导致的原始准确率虚高的情况。
平衡准确率|类别平衡的辨别力|防止常数预测被解释为能力。
线性探针|隐藏状态中可恢复的任务信息|区分无法访问/被移除的信息与输出头问题。
有效秩|表示方向的多样性|测试量化是否导致广泛的表示崩溃。
匹配微调|下游任务的可学习性|测试转换后是否仍能获取有用的任务结构。
困惑度|语言建模质量|衡量对token级建模的代价,而非任务分类。

因此,评估从*行为*转向*表示*再到*学习*。这一递进很重要:基准测试告诉我们模型未能完成某项任务,而表示探针和匹配微调实验有助于解释失败是反映了丢失的信息还是可适配性的丧失。

### 4\.1 答案字母失败

最初的多项选择评估产生了22\.97%的MMLU准确率,最初表明发生了灾难性失败\[16 (https://arxiv.org/html/2608.28809#bib.bib16)\]。检查生成的答案分布发现,Cloe在14,042个问题中有13,852个(即98\.6%的评估集)输出了“A”。

表4:暴露退化MMLU输出通道的答案字母分布。模型|A|B|C|D
---|---|---|---|---
Cloe, SFT前|13,852|113|14|63
Cloe, SFT后|6,801|2,505|1,248|3,488
BF16教师|3012,914|2,524|8,303

其含义是方法论上的,而不仅仅是消极的。通过答案字母诱导产生的分数只有在模型以允许真正区分的方式分布其输出时才有意义。因此,该项目用候选答案文本的长度归一化续写对数概率替换了这一工具。这也使得报告的基准结果与BitNet、Ternary Mamba和CAT\-Q所代表的三元文献更具可比性\[2 (https://arxiv.org/html/2608.28809#bib.bib2),3 (https://arxiv.org/html/2608.28809#bib.bib3),7 (https://arxiv.org/html/2608.28809#bib.bib7),11 (https://arxiv.org/html/2608.28809#bib.bib11)\]。

### 4\.2 误报防护

一项任务只有当其超过随机/多数阈值和平衡准确率阈值时,才被视为已证明的能力。

相似文章

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。

脆弱的思考:大型语言模型如何处理思维链扰动

arXiv cs.CL

本论文对大型语言模型在思维链推理步骤中处理损坏情况的能力进行了全面的实证评估,在数学推理任务上针对13个模型和5种扰动类型(数学错误、单位转换、盲从、跳过步骤、额外步骤)进行了测试。研究结果揭示了异质性的漏洞模式,对在多阶段推理管道中部署LLM具有重要意义。