Kathleen写作:无注意力机制的自回归生成与数据规模扩展
摘要
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
arXiv:2608.04678v1 公告类型:新
摘要:Kathleen系列的第1-2篇论文表明,一种由波表编码器和多尺度混响状态构建的字节级无注意力架构,在约45-70万参数下无需预训练即可在分类任务上匹配强基线。我们探究同样的组件能否用于生成。(1) 规模扩展:在字节级语言建模(WikiText-103,原始UTF-8,无分词器)上,混响模型在每一个测量的数据集规模(2-512 MB)上都击败了参数匹配的transformer,例如在512 MB、约0.5M参数下,1.84 vs 2.04 bits/byte;transformer需要超过512 MB才能匹配无注意力模型从32 MB中学到的内容。(2) 度量:我们引入了FORM DISTANCE(形式距离),一种非参数、抗游戏的工具,用于衡量“读起来像文本”的程度:人类文本的九个统计轴定义了一个参考云,所有五个构造的假样本都被拒绝。(3) 生成:解码策略主导架构——加宽采样器使同一模型的距离减半(从3.17降至1.52),而检索增强解码方案在不涉及任何训练步骤的情况下使冻结模型更进一步(从1.52降至1.14);消融实验将该收益归因于稀疏短语剂量本身,而非选择门控。该收益有一个明显的边界条件:短语必须来自模型自身的训练语料库——一个40倍大的外部库完全没有帮助,注意力孪生模型也有同样的效果,这与上下文内整合是一种规模化能力相一致。我们还报告了四种没有帮助的架构添加,以及一个计算词典,在五分之一的参数下达到了学习表格的top-1准确率的94%。所有内容均在离线环境运行;所有实验都可在免费的Kaggle T4上复现。
查看缓存全文
缓存时间: 2026/08/06 07:50
# 自回归生成与无注意力数据缩放
来源:https://arxiv.org/html/2608.04678
George Fountzoulas 计算机工程与信息学系 弗雷德里克大学,塞浦路斯尼科西亚 george\.fountzoulas\.research@gmail\.com
\(2026年8月\)
###### 摘要
Kathleen 系列的第 1–2 篇论文表明,一种由波表编码器和多尺度混响状态构建的字节级、无注意力架构,可以在 ∼\{\\sim\}450–700K 参数下,在不进行预训练的情况下匹配强基线在分类任务上的表现。悬而未决的问题是,同样的要素能否*生成*。我们用三个部分来回答。\(1\) 缩放。在字节级语言建模(WikiText\-103,原始 UTF\-8,无分词器)上,混响模型在我们测量的每个数据规模——2、8、32、128 和 512 MB——上都优于参数匹配的 transformer,例如在 512 MB 规模、∼\{\\sim\}0.5M 参数下为 1.84 对 2.04 比特/字节,同时训练预算在免费 GPU 额度内。从数据效率的角度说:transformer 需要超过 512 MB 才能匹配无注意力模型从 32 MB 学到的结果。注意力基线的对数\-对数斜率更陡(−0.107\-0.107 对 −0.074\-0.074)——这是从落后追赶的形状——但两条曲线都同时趋于相同的固定容量上限,而且其追赶速度本身也在衰减;在端侧设备范围内,无注意力模型处处领先。\(2\) 度量。困惑度并不能衡量生成文本是否*读起来*像文本。我们引入 FORM DISTANCE,一种非参数、抗游戏的测量工具:人类文本的九个统计轴(词汇丰富度、流畅度、局部重复、二元/三元组合理性……)定义一个参考云;生成器根据其到该云的距离被评分,并归一化使得人类文本位于 1.0。五种构造的伪造文本(词汤、鹦鹉、无人机、洗牌、三元组呓语)都被该工具拒绝。\(3\) 生成。在冻结的工具上,解码策略主导架构:加宽采样器(top\-1000,T=1.15T=1.15)将同一模型的距离减半,3.17→1.523\.17\\to 1.52——该工具更早的八轴版本将此策略读作完全人类(1.00),它与人类读者的分歧暴露了游戏通道(发明的三元组),而第九个轴现在封死了它。一种检索增强解码方案——在生成过程中提出语料短语并与自由词交错——将冻结模型进一步推进,1.52→1.141\.52\\to 1.14,且置信区间分离,无需任何训练步骤;消融研究将增益归因于稀疏短语剂量本身,而非选择短语的隐藏状态门。该增益有一个尖锐的边界条件:短语必须来自模型*自身*的训练语料——一个 40×40\\times 更大的外部库毫无帮助,注意力孪生模型也有同样的效应(我们同时审计了工具和架构),这与情境整合是一种规模能力、3M 参数模型无论哪一族都缺乏这一点一致。我们还如实报告了四种在该规模下*没有*帮助的架构添加,以及一个负面结果:计算得到的(无梯度)词典在五分之一的参数下达到了学习嵌入表 top\-1 准确率的 94%,但未能达到其困惑度。一切都在商品硬件上离线运行;所有实验都可以在免费的 Kaggle T4 上复现。
## 1 引言
本系列的前两篇论文确立了一个小的、无注意力、无分词器的架构可以*阅读*:直接操作原始 UTF\-8 字节,由波表字节编码器和多尺度混响状态构成的骨干,在约 450–700K 参数下匹配或超越了规模大得多的分词基线在情感和主题分类上的表现——并且在第二篇论文\[17 (https://arxiv.org/html/2608.04678#bib.bib17)\]中,完全消除了基于梯度的预训练。编码器通过 DFT 相位旋转从单个可学习向量衍生出全部 256 个字节向量;混响状态用内容门控的指数衰减在三个时间常数上取代注意力——一种遗忘率由内容本身决定的衰减记忆。那些论文刻意留下的更难动词是:同样的要素能否*书写*?
回答这个问题实际上需要同时回答三个问题。首先,缩放:生成器生死取决于其语言模型,所以我们必须知道无注意力骨干对下一个字节预测是否具有竞争力,并且——由于没有小模型只训练一次——这种竞争力如何随数据变化。其次,度量:困惑度衡量预测,而非采样文本是否*读起来*像文本;而流行的替代方案——让大语言模型来评判——对于一个前提是独立于大模型的项目来说是循环论证,而且无法离线使用。我们需要一个廉价、冻结且难以游戏的工具。第三,归因:当生成改善时,是哪个旋钮起了作用——架构、解码策略,还是解码时外挂的记忆?小模型正是这个问题能够真正得到回答的地方,因为每个旋钮都可以在免费级硬件上详尽地扫描。
本系列的设计约束原样延续:字节级约∼\{\\sim\}0.5M 参数,词级≤∼\\leq\{\\sim\}3M;一切都离线;每个实验都能在免费 Kaggle T4 上复现;整个流程中没有任何外部教师模型。在这些约束内,本文贡献了:\(a\) 一个五点数据缩放研究,2–512 MB,无注意力骨干在每个点上都击败参数匹配的 transformer,并在多种种子和第二个数据集上复现,且由冻结探针迁移研究佐证;\(b\) FORM DISTANCE,一种非参数、经过验证、抗游戏的“读起来像文本”测量工具,包括它被游戏的那一次如实记录以及如何修补;\(c\) 一个解码时归因研究,其头条令人不适但很有用:在该规模下,形式由解码策略和检索短语赢得,而非骨干的架构添加——我们报告了四个预先注册的添加均无帮助。
## 2 架构(共享要素)
- •ByteRotate 编码器——一个可学习向量 w∈Rdw\\in\\mathbb\{R\}^\{d\};字节 bb 得到 irfft\(rfft\(w\)⋅e2πibf/256\)\\mathrm\{irfft\}\(\\mathrm\{rfft\}\(w\)\\cdot e^\{2\\pi i\\,bf/256\}\)。128 个参数覆盖整个字节字母表。(沿用自第 1 篇论文。)
- •多尺度混响——三个包含内容相关衰减 γ∈\[0.50,0.90\]\\gamma\\in\[0.50,0.90\]/\[0.90,0.99\]\[0.90,0.99\]/\[0.95,0.9995\]\[0.95,0.9995\] 的库;递推 st=γtst−1\+\(1−γt\)vts\_\{t\}=\\gamma\_\{t\}s\_\{t\-1\}\+\(1\-\\gamma\_\{t\}\)\\,v\_\{t\}。这就是注意力的替代品:一种在三个时间尺度上衰减、内容门控的记忆。
- •混响块——LayerNorm→\\to 混响 ∥\\parallel 因果深度卷积→\\to 学习门混合两者→\\to FFN。三个块,d=128d=128。
- •快速扫描(新增,工程实现):通过 cumprod/cumsum 闭式形式以 16 为块计算混响递推;与顺序循环的等价性验证到 10−710^\{\-7\};约∼\{\\sim\}10–50×\\times 墙钟加速。这就是让 512 MB 数据点能在免费 T4 上训练的原因。(附录A (https://arxiv.org/html/2608.04678#A1)。)
- •字节级语言模型:565,888 参数(混响)对 463,360(注意力基线:相同骨架,但用 4 头因果 SDPA 替换混响+卷积)。用于生成研究的词级变体:3.08M 参数,10K 词表,WikiText\-2。
## 3 无注意力缩放(道路)
#### 协议。
WikiText\-103\[12 (https://arxiv.org/html/2608.04678#bib.bib12)\] 作为原始 UTF\-8 字节。训练切片为 2、8、32、128、512 MB;固定测试切片(1 MB);2 个 epoch,序列长度 256 字节,AdamW,余弦调度,双臂配方完全相同;运行前预先注册判定阈值。免费级硬件(T4/H100 混合;每字节比特数与硬件无关)。
表 1:字节级缩放道路,种子 42(比特/字节,越低越好)。对数\-对数斜率(bpb 对 MB):REVERB −0.074\-0.074,ATTN −0.107\-0.107。
参照标题图 1:道路:比特/字节 对 训练数据(对数\-对数),双臂,五个点,带双种子误差棒。
#### 解读。
\(i\) 无注意力模型在跨越三个数量级数据的每个点上获胜。\(ii\) 从数据效率来说:在 512 MB 上训练的 transformer(2.043 bpb)没能达到在 32 MB 上训练的混响模型(2.011 bpb)——在同等参数下 ≥16×\\geq 16\\times 的数据优势。\(iii\) 注意力臂显示出更陡的对数\-对数斜率(−0.107\-0.107 对 −0.074\-0.074),但这不能被过度解读:更陡的斜率正是从落后追赶的样子,而且两条曲线同时变平——这是共享的∼\{\\sim\}0.5M 参数容量上限的迹象,而非架构的判决。外推*最后*区间会将任何交叉点放到数百 GB 的量级,远远超出本工作所针对的端侧设备范围。\(iv\) 这个实验*不*测量的,按设计:参数随数据增长时的大规模行为(计算最优前沿\[7 (https://arxiv.org/html/2608.04678#bib.bib7),8 (https://arxiv.org/html/2608.04678#bib.bib8)\])。关于该量级,无论哪个方向的结论都不能从这些曲线得出;相关的递推(SSM 家族\[2 (https://arxiv.org/html/2608.04678#bib.bib2),3 (https://arxiv.org/html/2608.04678#bib.bib3),4 (https://arxiv.org/html/2608.04678#bib.bib4)\])已知可以在数十亿参数上追踪 transformer,而本架构对应的实验是未来的工作,而非让步。
#### 稳健性(测量于 2026\-08\-02,Kaggle T4,单次会话)。
*第二种子。*用种子 43 重复完整道路,几乎精确复现种子 42(例如 128 MB REVERB:1.9036 对 1.9039)。双种子均值:
表 2:双种子均值 ±\\pm 半范围。种子级斜率一致到小数第三位(REVERB −0.0744/−0.0732\-0.0744/\-0.0732,ATTN −0.1071/−0.1072\-0.1071/\-0.1072):曲线是系统的性质,而非种子的性质。
*第二个数据集。*enwik8(Wikipedia XML,未清洗字节),2/8/32 MB:
表 3:enwik8 稳健性检查。enwik8 上的斜率:REVERB −0.133\-0.133,ATTN −0.152\-0.152——近似平行;“注意力更陡”的解读本身就依赖于数据集。两个数据集、两个种子的每个完成点:REVERB 都领先。
#### 下游迁移(BRIDGE,H100,冻结探针协议)。
在 0/2/32/512 MB 预训练的骨干,冻结;只训练*线性头*(258 参数)在 SST\-2\[13 (https://arxiv.org/html/2608.04678#bib.bib13)\] 和 IMDB\[14 (https://arxiv.org/html/2608.04678#bib.bib14)\] 上:
表 4:冻结探针迁移(准确率,%)。BERT 链\[1 (https://arxiv.org/html/2608.04678#bib.bib1)\]在没有注意力的情况下成立:仅字节级语言模型预训练就将情感注入冻结表示(SST\-2 上比随机骨干 +12\+12 点),且混响骨干在每一个预训练规模上都比注意力孪生迁移得更好。32→\\to512 MB 的平台与 bpb 曲线一致——这是第二个独立工具读取相同的容量上限。
#### 探针 vs 完整配方(同一条链的两端)。
这些按设计是冻结探针数字——它们隔离仅仅预训练为骨干注入的内容。另一端也被测量了:完整的 Kathleen 配方(Arm\-H:V9 字节流水线 + 在分类器处融合的计数全息意义 + 5 阶段手工构建的语言课程——否定翻转、对比、“despite”、让步结构——+ 80K Stanford 短语,严格开发集排除)在 468K 参数下达到 SST\-2 开发集 96.4%(最佳观测运行 96.56%),残差错误恰好集中在语法最难的地方(否定 4.5%,对比 3.4% 错误率)。机制(本节)和上限(Arm\-H)界定了这一主张:读取更多字节换来理解,而有针对性的课程加上计数意义买来其余部分——链条中没有任何注意力也没有基于梯度的预训练。与我们早期文档级研究一致,在冻结的句子训练骨干下,无论聚合策略如何(均值/top\-k/MIL/主观性门控),IMDB 在 88% 附近达到平台——缺失的 pp 存在于任务对齐预训练中,而这正是本节所测量的杠杆。
## 4 FORM DISTANCE——“读起来像文本”的仪表
每字节比特数衡量模型预测文本的好坏;它完全不说明模型*采样*的文本是否读起来像文本。两者可能且确实会分离:第5节 (https://arxiv.org/html/2608.04678#S5)中的每个解码策略结果都剧烈改变形式,而权重——因此困惑度——保持固定。流行的修复办法,即让大语言模型来评判,在这里双重不可用:对于一个前提是独立于大模型的项目是循环论证,且它无法离线运行。因此我们仅从表面统计构建了一个冻结工具。(关于无评判者的参数化替代方案,见 MAUVE\[9 (https://arxiv.org/html/2608.04678#bib.bib9)\];第6节 (https://arxiv.org/html/2608.04678#S6)。)
#### 构造(v6.2)。
九个轴从一段文本的表面统计计算得到:内容词丰富度(RICH)、三元组多样性(FLOW)、开头与结尾三分之一之间的主题持续性(HOLD)、块到块的语义连续性(GRAIN)、后期新颖率(NEW)、局部二元组良好形成(LOCAL)、随距离的语义发展(ARC)、未见二元组率(CLUNK)和未见三元组率(CLUNK3)。四百段留出的人类 WikiText 文本在这个九维空间中定义一个参考云;生成器根据其到云的 Mahalanobis 式距离被评分,并归一化使得留出的人类文本读作 1.0。伴随的百分位视图(典型性:人类≈\{\\approx\}50)在距离饱和处提供云附近的解析度。关键地,没有任何轴方向被假定为好:一个轴只有在两个退化对照在该轴上均远远落在人类带之外时才赢得其位置——词汤在一个方向上失败,鹦鹉在另一个方向上失败,所以任何轴的“更多”都不是目标,*典型性*才是。
#### 验证(图2 (https://arxiv.org/html/2608.04678#S4.F2))。
在测量任何模型之前,五种构造的伪造文本探测该工具:词汤(二元组采样——局部流畅,无结构)、鹦鹉(一句短语永远重复)、无人机(内容词被覆盖)、洗牌(局部词序被破坏)和三元组呓语(语料可证的三元组拼接成全局胡言——专门为占据宽采样器逃逸所经过的洞而构建)。所有五种读起来都远离参考云(典型性≤4\\leq 4,大多数 0.0;距离 1.9–13.2),而留出的人类文本按构造读作 1.0/典型性≈\{\\approx\}50。第九个轴有一段值得讲述的历史:该工具更早的八轴版本将一个宽采样器策略评分为完全人类,而人类读者称同样的样本为词沙拉;这一分歧暴露了一个游戏通道——发明的三元组——CLUNK3 和三元组呓语对照现在封死了它(完整事件及公式见附录B (https://arxiv.org/html/2608.04678#A2))。
参照标题图 2:工具验证:留出的人类文本 对 五种构造的伪造文本和两种保守解码模型,在距离和典型性上。
#### 首次读数。
两种架构,保守解码,都从距离≈\{\\approx\}3.3 开始,且*相同*的主导失败轴(LOCAL:安全 n\-gram 的重复)。共享的失败本身就是一个发现:小模型文本的胆怯不是注意力问题,而是解码问题——这正是第5节 (https://arxiv.org/html/2608.04678#S5) 深入的地方。相似文章
@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。
使用稀疏Transformer进行生成建模
OpenAI推出了稀疏Transformer,一种深度神经网络,将注意力机制的复杂度从O(N²)优化到O(N√N),使得能够对长度超过以前30倍的序列进行建模,适用于文本、图像和音频领域。该模型采用稀疏注意力模式和基于检查点的内存优化技术,可以训练深达128层的网络,在多个领域实现了最先进的性能。
当新生成器到来:基于岭特征迁移的终身机器生成文本归因
本文提出RidgeFT,一个轻量级的分析更新框架,用于终身机器生成文本归因,能够适应新的文本生成器而不遗忘旧的,在多个评估设置中取得了强劲性能。
@omarsar0:来自 Google DeepMind 及其同事的重磅论文。(收藏它)一个模型在每次生成时读取其整个 KV 缓存……
这篇论文介绍了声明式注意力,一种允许语言模型声明其在思维链中关注位置的协议,在 Gemma-4-31B 上减少 52% 的关注令牌,在 Qwen-3.6-27B 上减少 31.1%,精度损失最小。
注意力漂移:自回归投机解码模型学到了什么
本文指出了自回归投机解码模型中的“注意力漂移”现象,即草稿模型的注意力从提示词转移到了其自身生成的令牌上。作者提出了架构上的改进,例如后归一化(Post-norm)和 RMSNorm,这些改进在各种基准测试中提高了接受率和鲁棒性。