BF1: 用于高效长上下文Transformer的因果二元稀疏注意力改造

arXiv cs.LG 论文

摘要

本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。

arXiv:2608.20427v1 公告类型:新 摘要:即使使用高度优化的精确核实现,密集因果注意力在长上下文时仍然昂贵。我们研究BF1,一种确定性块对齐二元稀疏注意力路由,它结合了小的精确局部邻域、全局首块和对数间隔的历史块。该路由与先前的对数稀疏和扩张注意力模式相关;我们的贡献是正确性门控的预训练模型改造、匹配的拓扑控制研究,以及将每层稀疏性与全模型延迟相连接的系统特性分析。对于固定块宽度,每个转换层使用O(n log n)个选定令牌交互,并具有O(log n)图通信深度。在NVIDIA RTX PRO 6000 Blackwell GPU上,一个优化的BF16实现在2K到4K令牌之间超越密集注意力,并在32K时达到每层10.91倍的预填充加速。改造28层Qwen3-0.6B注意力层中的八层,在8K、16K和32K时分别降低热启动全模型到首个令牌的时间7.7%、11.3%和15.3%,而剩余的密集层保持完整模型渐进二次复杂度。在匹配的1,000步、16.384M令牌适应协议下,BF1在三个训练种子中排名第一:平均报告困惑度为1.68639,而匹配的静态随机非局部图为1.69154,密集持续训练为1.69258,等预算局部滑动为1.81505。在种子1234下,打包报告配对区间将Dense-CT置于比BF1高0.3169-0.4055%,静态随机图17比BF1高0.2441-0.3642%。这些结果确立BF1为一种可复现的稀疏算子和选择性改造原语,具有实际长上下文系统价值。本文评估数值正确性、选定交互缩放、核性能、部分模型推理和匹配的下一个令牌语言建模。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:28

# BF1:面向高效长上下文Transformer的因果对偶稀疏注意力改造
来源:https://arxiv.org/abs/2608.20427
文献工具

## 文献与引用工具

文献探索器切换

代码、数据、媒体

## 与本文相关的代码、数据及媒体

演示

## 演示

相关论文

## 推荐与搜索工具

IArxiv 推荐器切换

关于 arXivLabs

## arXivLabs:与社区协作者共同推进的实验性项目

arXivLabs是一个框架,允许协作者直接在我们网站上开发和分享新的arXiv功能。

所有使用 arXivLabs 的个人和组织都已认同并接受我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 坚守这些原则,仅与认同这些价值观的合作伙伴开展协作。

有一个能为 arXiv 社区带来价值的项目构想?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

学习如何遗忘:针对长上下文稀疏注意力的微调

arXiv cs.CL

本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。

BCMT:分块因果记忆Transformer

arXiv cs.CL

BCMT引入了一个分块因果记忆Transformer架构,它在长上下文语言建模中解耦了局部和全局依赖,在保持与密集Transformer相当的性能的同时提高了效率。