BF1: 用于高效长上下文Transformer的因果二元稀疏注意力改造
摘要
本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。
arXiv:2608.20427v1 公告类型:新
摘要:即使使用高度优化的精确核实现,密集因果注意力在长上下文时仍然昂贵。我们研究BF1,一种确定性块对齐二元稀疏注意力路由,它结合了小的精确局部邻域、全局首块和对数间隔的历史块。该路由与先前的对数稀疏和扩张注意力模式相关;我们的贡献是正确性门控的预训练模型改造、匹配的拓扑控制研究,以及将每层稀疏性与全模型延迟相连接的系统特性分析。对于固定块宽度,每个转换层使用O(n log n)个选定令牌交互,并具有O(log n)图通信深度。在NVIDIA RTX PRO 6000 Blackwell GPU上,一个优化的BF16实现在2K到4K令牌之间超越密集注意力,并在32K时达到每层10.91倍的预填充加速。改造28层Qwen3-0.6B注意力层中的八层,在8K、16K和32K时分别降低热启动全模型到首个令牌的时间7.7%、11.3%和15.3%,而剩余的密集层保持完整模型渐进二次复杂度。在匹配的1,000步、16.384M令牌适应协议下,BF1在三个训练种子中排名第一:平均报告困惑度为1.68639,而匹配的静态随机非局部图为1.69154,密集持续训练为1.69258,等预算局部滑动为1.81505。在种子1234下,打包报告配对区间将Dense-CT置于比BF1高0.3169-0.4055%,静态随机图17比BF1高0.2441-0.3642%。这些结果确立BF1为一种可复现的稀疏算子和选择性改造原语,具有实际长上下文系统价值。本文评估数值正确性、选定交互缩放、核性能、部分模型推理和匹配的下一个令牌语言建模。
查看缓存全文
缓存时间: 2026/08/24 04:28
# BF1:面向高效长上下文Transformer的因果对偶稀疏注意力改造 来源:https://arxiv.org/abs/2608.20427 文献工具 ## 文献与引用工具 文献探索器切换 代码、数据、媒体 ## 与本文相关的代码、数据及媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 IArxiv 推荐器切换 关于 arXivLabs ## arXivLabs:与社区协作者共同推进的实验性项目 arXivLabs是一个框架,允许协作者直接在我们网站上开发和分享新的arXiv功能。 所有使用 arXivLabs 的个人和组织都已认同并接受我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 坚守这些原则,仅与认同这些价值观的合作伙伴开展协作。 有一个能为 arXiv 社区带来价值的项目构想?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
学习如何遗忘:针对长上下文稀疏注意力的微调
本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。
@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…
MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。
Asymmetric Attention Heads: 面向Transformer注意力的结构化头级上下文分配
本文介绍了Asymmetric Attention Heads (AAH),一个为transformer中的注意力头分配不同上下文窗口的框架,实验表明语言建模性能得到提升。
语法引导的稀疏注意力机制:实现高效可解释的Transformer
本文介绍了一种针对Transformer的语法引导稀疏注意力机制,旨在通过利用语言结构来提高效率和可解释性。
BCMT:分块因果记忆Transformer
BCMT引入了一个分块因果记忆Transformer架构,它在长上下文语言建模中解耦了局部和全局依赖,在保持与密集Transformer相当的性能的同时提高了效率。