multi-head-attention

标签

Cards List
#multi-head-attention

多头注意力残差

Hugging Face Daily Papers · 2026-07-22 缓存

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。

0 人收藏 0 人点赞
#multi-head-attention

Prism Transformer: 渐进式头调度用于层级注意力处理

arXiv cs.LG · 2026-06-29 缓存

Prism Transformer 用渐进式头调度替代了统一的多头注意力机制,该调度在层间逐步增加头的数量,从而在不增加参数或计算量的情况下实现从局部到全局的层级结构。在124M、354M和757M三个模型规模上,它在语言建模和零样本基准测试中始终优于标准Transformer。

0 人收藏 0 人点赞
#multi-head-attention

用于数据中心 SLA 合规监控的多头注意力方法

arXiv cs.LG · 2026-05-08 缓存

本文提出了一种框架,利用多头 Transformer 模型提前 30 分钟预测数据中心的 SLA 违约情况,并通过将规则编码为 JSON 进行训练,无需人工标注。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈