标签
斯坦福NLP宣布,一篇题为《大语言模型中的未完成体悖论》的语言学视角NLP论文在ACL 2026上获得最佳论文奖,鼓励对大语言模型进行更细致的语言学评估。
BLASST 是一种无需训练的动态稀疏注意力机制,它利用在线 softmax 统计量上的单一标量阈值来跳过不重要的注意力块,在 MLSys26 上获得最佳论文奖。该机制在保持准确性的同时,实现了超过 70% 的稀疏度,预填充阶段加速 1.52 倍,解码阶段加速 1.48 倍。