标签
MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。
本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。
一种新颖的、不依赖患者的自动抑郁症检测多模态框架,整合了BiLSTM与模态内和跨模态注意力机制以及域对抗训练,以提高跨说话人的泛化能力。在Androids-Corpus数据集上达到了93.2%的先进准确率。
提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。
本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。
CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。
提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。
本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。
提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。
提出支持向量注意力(SV-Attention),一种可训练的最大间隔记忆,通过可逆增量求解器提供令牌的零权重认证选择和精确遗忘。它实现了改进的稀有项召回率和患者记录删除能力。
UnisonAI 是一个零参数、精确分数几何引擎,它基于史密斯折叠理论,从数学定律而非训练中推导出智能,并声称在保留文本上优于像 GPT 这样的训练模型。
本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。
最近的分析表明,针对LLM智能体的基于检索的工具选择最多只能挽回约23%的失败,而针对注意力偏差的读取侧干预措施则可以挽回59-91%的失败,这表明真正的瓶颈在于模型的输出处理,而非输入过滤。
这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。
Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。
KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。
本文提出了一种跨模态生成框架,利用跨模态注意力和膨胀卷积从胎儿-母亲心电图合成胎儿多普勒超声波形,提高了合成质量,并量化了母胎耦合的影响。
本教程演示了如何使用 PyTorch 性能分析器在 NVIDIA A100 GPU 上对各种注意力实现进行性能分析,从朴素注意力到具有不同后端的缩放点积注意力。
本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。
本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。