attention

标签

Cards List
#attention

MM-ShiftKV: 解码感知的预填充阶段KV选择用于多模态大语言模型

arXiv cs.AI · 2026-07-28 缓存

MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。

0 人收藏 0 人点赞
#attention

穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置

arXiv cs.LG · 2026-07-28 缓存

本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。

0 人收藏 0 人点赞
#attention

多模态域泛化的抑郁症检测:基于注意力的BiLSTM网络与域对抗训练

arXiv cs.LG · 2026-07-28 缓存

一种新颖的、不依赖患者的自动抑郁症检测多模态框架,整合了BiLSTM与模态内和跨模态注意力机制以及域对抗训练,以提高跨说话人的泛化能力。在Androids-Corpus数据集上达到了93.2%的先进准确率。

0 人收藏 0 人点赞
#attention

RED-PIM: 使用处理内存减少Transformer的数据移动

arXiv cs.LG · 2026-07-27 缓存

提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。

0 人收藏 0 人点赞
#attention

面向大型语言模型的卷积

arXiv cs.CL · 2026-07-22 缓存

本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。

0 人收藏 0 人点赞
#attention

@akshay_pachaar:你的 KV 缓存中 90% 从未被重用。(提示缓存从未旨在解决此问题)如果你的系统提示和工具定义…

X AI KOLs Following · 2026-07-20 缓存

CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。

0 人收藏 0 人点赞
#attention

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

arXiv cs.LG · 2026-07-20 缓存

提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。

0 人收藏 0 人点赞
#attention

相关与无关:Transformer注意力机制的重整化群分析

arXiv cs.LG · 2026-07-20 缓存

本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。

0 人收藏 0 人点赞
#attention

语义空间的几何:Transformer架构的连续几何框架

Hugging Face Daily Papers · 2026-07-19 缓存

提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。

0 人收藏 0 人点赞
#attention

遗忘注意力:一种可训练的支持向量记忆,具有认证选择和精确遗忘

arXiv cs.LG · 2026-07-15 缓存

提出支持向量注意力(SV-Attention),一种可训练的最大间隔记忆,通过可逆增量求解器提供令牌的零权重认证选择和精确遗忘。它实现了改进的稀有项召回率和患者记录删除能力。

0 人收藏 0 人点赞
#attention

打开黑盒:Unison 零参数模型

Reddit r/artificial · 2026-07-14 缓存

UnisonAI 是一个零参数、精确分数几何引擎,它基于史密斯折叠理论,从数学定律而非训练中推导出智能,并声称在保留文本上优于像 GPT 这样的训练模型。

0 人收藏 0 人点赞
#attention

记住独特项目而非标记:一种可学习的狄利克雷过程缓存,介于状态空间模型与注意力机制之间

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。

0 人收藏 0 人点赞
#attention

MCP工具选择实际在哪里失效:基于检索的修复最多只能挽回约23%的失败

Reddit r/AI_Agents · 2026-07-13

最近的分析表明,针对LLM智能体的基于检索的工具选择最多只能挽回约23%的失败,而针对注意力偏差的读取侧干预措施则可以挽回59-91%的失败,这表明真正的瓶颈在于模型的输出处理,而非输入过滤。

0 人收藏 0 人点赞
#attention

@PyTorch: https://bit.ly/4yawNqB..*

X AI KOLs Timeline · 2026-07-10 缓存

这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。

0 人收藏 0 人点赞
#attention

@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…

X AI KOLs Following · 2026-07-10 缓存

Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。

0 人收藏 0 人点赞
#attention

@VukRosic99: 大多数KV缓存压缩仅对键进行SVD,或者联合嵌入查询和键。两者都忽略了显而易见的目标…

X AI KOLs Timeline · 2026-07-10 缓存

KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。

0 人收藏 0 人点赞
#attention

从胎儿-母亲心电图到胎儿多普勒波形的跨模态生成式信号转换框架

arXiv cs.LG · 2026-07-10 缓存

本文提出了一种跨模态生成框架,利用跨模态注意力和膨胀卷积从胎儿-母亲心电图合成胎儿多普勒超声波形,提高了合成质量,并量化了母胎耦合的影响。

0 人收藏 0 人点赞
#attention

PyTorch 性能分析 (第3部分):注意力即剖析

Hugging Face Blog · 2026-07-10 缓存

本教程演示了如何使用 PyTorch 性能分析器在 NVIDIA A100 GPU 上对各种注意力实现进行性能分析,从朴素注意力到具有不同后端的缩放点积注意力。

0 人收藏 0 人点赞
#attention

FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力

arXiv cs.CL · 2026-07-09 缓存

本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。

0 人收藏 0 人点赞
#attention

基于梯度的语音到文本对齐方法,适用于任何ASR模型:从CTC到语音大语言模型

arXiv cs.CL · 2026-07-09 缓存

本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈