标签
比较AI模型中自注意力和交叉注意力机制的交互式图解,作为注意力教育库的一部分发布。
本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。
本文研究选择性状态空间模型中的递归是否像Transformer中的注意力一样驱动令牌达成共识,利用动力系统理论分析时变权重矩阵的稳定性和吸引域。
本文介绍了一种注意力的平均场分析,该分析能够预测平均表征动态并揭示语言模型中的上下文特定计算,并在GPT-2、Pythia和Qwen-3-14B等模型上进行了验证。
本文按瓶颈问题组织了AI中的13种注意力机制,涵盖KV缓存缩减、注意力模式、计算效率和服务效率,以帮助AI工程师理解和应用这些技术。
本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。
Attention-DP3通过注意力机制融入对象级几何线索,增强了3D扩散策略,在复杂环境中提高了稳定性,并在多个基准测试中实现了最先进的性能。
一位用户宣布他们已经解决了LeetGPU上所有与注意力相关的问题,并将它们编译成一个易于访问的资源。
带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。
本文对大语言模型推理的能耗进行了系统性实证研究,分析了如多头注意力(Multi-Head Attention)、分组查询注意力(Grouped Query Attention)和滑动窗口注意力(Sliding Window Attention)等注意力架构如何影响不同上下文长度和工作负载下的能耗缩放。
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。
一条推文重点介绍了《理解Transformer与注意力机制》,这是一篇13页的论文,从应用数学的角度解释了Transformer架构和注意力机制。
一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。
本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。
提出了一种新颖的通用控制器,采用注意力机制和专家混合,使单个神经网络无需针对特定系统进行调优即可控制多种动态系统。在25个不同系统上,其性能与传统控制器相当。
一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。
本文对掩码扩散语言模型中的归纳机制进行了机制分析,识别出一个双向归纳电路,并表明这些模型将全局掩码标记比例用作隐式时间步。
本文识别了视觉语言模型中的“问题优先悖论”,即在图像之前提问虽然改善了视觉注意,但会阻碍答案准确性。本文提出了一种无需训练的技术——“问题回响”——在图像前后重复提问,该技术无需架构更改即可在多个基准测试中提升性能。
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。