attention-mechanisms

标签

Cards List
#attention-mechanisms

@ProfTomYeh:自注意力与交叉注意力交互式图解。打开 https://byhand.ai/self-vs-cross

X AI KOLs Timeline ↗ · 2026-09-20 缓存

比较AI模型中自注意力和交叉注意力机制的交互式图解,作为注意力教育库的一部分发布。

0 人收藏 0 人点赞
#attention-mechanisms

为什么视频扩散模型违反物理规律?揭示注意力机制中的缺陷

Hugging Face Daily Papers ↗ · 2026-09-20 缓存

本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。

0 人收藏 0 人点赞
#attention-mechanisms

内在注意力:选择性状态空间模型中的共识动态

arXiv cs.LG ↗ · 2026-09-17 缓存

本文研究选择性状态空间模型中的递归是否像Transformer中的注意力一样驱动令牌达成共识,利用动力系统理论分析时变权重矩阵的稳定性和吸引域。

0 人收藏 0 人点赞
#attention-mechanisms

注意力平均场预测平均表征动态并揭示上下文特定计算

arXiv cs.LG ↗ · 2026-09-16 缓存

本文介绍了一种注意力的平均场分析,该分析能够预测平均表征动态并揭示语言模型中的上下文特定计算,并在GPT-2、Pythia和Qwen-3-14B等模型上进行了验证。

0 人收藏 0 人点赞
#attention-mechanisms

@akshay_pachaar: AI工程师必须知道的13种注意力机制:(收藏这个)注意力的难点在于这些技术…

X AI KOLs Following ↗ · 2026-09-13 缓存

本文按瓶颈问题组织了AI中的13种注意力机制,涵盖KV缓存缩减、注意力模式、计算效率和服务效率,以帮助AI工程师理解和应用这些技术。

0 人收藏 0 人点赞
#attention-mechanisms

Transformer Circuits 的数学框架(2021)

Hacker News Top ↗ · 2026-09-12 缓存

本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。

0 人收藏 0 人点赞
#attention-mechanisms

Attention-DP3:基于几何对齐注意力条件化的空间感知3D扩散策略

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

Attention-DP3通过注意力机制融入对象级几何线索,增强了3D扩散策略,在复杂环境中提高了稳定性,并在多个基准测试中实现了最先进的性能。

0 人收藏 0 人点赞
#attention-mechanisms

@pavelsimo: 我已经解决了LeetGPU上所有的注意力问题。将它们全部放在一处,以便轻松找到:1/13

X AI KOLs Timeline ↗ · 2026-09-07 缓存

一位用户宣布他们已经解决了LeetGPU上所有与注意力相关的问题,并将它们编译成一个易于访问的资源。

0 人收藏 0 人点赞
#attention-mechanisms

滑动窗口优于线性注意力

Hugging Face Daily Papers ↗ · 2026-08-28 缓存

带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。

0 人收藏 0 人点赞
#attention-mechanisms

理解大语言模型推理在上下文长度和注意力架构下的能耗缩放

arXiv cs.LG ↗ · 2026-08-27 缓存

本文对大语言模型推理的能耗进行了系统性实证研究,分析了如多头注意力(Multi-Head Attention)、分组查询注意力(Grouped Query Attention)和滑动窗口注意力(Sliding Window Attention)等注意力架构如何影响不同上下文长度和工作负载下的能耗缩放。

0 人收藏 0 人点赞
#attention-mechanisms

ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。

0 人收藏 0 人点赞
#attention-mechanisms

ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩

arXiv cs.CL ↗ · 2026-08-21 缓存

ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。

0 人收藏 0 人点赞
#attention-mechanisms

@currying: 非常棒的13页讲解!

X AI KOLs Timeline ↗ · 2026-08-03 缓存

一条推文重点介绍了《理解Transformer与注意力机制》,这是一篇13页的论文,从应用数学的角度解释了Transformer架构和注意力机制。

0 人收藏 0 人点赞
#attention-mechanisms

@shubh6200: 周末花了些时间阅读这篇文章,老实说真希望它早几年就存在。我们看的每个AI教程都…

X AI KOLs Timeline ↗ · 2026-08-02 缓存

一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。

0 人收藏 0 人点赞
#attention-mechanisms

Transformer的熵界:为何静态秩失效而注意力原生秩恢复

arXiv cs.LG ↗ · 2026-07-28 缓存

本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。

0 人收藏 0 人点赞
#attention-mechanisms

通用AI控制:迈向多用途自适应算法

arXiv cs.AI ↗ · 2026-07-21 缓存

提出了一种新颖的通用控制器,采用注意力机制和专家混合,使单个神经网络无需针对特定系统进行调优即可控制多种动态系统。在25个不同系统上,其性能与传统控制器相当。

0 人收藏 0 人点赞
#attention-mechanisms

@classiclarryd: 向LLM研究社区提问:是否有人知道完全可重复的实验结果表明MLA能……

X AI KOLs Following ↗ · 2026-07-20 缓存

一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。

0 人收藏 0 人点赞
#attention-mechanisms

双向归纳:掩码扩散语言模型中上下文学习的机制分析

arXiv cs.CL ↗ · 2026-07-20 缓存

本文对掩码扩散语言模型中的归纳机制进行了机制分析,识别出一个双向归纳电路,并表明这些模型将全局掩码标记比例用作隐式时间步。

0 人收藏 0 人点赞
#attention-mechanisms

问两次,看两次:提示回响解决视觉语言模型中的问题优先悖论

arXiv cs.AI ↗ · 2026-07-20 缓存

本文识别了视觉语言模型中的“问题优先悖论”,即在图像之前提问虽然改善了视觉注意,但会阻碍答案准确性。本文提出了一种无需训练的技术——“问题回响”——在图像前后重复提问,该技术无需架构更改即可在多个基准测试中提升性能。

0 人收藏 0 人点赞
#attention-mechanisms

分离、细化、整合:为情感分析分解多模态融合

arXiv cs.CL ↗ · 2026-07-15 缓存

一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈