@lateinteraction: 猜猜NVIDIA在这里使用了什么?一种"基于注意力的编码器-解码器,可直接从其内部表示中检索…
摘要
NVIDIA采用了后期交互(一种稀疏注意力形式),用于基于注意力的编码器-解码器,以直接从内部表示中进行检索。
猜猜NVIDIA在这里使用了什么?一种"基于注意力的编码器-解码器,可直接从其内部表示中检索"?
后期交互是稀疏注意力 https://t.co/oRar8dRIqb
查看缓存全文
缓存时间: 2026/05/08 09:56
猜猜看 NVIDIA 在这里使用了什么,实现“基于注意力的编码器-解码器直接从其内部表示中检索”?后期交互就是稀疏注意力 https://t.co/oRar8dRIqb
相似文章
@lateinteraction: Late-interaction稀疏检索?利用神经元级倒排索引,基于无监督稀疏自编码器。效果更佳…
本文提出了一种使用无监督稀疏自编码器和自然倒排索引的单阶段稀疏编码方法,以加速多向量检索,其效果优于传统的基于k-means的方法。
@h100envy: 构建了NVIDIA TensorRT-LLM内核的CMU博士用68分钟讲解快速注意力——比1200美元的GPU课程更胜一筹
一位开发了NVIDIA现用于TensorRT-LLM的内核的CMU博士讲解了快速注意力,内容涵盖融合CUDA内核、FlashInfer、Triton和分页KV注意力,使同一GPU每秒能处理更多token。
@yifeiwang77: 感谢分享我们的工作 @lateinteraction @sum!这个想法极其简单:- 多向量检索成本高昂……
作者分享了他们通过将k-means用作top-1稀疏编码来降低多向量检索成本的工作。Omar Khattab补充说,在无监督稀疏自编码器上使用神经元级别倒排索引的晚期交互稀疏检索效果很好。
@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)
AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。
@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…
英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。