bidirectional-attention

标签

Cards List
#bidirectional-attention

@nathanrs: 新帖子!扩散LLM的一个缺点是双向注意力机制导致键值跨步骤漂移,破…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

一篇新帖子强调了扩散LLM的一个缺点:双向注意力机制导致键值跨步骤漂移,破坏了KV缓存。不过,生成质量对轻微的KV漂移具有鲁棒性,研究重点已放在最大化陈旧KV重用而不导致质量下降上。

0 人收藏 0 人点赞
#bidirectional-attention

改进的大型语言扩散模型

arXiv cs.CL ↗ · 2026-06-25 缓存

iLLaDA是一个80亿参数的掩码扩散语言模型,具有完全双向注意力机制,从头开始在12万亿token上训练。与LLaDA相比,它在多个方面都有显著改进,并在多个基准测试上与Qwen2.5 7B保持竞争力。模型和代码已开源。

0 人收藏 0 人点赞
#bidirectional-attention

为何 DiffusionGemma 在工具调用上可能优于其基准质量所暗示的表现

Reddit r/LocalLLaMA ↗ · 2026-06-16

分析了 DiffusionGemma 的双向注意力和并行块生成如何由于其能够修正 token 的能力,可能产生更高的有效工具调用率,尽管其基础质量低于 Gemma 4。

0 人收藏 0 人点赞
#bidirectional-attention

[Talk] Text Diffusion — Google DeepMind's Brendan O’Donoghue

Reddit r/LocalLLaMA ↗ · 2026-06-11 缓存

DeepMind研究员Brendan O'Donoghue深入介绍文本扩散模型,通过迭代去噪生成文本,相比自回归模型延迟更低但吞吐量受限,并展示自修正和动态计算等独特优势。

0 人收藏 0 人点赞
#bidirectional-attention

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG ↗ · 2026-06-09 缓存

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈