parallel-decoding

标签

Cards List
#parallel-decoding

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL · 2026-06-01 缓存

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。

0 人收藏 0 人点赞
#parallel-decoding

@ZhidingYu:感谢 NVIDIA!我将在 #CVPR2026 上于 NVIDIA 展台展示 LocateAnything:6月5日 MDT 下午4:20-4:40(周五…

X AI KOLs Following · 2026-05-28 缓存

NVIDIA 推出了 LocateAnything,这是一个统一的生成式定位与检测框架,采用并行框解码(Parallel Box Decoding)来提升解码吞吐量和定位精度。该工作将在 CVPR 2026 上进行展示。

0 人收藏 0 人点赞
#parallel-decoding

LocateAnything: 快速高质量的视觉-语言定位与并行框解码

Hugging Face Daily Papers · 2026-05-26 缓存

LocateAnything 提出并行框解码用于统一视觉定位与目标检测,将几何元素解码为原子单元,以提高吞吐量和定位精度,并得到包含1.38亿样本的大规模数据集的支持。

0 人收藏 0 人点赞
#parallel-decoding

迈向光速文本生成:Nemotron-Labs扩散语言模型

Hugging Face Blog · 2026-05-23 缓存

NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。

0 人收藏 0 人点赞
#parallel-decoding

@NVIDIAAI: 大多数语言模型一次只生成一个token。我们刚刚发布了Nemotron-Labs-Diffusion,一个扩散语言模型系列…

X AI KOLs Following · 2026-05-19 缓存

NVIDIA发布了Nemotron-Labs-Diffusion,这是一个扩散语言模型系列,可以并行生成多个token,从而实现更快的推理和更好的GPU利用率,模型规模从3B到14B,包括视觉语言变体。

0 人收藏 0 人点赞
#parallel-decoding

展开与回滚:扩散大语言模型是自身的效率教师

arXiv cs.CL · 2026-05-19 缓存

本文介绍了 WINO 和 WINO+,这两种方法能够在扩散大语言模型中实现可撤销的并行解码,并提炼高效的降噪轨迹,显著改善质量-速度权衡。

0 人收藏 0 人点赞
#parallel-decoding

PSD: 通过并行推测解码推动扩散大语言模型的帕累托前沿

arXiv cs.CL · 2026-05-18 缓存

本文介绍了一种无需训练的框架——并行推测解码(PSD),它通过同时提升空间和时间效率来加速扩散大语言模型的推理,每次前向传递最多可处理5.5×的token数,且质量与贪婪解码相当。

0 人收藏 0 人点赞
#parallel-decoding

@DivyanshT91162: 自回归大语言模型可能正在被取代 有人构建了dLLM——一个开源库,可以将任何自…

X AI KOLs Timeline · 2026-05-16 缓存

dLLM是一个开源库,可将任何自回归大语言模型转换为扩散大语言模型,实现并行解码和更快的文本生成。

0 人收藏 0 人点赞
#parallel-decoding

Orthrus-Qwen3-8B:在Qwen3-8B上实现高达7.8倍每前向传播token数,冻结主干网络,可证明输出分布一致

Reddit r/LocalLLaMA · 2026-05-15

介绍Orthrus,一种在冻结的自回归Transformer中注入可训练的扩散注意力模块的方法,在MATH-500上实现高达7.8倍每前向传播token数和约6倍实际时间加速,且输出分布与基础Qwen3-8B模型可证明一致。该方法仅需极少的额外参数和训练,并避免了外部草稿模型带来的TTFT惩罚。

0 人收藏 0 人点赞
#parallel-decoding

LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力

arXiv cs.LG · 2026-05-13 缓存

本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。

0 人收藏 0 人点赞
#parallel-decoding

@JulieKallini: Fast Byte Latent Transformer 被 ICML 2026 接收!字节级语言模型有望摆脱子词分词器,但解码……

X AI KOLs Following · 2026-05-11 缓存

快速字节潜在变换器(BLT-D)已被 ICML 2026 接收,它引入了一种文本扩散方法,用于并行字节级解码,以克服传统字节级语言模型的速度限制。

0 人收藏 0 人点赞
#parallel-decoding

LACE: 用于跨线程探索的格子注意力机制

arXiv cs.AI · 2026-04-20 缓存

LACE 引入了一种格子注意力机制,使LLM中的并发推理路径能够在推理过程中共享中间结果并相互纠正错误,相比标准的独立并行采样,推理准确度提高了7个多百分点。

0 人收藏 0 人点赞
#parallel-decoding

及时止损!学习早期剪枝路径以实现高效并行推理

Hugging Face Daily Papers · 2026-04-17 缓存

本文介绍了STOP(用于剪枝的超令牌),一种轻量级方法,通过在并行解码中附加可学习令牌并读取KV缓存状态,学会早期剪枝不优的推理路径,在AIME和GPQA基准测试中实现70%的令牌减少,同时提高性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈