parallel-decoding

标签

Cards List
#parallel-decoding

FastGuide:加速扩散大语言模型的奖励引导

arXiv cs.CL ↗ · 19小时前 缓存

FastGuide 是一种自适应的并行与自回归混合解码方法,通过复用奖励模型反向传播计算、利用 KV 缓存和稀疏注意力重计算来加速扩散大语言模型的梯度奖励引导,在三个奖励基准上实现最高 4.4× 加速同时保持相近生成质量。

0 人收藏 0 人点赞
#parallel-decoding

非均匀离散扩散:更强、更可扩展

arXiv cs.CL ↗ · 19小时前 缓存

本文提出 LUDI,一种非均匀扩散语言建模框架,解决了均匀扩散语言模型中训练目标过度均匀以及条件与目标混淆的问题,实现了 7B 规模的均匀离散扩散语言模型(UDLM),在逐步处理速度上比自回归解码快 3 倍,同时在复杂推理任务上具备有竞争力的性能。

0 人收藏 0 人点赞
#parallel-decoding

WaveFront Decoding:针对循环语言模型的并行化自推测解码

Hugging Face Daily Papers ↗ · 4天前 缓存

WaveFront Decoding 引入了一个无需训练的自推测解码框架,针对循环语言模型,通过并发批量处理草拟和验证来减少延迟,在 Huginn-3.5B 上实现了高达 4.81 倍的加速。

0 人收藏 0 人点赞
#parallel-decoding

Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。

0 人收藏 0 人点赞
#parallel-decoding

利用并行解码技术扩展电子商务属性提取

arXiv cs.CL ↗ · 2026-09-10 缓存

论文介绍了一个两阶段的大语言模型管道,使用经过微调的Qwen3-4B和超并行解码来提取电子商务中具有购买区分度的属性,实现了85%的准确率,成本降低了92%。

0 人收藏 0 人点赞
#parallel-decoding

Alibaba PAI/MiniMax-H3 加速 LoRAs

Hugging Face Models Trending ↗ · 2026-08-26 缓存

Alibaba PAI 发布了 LoRA 检查点,用于通过并行解码蒸馏加速 MiniMax-H3 视频生成,从而在 8 步内实现高效推理。

0 人收藏 0 人点赞
#parallel-decoding

CForce:通过一致性强制提升dLLMs的并行解码

arXiv cs.CL ↗ · 2026-08-17 缓存

本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。

0 人收藏 0 人点赞
#parallel-decoding

Ripple-Pivot Search:扩散大语言模型的主动并行解码

arXiv cs.CL ↗ · 2026-08-13 缓存

提出了Ripple-Pivot Search,一种无需训练的扩散大语言模型解码方法,主动确定中熵枢轴位置以减少不确定性并加速并行解码,实现4-10倍加速。

0 人收藏 0 人点赞
#parallel-decoding

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞
#parallel-decoding

视频生成的并行解码(10分钟阅读)

TLDR AI ↗ · 2026-07-30 缓存

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

0 人收藏 0 人点赞
#parallel-decoding

并行解码蒸馏加速图像与视频生成

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。

0 人收藏 0 人点赞
#parallel-decoding

DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速

arXiv cs.AI ↗ · 2026-07-24 缓存

提出DC-Leap,一种无训练框架,通过引入动态连续验证和草稿引导解码来加速扩散大语言模型,在保持生成质量的同时实现高达105倍的加速。

0 人收藏 0 人点赞
#parallel-decoding

HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers ↗ · 2026-07-21 缓存

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

0 人收藏 0 人点赞
#parallel-decoding

面向扩散语言模型的自适应多步前瞻解码

arXiv cs.CL ↗ · 2026-07-20 缓存

提出 AdaLook,一种适用于掩码扩散语言模型的自适应多步前瞻解码框架,该框架根据候选分数方差动态确定展开深度和分支扩展,与现有的单步前瞻解码方法相比,实现了更好的准确率-解码步骤权衡。

0 人收藏 0 人点赞
#parallel-decoding

@rohanpaul_ai: 空间推测解码(SSD)通过并行预测图像行,将自回归图像模型的速度提升高达13.28倍

X AI KOLs Timeline ↗ · 2026-07-14 缓存

空间推测解码(SSD)通过使用小型辅助网络并行预测整行像素,加速了自回归图像模型,实现了高达13.28倍的加速,同时保持了基准性能。

0 人收藏 0 人点赞
#parallel-decoding

DeLS-Spec: 解耦的长短上下文用于并行推测性草拟

arXiv cs.CL ↗ · 2026-07-09 缓存

DeLS-Spec通过在DFlash上添加轻量级局部头,将推测性解码中的长上下文和短上下文建模解耦,无需完全重新训练即可实现一致的加速。它仅需要对局部头进行标准的下一个词元预测训练,并在Qwen3基准测试中提高了接受长度。

0 人收藏 0 人点赞
#parallel-decoding

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers ↗ · 2026-07-03 缓存

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

0 人收藏 0 人点赞
#parallel-decoding

理解扩散大语言模型中的评估幻觉

arXiv cs.CL ↗ · 2026-06-30 缓存

本文指出了扩散LLM解码方法中的评估不一致性,表明提示模板的选择会显著影响排名,并提出了可靠评估的实用指南。

0 人收藏 0 人点赞
#parallel-decoding

Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速

arXiv cs.CL ↗ · 2026-06-26 缓存

本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。

0 人收藏 0 人点赞
#parallel-decoding

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning ↗ · 2026-06-17

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈