parallel-decoding

标签

Cards List
#parallel-decoding

Ripple-Pivot Search:扩散大语言模型的主动并行解码

arXiv cs.CL · 2天前 缓存

提出了Ripple-Pivot Search,一种无需训练的扩散大语言模型解码方法,主动确定中熵枢轴位置以减少不确定性并加速并行解码,实现4-10倍加速。

0 人收藏 0 人点赞
#parallel-decoding

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers · 2026-08-06 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞
#parallel-decoding

视频生成的并行解码(10分钟阅读)

TLDR AI · 2026-07-30 缓存

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

0 人收藏 0 人点赞
#parallel-decoding

并行解码蒸馏加速图像与视频生成

Hugging Face Daily Papers · 2026-07-28 缓存

并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。

0 人收藏 0 人点赞
#parallel-decoding

DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速

arXiv cs.AI · 2026-07-24 缓存

提出DC-Leap,一种无训练框架,通过引入动态连续验证和草稿引导解码来加速扩散大语言模型,在保持生成质量的同时实现高达105倍的加速。

0 人收藏 0 人点赞
#parallel-decoding

HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers · 2026-07-21 缓存

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

0 人收藏 0 人点赞
#parallel-decoding

面向扩散语言模型的自适应多步前瞻解码

arXiv cs.CL · 2026-07-20 缓存

提出 AdaLook,一种适用于掩码扩散语言模型的自适应多步前瞻解码框架,该框架根据候选分数方差动态确定展开深度和分支扩展,与现有的单步前瞻解码方法相比,实现了更好的准确率-解码步骤权衡。

0 人收藏 0 人点赞
#parallel-decoding

@rohanpaul_ai: 空间推测解码(SSD)通过并行预测图像行,将自回归图像模型的速度提升高达13.28倍

X AI KOLs Timeline · 2026-07-14 缓存

空间推测解码(SSD)通过使用小型辅助网络并行预测整行像素,加速了自回归图像模型,实现了高达13.28倍的加速,同时保持了基准性能。

0 人收藏 0 人点赞
#parallel-decoding

DeLS-Spec: 解耦的长短上下文用于并行推测性草拟

arXiv cs.CL · 2026-07-09 缓存

DeLS-Spec通过在DFlash上添加轻量级局部头,将推测性解码中的长上下文和短上下文建模解耦,无需完全重新训练即可实现一致的加速。它仅需要对局部头进行标准的下一个词元预测训练,并在Qwen3基准测试中提高了接受长度。

0 人收藏 0 人点赞
#parallel-decoding

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers · 2026-07-03 缓存

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

0 人收藏 0 人点赞
#parallel-decoding

理解扩散大语言模型中的评估幻觉

arXiv cs.CL · 2026-06-30 缓存

本文指出了扩散LLM解码方法中的评估不一致性,表明提示模板的选择会显著影响排名,并提出了可靠评估的实用指南。

0 人收藏 0 人点赞
#parallel-decoding

Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速

arXiv cs.CL · 2026-06-26 缓存

本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。

0 人收藏 0 人点赞
#parallel-decoding

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning · 2026-06-17

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

0 人收藏 0 人点赞
#parallel-decoding

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers · 2026-06-17 缓存

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

0 人收藏 0 人点赞
#parallel-decoding

为何 DiffusionGemma 在工具调用上可能优于其基准质量所暗示的表现

Reddit r/LocalLLaMA · 2026-06-16

分析了 DiffusionGemma 的双向注意力和并行块生成如何由于其能够修正 token 的能力,可能产生更高的有效工具调用率,尽管其基础质量低于 Gemma 4。

0 人收藏 0 人点赞
#parallel-decoding

MARS: 面向并行LLM测试时扩展的边际对抗风险控制停止策略

arXiv cs.AI · 2026-06-12 缓存

本文提出MARS,一种用于并行LLM测试时扩展的停止规则,通过探测部分轨迹来提前停止而不牺牲准确性,在竞赛数学基准测试上为推理模型节省25-47%的令牌。

0 人收藏 0 人点赞
#parallel-decoding

# 支持性令牌揭示:用于快速扩散语言模型解码

arXiv cs.CL · 2026-06-04 缓存

本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。

0 人收藏 0 人点赞
#parallel-decoding

@VincentLogic: NVIDIA 刚开源的这个 LocateAnything 模型,真的有点强。 以前那种视觉定位模型,生成坐标是一个数字一个数字往外蹦(像挤牙膏一样),又慢又不稳定。 这个新模型用了“并行边界框解码”,直接一步预测完整坐标,速度快多了,框得…

X AI KOLs Timeline · 2026-06-03 缓存

NVIDIA 开源了 LocateAnything 模型,采用并行边界框解码技术,一步预测完整坐标,速度快且准确。模型仅 3B 参数,可在消费级显卡上运行,支持视频物体定位、UI 识别和 OCR 等任务。

0 人收藏 0 人点赞
#parallel-decoding

Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码

arXiv cs.CL · 2026-06-03 缓存

Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。

0 人收藏 0 人点赞
#parallel-decoding

EPIC: 在上下文无关文法约束下的扩散语言模型高效并行推理

arXiv cs.CL · 2026-06-02 缓存

本文介绍了EPIC,一个用于扩散语言模型中上下文无关文法约束解码的高效框架,在保持语法正确性的同时,将推理时间最多减少67.5%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈