inference-acceleration

标签

Cards List
#inference-acceleration

Retrofitting Linear Attention into Diffusion Language Models

arXiv cs.LG · 4小时前 缓存

This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.

0 人收藏 0 人点赞
#inference-acceleration

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

arXiv cs.CL · 6天前 缓存

This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.

0 人收藏 0 人点赞
#inference-acceleration

更快但不同:加速多模态扩散语言模型中内容漂移的诊断与控制

arXiv cs.CL · 2026-08-03 缓存

本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。

0 人收藏 0 人点赞
#inference-acceleration

Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models

arXiv cs.CL · 2026-07-31 缓存

This paper introduces LATCH, a training-free candidate-aware early-exit framework for diffusion language models that separates when to stop from where to accelerate, achieving 9.3-17.8x speedups on short-answer tasks and 2-3.3x on long-reasoning tasks with minimal accuracy loss on LLaDA and Dream.

0 人收藏 0 人点赞
#inference-acceleration

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL · 2026-07-29 缓存

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。

0 人收藏 0 人点赞
#inference-acceleration

CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理

arXiv cs.CL · 2026-07-29 缓存

CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。

0 人收藏 0 人点赞
#inference-acceleration

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers · 2026-07-28 缓存

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

0 人收藏 0 人点赞
#inference-acceleration

OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配

Hugging Face Daily Papers · 2026-07-28 缓存

OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。

0 人收藏 0 人点赞
#inference-acceleration

Sol-Attn: 通过即时注意力稀疏化加速视频生成推理

Hugging Face Daily Papers · 2026-07-27 缓存

Sol-Attn 提出了一种无需训练的方法,用于视频生成推理的注意力稀疏化,通过在线softmax过程中动态选择键值块,实现了超过2倍的速度提升,且质量损失极小。

0 人收藏 0 人点赞
#inference-acceleration

LaCache: 扩散大语言模型的精确缓存与精度自适应推理

arXiv cs.AI · 2026-07-21 缓存

LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。

0 人收藏 0 人点赞
#inference-acceleration

基于推测词汇表的推测解码

arXiv cs.CL · 2026-07-20 缓存

本文提出SpecVocab,一种为推测解码中的草稿模型逐步骤选择词汇子集的方法,实现了更高的接受长度,并相较于EAGLE-3最高提升8.1%的吞吐量。

0 人收藏 0 人点赞
#inference-acceleration

DFlash 使 Qwen3.6 27B 速度提升2.2倍,且质量无损

Reddit r/LocalLLaMA · 2026-07-16

DFlash 是一种方法,可将 Qwen3.6 27B 模型推理速度提升2.2倍,且质量无损失。

0 人收藏 0 人点赞
#inference-acceleration

@Underfox3: 本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,能够实现...

X AI KOLs Timeline · 2026-07-15 缓存

本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,通过一种新颖的CUDA内核(MD-SpMM)和部署感知的稀疏性搜索,在保持准确性的同时,在GPU上实现了超过2.2倍的延迟加速。

0 人收藏 0 人点赞
#inference-acceleration

通过渐进式树形草稿的推测解码解锁自回归语言模型中的并行性

arXiv cs.CL · 2026-07-14 缓存

提出渐进式树形草稿(PTD),一种免训练、模型无关的推测解码方法,利用渐进式树结构和逐步剪枝实现多个草稿路径的并行生成,在各种基准测试上实现高达2倍的加速。

0 人收藏 0 人点赞
#inference-acceleration

基于自监督早期退出机制加速大语言模型推理

arXiv cs.CL · 2026-07-13 缓存

本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。

0 人收藏 0 人点赞
#inference-acceleration

针对 Qwen 的最快推测解码

Reddit r/LocalLLaMA · 2026-07-11

一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。

0 人收藏 0 人点赞
#inference-acceleration

novita/kimi-k2.6-dspark · Hugging Face

Reddit r/LocalLLaMA · 2026-07-08 缓存

Novita 发布了 Kimi-K2.6 DSpark,这是一个采用推测解码的推测模型,用于加速基础 Kimi-K2.6 模型的推理,实现了更高的令牌接受长度。

0 人收藏 0 人点赞
#inference-acceleration

HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更优

Hugging Face Daily Papers · 2026-07-06 缓存

HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。

0 人收藏 0 人点赞
#inference-acceleration

DSpark:基于置信度调度的半自回归推测解码

Hugging Face Daily Papers · 2026-07-06 缓存

DSpark 是一个推测解码框架,结合了半自回归草稿生成与置信度调度验证,以加速大语言模型推理,并在高并发场景下提升吞吐量。

0 人收藏 0 人点赞
#inference-acceleration

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers · 2026-07-03 缓存

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈