inference-speedup

标签

Cards List
#inference-speedup

Intern-S2-Mobius:解耦知识与推理的基础模型

Hugging Face Daily Papers · 3天前 缓存

该论文介绍了Mobius-v0,一种将知识存储与推理解耦以提升效率的架构,表明一个7B模型在62.6%的训练数据下能达到可比性能,而Intern-S2-Mobius实现了4倍推理加速。

0 人收藏 0 人点赞
#inference-speedup

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers · 2026-07-17 缓存

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。

0 人收藏 0 人点赞
#inference-speedup

尝试预测下一个token会用到哪些MoE专家来加速CPU/GPU offload,得到了一些实际数据,这真的可实现吗还是我在浪费时间(30tg/s -> 150-200tg/s)

Reddit r/LocalLLaMA · 2026-07-16

探索通过预测下一个token将使用的MoE专家来改进CPU/GPU offload,实现了30->150-200 tg/s的加速,并质疑实现可行性。

0 人收藏 0 人点赞
#inference-speedup

@_ARahim_: DeepSeek 的 DSpark 推测解码草稿模型,在 Mac(原生 Apple Silicon,MLX)上基准测试,无损;结果与基础模型完全一致……

X AI KOLs Timeline · 2026-07-07 缓存

mlx-dspark 将 DeepSeek 的 DSpark 和 z-lab 的 DFlash 推测解码草稿模型通过 MLX 引入 Apple Silicon,实现无损加速(约 1.4–1.6 倍,代码/数学任务可达 2 倍),并提供兼容 OpenAI 的 API 用于本地推理。

0 人收藏 0 人点赞
#inference-speedup

Ornith 35B 与 Qwen3.6 35B DFlash 推测模型配合效果良好

Reddit r/LocalLLaMA · 2026-06-29

在 llama-server 中,Ornith 35B 与 Qwen3.6 35B DFlash 推测模型搭配使用时,token 生成速度提升了 30-40%,在混合代码和文本上实现了 80% 的接受率,但提示处理性能有所下降。

0 人收藏 0 人点赞
#inference-speedup

The Context-Ready Transformer

arXiv cs.CL · 2026-06-29 缓存

本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。

0 人收藏 0 人点赞
#inference-speedup

MeshFlow: 基于等变流匹配的网格生成

Hugging Face Daily Papers · 2026-06-22 缓存

MeshFlow 引入了一种等变最优传输流匹配模型,用于直接生成三角形网格,在达到最先进质量的同时,相比自回归方法提供了约18倍的推理加速。

0 人收藏 0 人点赞
#inference-speedup

dMoE: 具有可学习块级专家的dLLMs

Hugging Face Daily Papers · 2026-05-29 缓存

本文提出了dMoE,一种用于扩散大语言模型的块级混合专家框架,该框架将词元级专家分布聚合成块级路由,在保持性能的同时减少激活的专家数量和内存使用。

0 人收藏 0 人点赞
#inference-speedup

Domino:在推测解码中将因果建模与自回归草稿生成解耦

Hugging Face Daily Papers · 2026-05-28 缓存

Domino是一个推测解码框架,它将因果依赖建模与自回归草稿生成解耦,采用并行主干和轻量级因果精炼头,在Qwen3模型上实现了高达5.49倍的端到端加速。

0 人收藏 0 人点赞
#inference-speedup

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers · 2026-05-19 缓存

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。

0 人收藏 0 人点赞
#inference-speedup

减少草稿,增加检索:用于推测解码的混合树构建

Hugging Face Daily Papers · 2026-05-19 缓存

Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。

0 人收藏 0 人点赞
#inference-speedup

通过自蒸馏,后训练MoE可跳过一半专家

Hugging Face Daily Papers · 2026-05-18 缓存

ZEDA是一种低成本框架,通过注入零输出专家并使用自蒸馏,将后训练的静态MoE模型转换为动态模型,在基准测试中实现了超过50%的专家FLOP减少,且精度损失极小。

0 人收藏 0 人点赞
#inference-speedup

基于推测解码的无分解错误离散扩散语言模型

arXiv cs.CL · 2026-05-15 缓存

本文提出了FeF-DLLM,一种通过精确前缀条件分解消除分解错误、并利用推测解码加速推理的离散扩散语言模型,在GSM8K和MATH等基准测试中显著提升了准确率和速度。

0 人收藏 0 人点赞
#inference-speedup

Orthrus:通过双视图扩散实现内存高效的并行令牌生成

Hugging Face Daily Papers · 2026-05-12 缓存

Orthrus 是一个双架构框架,结合了自回归大语言模型与扩散模型,通过共享KV缓存和共识机制实现快速并行令牌生成,同时保持精确推理保真度,速度提升最高可达7.8倍。

0 人收藏 0 人点赞
#inference-speedup

z-lab/dflash

GitHub Trending (daily) · 2026-05-08

DFlash 引入了一种用于 Flash 投机解码的块扩散方法,以提高大语言模型的推理速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈