block-parallel-decoding

Tag

Cards List
#block-parallel-decoding

dMoE: dLLMs with Learnable Block Experts

Hugging Face Daily Papers · 2026-05-29 Cached

This paper proposes dMoE, a block-level mixture-of-experts framework for diffusion large language models that aggregates token-level expert distributions into block-level routing, reducing activated experts and memory usage while maintaining performance.

0 favorites 0 likes
← Back to home

Submit Feedback