@HuggingPapers:NVIDIA 刚刚在 Hugging Face 上发布了 NVFP4 量化的 DiffusionGemma——一个 26B MoE 多模态模型,通过并行扩散生成文本…

X AI KOLs Following 模型

摘要

NVIDIA 在 Hugging Face 上发布了一个名为 DiffusionGemma 的 26B MoE 多模态模型,采用 NVFP4 量化,在 Hopper 硬件上达到每秒超过 1100 个 token 的速度。

NVIDIA 刚刚在 Hugging Face 上发布了 NVFP4 量化的 DiffusionGemma 一个 26B MoE 多模态模型,通过并行扩散生成文本, 拥有 256K 上下文窗口,在 Hopper 上速度达到 1100+ tokens/秒。https://t.co/xxd93AKmga
查看原文
查看缓存全文

缓存时间: 2026/06/10 21:55

NVIDIA 刚刚在 Hugging Face 上发布了 NVFP4 量化的 DiffusionGemma

这是一款 26B MoE 多模态模型,通过并行扩散生成文本,

具有 256K 上下文和每秒 1,100+ tokens 的速度(基于 Hopper 架构)。https://t.co/xxd93AKmga

相似文章

DiffusionGemma: 文本生成速度提升4倍

Hacker News Top

Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。

DiffusionGemma

Simon Willison's Blog

Google 发布了 DiffusionGemma,这是一个采用 Apache 2 许可证的开源权重文本生成模型(总参数量 26B,活跃参数量 4B),通过 NVIDIA 的 NIM 云 API 展示了极高的推理速度。

google/diffusiongemma-26B-A4B-it

Hugging Face Models Trending

Google DeepMind 发布了 DiffusionGemma,这是一个 26B 参数的 Mixture-of-Experts 模型,使用离散扩散实现更快的文本生成,支持多模态输入和 256K token 上下文。