nvfp4

标签

Cards List
#nvfp4

@nrehiew_:献给视觉学习者

X AI KOLs Timeline · 2026-06-05 缓存

一条推文线程,回顾了论文《使用NVFP4预训练大型语言模型》并讨论了NVFP4预训练,特别是针对NVIDIA Blackwell。

0 人收藏 0 人点赞
#nvfp4

@TheAhmadOsman: 我的朋友Jensen正在提供前沿开源智能(极其高效),正如他所说…

X AI KOLs Following · 2026-06-01 缓存

Jensen Huang暗示将发布更多Nemotron模型,强调通过NVFP4训练实现的开源前沿智能和成本效益。

0 人收藏 0 人点赞
#nvfp4

@vllm_project: vLLM v0.22.0 发布了!来自 230 位贡献者(63 位新人)的 459 次提交。亮点:DeepSeek V4 加固(NVFP4 融合 MoE,fu…

X AI KOLs Timeline · 2026-05-30 缓存

vLLM v0.22.0 发布,包含 459 次提交,主要特点包括 DeepSeek V4 加固、实验性 Rust 前端、以及批次不变的 Cutlass FP8,端到端延迟降低 28.9%。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t:官方 @NVIDIAAI GLM5.1-NVFP4 在 @huggingface 上被发现

X AI KOLs Timeline · 2026-05-28 缓存

NVIDIA 发布了 GLM-5.1-NVFP4,这是 ZAI 的 GLM-5.1 模型的量化版本,总参数 754B(激活参数 40B),在 Hugging Face 上以 MIT 许可证提供。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t: 16个本地AI代理同时流式传输!MiniMax M2.7 NVFP4 — 2x GB10,没有云API。

X AI KOLs Timeline · 2026-05-25 缓存

演示展示了使用MiniMax M2.7 NVFP4在两个Nvidia GB10芯片上同时流式传输16个本地AI代理,无需云API。

0 人收藏 0 人点赞
#nvfp4

Mix-Quant: 量化预填充,精准解码的智能体大语言模型

arXiv cs.CL · 2026-05-21 缓存

Mix-Quant 提出了一种面向智能体大语言模型的阶段感知量化框架,在预填充阶段使用 NVFP4 量化以加速计算,同时在解码阶段保持 BF16 精度以维持准确性。该方法在智能体基准测试中实现了预填充速度提升最高 3 倍,且性能下降极小。

0 人收藏 0 人点赞
#nvfp4

实时长视频生成(GitHub仓库)

TLDR AI · 2026-05-20 缓存

NVlabs 发布了 LongLive 2.0,这是一个采用 NVFP4 量化的实时长视频生成并行基础设施,同时支持训练和推理。它达到了 45.7 FPS,并被 ICLR 2026 接收。

0 人收藏 0 人点赞
#nvfp4

LongLive-2.0:用于长视频生成的NVFP4并行基础设施

Hugging Face Daily Papers · 2026-05-18 缓存

LongLive-2.0 引入了一种基于NVFP4的并行基础设施,用于长视频生成,在训练上实现了高达2.15倍的加速,推理上实现了1.84倍的加速,5B模型达到了45.7 FPS。

0 人收藏 0 人点赞
#nvfp4

@ctnzr: 我们更进一步:Nemotron 3 Super 拥有120B参数,在NVFP4精度下基于25T tokens进行了预训练。Nemotron 3 Ultra 大约为500B参数,……

X AI KOLs Following · 2026-05-15 缓存

NVIDIA 宣布推出 Nemotron 3 Super(120B)和 Nemotron 3 Ultra(约500B)模型,这些模型在 NVFP4 精度下基于25T tokens进行了预训练,强调加速计算和效率提升。

0 人收藏 1 人点赞
#nvfp4

@HowToAI_: NVIDIA 完成了一项不可能的任务,却无人提及。他们以 4 位精度训练了一个 120 亿参数的 LLM…

X AI KOLs Timeline · 2026-05-15

NVIDIA 利用新的 NVFP4 格式及微缩放技术,以 4 位精度训练了一个 120 亿参数的大语言模型,在几乎不损失智能的同时,内存使用减半、算术速度提升三倍,标志着高效 AI 训练的重大突破。

0 人收藏 0 人点赞
#nvfp4

NVIDIA发布NVFP4版Kimi-K2.6和Kimi-K2.5模型

Reddit r/LocalLLaMA · 2026-05-14

NVIDIA发布了Moonshot AI的Kimi-K2.6和Kimi-K2.5语言模型的NVFP4量化版本,保持高精度,可用于商业和非商业用途。

0 人收藏 0 人点赞
#nvfp4

Blackwell LLM 工具包 - 针对 Blackwell GPU 的 NVFP4 配置 + Wheels + TensorRT-LLM 基准测试 - Nemotron 3 Omni 达到 270 tok/s

Reddit r/LocalLLaMA · 2026-05-12

一个开发者工具包,提供在使用 TensorRT-LLM 通过 Nvidia Blackwell GPU 以 NVFP4 精度运行大型语言模型时的配置、预编译包(wheels)及基准测试数据。

0 人收藏 0 人点赞
#nvfp4

@0xSero: 刚刚添加了两种新的模型压缩版本:Hy3-FP8 和 NVFP4。我推荐尝试这个模型,它非常强大且可以完整地在 256GB 显存上运行……

X AI KOLs Following · 2026-05-10 缓存

0xSero 发布了腾讯 Hy3-preview 模型的 FP8 和 NVFP4 量化版本,使其能够在使用完整上下文的情况下在 256GB 显存的设备上运行。

0 人收藏 0 人点赞
#nvfp4

unsloth/Qwen3.6-27B-NVFP4

Hugging Face Models Trending · 2026-04-23 缓存

Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。

0 人收藏 0 人点赞
#nvfp4

Qwen3.6-27B 各量化格式 KLD 对比:INT 与 NVFP

Reddit r/LocalLLaMA · 2026-04-22

Reddit 帖子对比了 Qwen3.6-27B 的多种量化版本(INT4、NVFP4、BF16-INT4),展示不同场景下内存占用与精度的权衡。

0 人收藏 0 人点赞
#nvfp4

@0xSero:GLM-5.1-478B-NVFP4 跑在:4×RTX Pro 6000、SGLang,最大 37 万 token(1.75× 满上下文),p10 27.7 | p90 45…

X AI KOLs Timeline · 2026-04-21 缓存

一份 478B 参数的量化 GLM-5.1 模型在 4 块 RTX Pro 6000 上用 SGLang 运行,支持 37 万 token 上下文,解码最高 45 tok/s,预填充 1340 tok/s,并现场演示操控 Figma。

0 人收藏 0 人点赞
#nvfp4

@0xSero:终于搞定 GLM-5.1-505B-REAP-NVFP4,解码 45 tokens/s,预填充 1350 tokens/s,剪枝 32%,这是我跑通过最费劲的一次…

X AI KOLs Timeline · 2026-04-20 缓存

开发者 @0xSero 在优化版 GLM-5.1-505B 上通过 NVFP4 量化与 32% 剪枝实现高吞吐推理,解码速度 45 tokens/s,预填充速度 1350 tokens/s。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈