@zcbenz: nvfp4与mxfp4不仅仅是块大小和缩放格式的不同选择,nvfp4还使用了额外的张量级缩放因子…
摘要
对nvfp4和mxfp4格式的技术比较,强调nvfp4使用额外的张量级缩放因子来克服fp4的范围限制,从而可以在块级缩放因子上获得更高的精度。
nvfp4与mxfp4不仅仅是块大小和缩放格式的不同选择,nvfp4还使用额外的张量级缩放因子来克服fp4的范围限制,从而可以在块级缩放因子上使用更高的精度。https://t.co/9d1hvNBWhO
查看缓存全文
缓存时间: 2026/06/17 16:02
nvfp4与mxfp4的区别不仅在于块大小和缩放格式的选择,nvfp4还使用了额外的张量级缩放因子来克服fp4的范围限制,从而可以为块级缩放因子使用更高的精度。https://t.co/9d1hvNBWhO
相似文章
@RayFernando1337: “所选运行时使用NVFP4权重以获得最大性能。从原始FP8权重,我们进行了内部量…
讨论使用NVFP4 4位浮点权重以获得最大性能,通过使用NVIDIA ModelOpt从FP8进行内部量化实现,突出了该数据格式的双缩放因子以保持高动态范围。
@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……
NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。
@hotschmoe: 在阅读了这篇文章后,我决定让 nvfp4 在我的 Intel Arc B70s 上运行看看,12小时后,它的运行速度……
一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。
@ArkadiiBessonov: LLM预训练中使用FP8的三种主要方法——区别主要在于scale的附加方式。per-tens…
解释了LLM预训练中FP8缩放的三种主要方法——per-tensor、blockwise和MXFP8——重点关注scale的附加方式,并根据scale必须在matmul的收缩维度上保持恒定这一约束,推导出tile几何形状。
有人知道为什么bartowski声称DeepSeek-V4-Flash是MXFP4格式吗?
一位用户质疑,为什么bartowski声称DeepSeek-V4-Flash是MXFP4格式,而原始模型页面列出的张量类型是BF16、F32等,并非MXFP4。