@hotschmoe: 在阅读了这篇文章后,我决定让 nvfp4 在我的 Intel Arc B70s 上运行看看,12小时后,它的运行速度……

X AI KOLs Following 工具

摘要

一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。

在阅读了这篇文章后,我决定让 nvfp4 在我的 Intel Arc B70s 上运行试试看,12小时后,它的运行速度几乎是我当前最佳 int4 autoround 配置的两倍,同时更加准确。 “这些本来都不应该行得通”
查看原文
查看缓存全文

缓存时间: 2026/07/04 18:54

读完这篇帖子后,我决定让我的 Intel Arc B70 显卡跑一下 NVFP4 看看效果。12 小时后,它的运行速度几乎翻倍,同时精度也比我当前最好的 INT4 自动舍入配置更高。

“这一切本不该能跑起来。”

Eric Hartford (@QuixiAI): “这一切本不该能跑起来。”

噗!这就是人民的力量!

再也不用听什么“GGUF/MLX 是给 Mac 的、BF16 是给安培的、NVFP4 是给 NVIDIA 的”这类胡话了。

相似文章

@witcheer:大家都说NVFP4让黑伟德显卡“更快”。我在我的5090上对Qwen3.6-27B进行了三种方式的基准测试:>NVFP4 >普通Q4_K…

X AI KOLs Timeline

在RTX 5090上对Qwen3.6-27B进行的NVFP4基准测试显示,与同等比特的Q4_K_M相比,预填速度提升32-42%,与Q6_K相比提升52-68%,但解码速度提升有限(相比Q4提升+9%),因为解码受内存带宽限制。与Q6相比,质量损失极小(平均-0.8),使得NVFP4成为本地推理的不错选择。