fp4

标签

Cards List
#fp4

面向B300的全新FP4注意力内核,速度相比FA4提升最高达1.69倍

Reddit r/LocalLLaMA · 2026-07-14 缓存

FastVideo团队发布了面向B300的全新FP4注意力内核,速度相比FlashAttention 4提升最高达1.69倍。

0 人收藏 0 人点赞
#fp4

@HuggingPapers: NVIDIA 刚刚在 Hugging Face 上发布了 NVFP4 量化的 Kimi-K2.7-Code——一个经过 FP4 量化的 1 万亿参数 Moonshot AI 模型,用于 F…

X AI KOLs Following · 2026-07-10 缓存

NVIDIA 发布了 NVFP4 量化的 Kimi-K2.7-Code,这是一个为 Blackwell GPU 量化为 FP4 的 1 万亿参数 Moonshot AI 模型,在减少内存占用的同时保持了准确性。

0 人收藏 0 人点赞
#fp4

@coffeecup2020: 如果你的显卡支持Blackwell,请阅读!https://github.com/turbo-tan/llama.cpp-tq3… 已更新turbo4/turbo3 TQ3_4…

X AI KOLs Timeline · 2026-07-01 缓存

llama.cpp的一个分支引入了TurboQuant TQ3_4S量化方法,该方法映射到Blackwell FP4张量核心,在GB10上实现高达221%的提示处理加速,同时以Q3的大小保持接近Q4的质量。

0 人收藏 0 人点赞
#fp4

@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……

X AI KOLs Following · 2026-06-30 缓存

NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。

0 人收藏 0 人点赞
#fp4

SharQ:连接激活稀疏性与FP4量化以优化大语言模型推理

arXiv cs.LG · 2026-06-26 缓存

SharQ提出了一种无需训练的方法,将激活稀疏性与FP4量化相结合用于大语言模型推理,采用稀疏-密集分解和统一的FP4权重负载。与仅使用FP4的基线相比,它显著降低了延迟并恢复了精度。

0 人收藏 0 人点赞
#fp4

@RayFernando1337: “所选运行时使用NVFP4权重以获得最大性能。从原始FP8权重,我们进行了内部量…

X AI KOLs Following · 2026-06-23

讨论使用NVFP4 4位浮点权重以获得最大性能,通过使用NVIDIA ModelOpt从FP8进行内部量化实现,突出了该数据格式的双缩放因子以保持高动态范围。

0 人收藏 0 人点赞
#fp4

重新思考LLM FP4预训练中的收缩偏差:几何起源、系统性影响与UFP4方案

Hugging Face Daily Papers · 2026-06-18 缓存

本文识别了LLM预训练中非均匀FP4量化格式的一个根本限制(收缩偏差),并提出了UFP4,一种优于现有基于E2M1方法的统一4位训练方案。

0 人收藏 0 人点赞
#fp4

@Italianclownz: 已将 Qwen 3.6 35b a3b 转换为 ROCmfp4,运行飞快。使用了 mtp 版本,因为此 ROCmfp4 也可以融合 MTP 的优势…

X AI KOLs Timeline · 2026-05-24 缓存

将 Qwen 3.6 35b a3b 模型转换为 ROCmfp4 格式,利用 MTP 优势提升 AMD 硬件上的性能。

0 人收藏 0 人点赞
#fp4

@charles_irl: @modal LLMEng Almanac 的另一页:低精度浮点数(从 bf16 到 fp4)探索器 https://modal.com/ll…

X AI KOLs Following · 2026-05-18 缓存

来自 Modal 的 LLM Engineer's Almanac,提供了一个互动探索器,用于理解 bf16 和 fp4 等低精度浮点数格式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈