标签
作者验证了Qwen3.6 27B模型权重从BF16转换为FP16不会导致数值溢出,并指出FP16尾数精度更高,解释了量化版本为何使用FP16而非保持BF16。
宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED,这是一个采用 BF16 和 NVFP4 量化的模型,适用于 DGX Spark/Blackwell 架构,声称在启用 DFlash 的情况下性能提升 200-300%。
一位用户指出,目前没有云服务提供商提供原生 bf16 精度的 GLM-5.2 模型,凸显了托管选项上的空白。
zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。
作者开源了一个在FPGA上实现的自定义AI加速器(atik),原生支持BF16和注意力机制,展示了在各种模型上相比PyTorch的显著加速效果。
来自 Modal 的 LLM Engineer's Almanac,提供了一个互动探索器,用于理解 bf16 和 fp4 等低精度浮点数格式。