标签
作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。
一位用户展示了为运行Qwen3.8-27B-BF16模型而搭建的便携式个人数据中心,详细介绍了其硬件配置、性能基准测试以及针对高上下文长度AI推理的散热管理方案。
InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。
作者验证了Qwen3.6 27B模型权重从BF16转换为FP16不会导致数值溢出,并指出FP16尾数精度更高,解释了量化版本为何使用FP16而非保持BF16。
宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED,这是一个采用 BF16 和 NVFP4 量化的模型,适用于 DGX Spark/Blackwell 架构,声称在启用 DFlash 的情况下性能提升 200-300%。
一位用户指出,目前没有云服务提供商提供原生 bf16 精度的 GLM-5.2 模型,凸显了托管选项上的空白。
zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。
作者开源了一个在FPGA上实现的自定义AI加速器(atik),原生支持BF16和注意力机制,展示了在各种模型上相比PyTorch的显著加速效果。
来自 Modal 的 LLM Engineer's Almanac,提供了一个互动探索器,用于理解 bf16 和 fp4 等低精度浮点数格式。