bf16

标签

Cards List
#bf16

@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…

X AI KOLs Timeline · 2026-08-28 缓存

作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。

0 人收藏 0 人点赞
#bf16

巅峰便携式个人数据中心

Reddit r/LocalLLaMA · 2026-08-25

一位用户展示了为运行Qwen3.8-27B-BF16模型而搭建的便携式个人数据中心,详细介绍了其硬件配置、性能基准测试以及针对高上下文长度AI推理的散热管理方案。

0 人收藏 0 人点赞
#bf16

inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8

Reddit r/LocalLLaMA · 2026-08-04

InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。

0 人收藏 0 人点赞
#bf16

@0xkeenz: 今天验证了一个纠结很久的事情 Qwen3.6 27B 官方原模型是 BF16 权重,但一些量化版本,比如 cyankiwi / Unsloth,会把部分关键权重转换成 FP16 而不是保持 BF16。BF16 和 FP16 在存储占用上是…

X AI KOLs Timeline · 2026-07-08 缓存

作者验证了Qwen3.6 27B模型权重从BF16转换为FP16不会导致数值溢出,并指出FP16尾数精度更高,解释了量化版本为何使用FP16而非保持BF16。

0 人收藏 0 人点赞
#bf16

@SpaceTimeViking: 宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED!BF16 和 NVFP4 量化版,适用于 DGX Spark / Blackwell 架构。保留…

X AI KOLs Timeline · 2026-06-27 缓存

宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED,这是一个采用 BF16 和 NVFP4 量化的模型,适用于 DGX Spark/Blackwell 架构,声称在启用 DFlash 的情况下性能提升 200-300%。

0 人收藏 0 人点赞
#bf16

@jpschroeder: 没有任何提供商提供原生 bf16 的 GLM-5.2。

X AI KOLs Following · 2026-06-26 缓存

一位用户指出,目前没有云服务提供商提供原生 bf16 精度的 GLM-5.2 模型,凸显了托管选项上的空白。

0 人收藏 0 人点赞
#bf16

@steeve:又是5天后,zml/llmd完全在Metal上运行,以完整bf16精度服务8个并发请求 zml/llmd是我们的大语言模型服务…

X AI KOLs Following · 2026-06-13 缓存

zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。

0 人收藏 0 人点赞
#bf16

构建了一个AI加速器并将其开源。[P]

Reddit r/MachineLearning · 2026-05-31

作者开源了一个在FPGA上实现的自定义AI加速器(atik),原生支持BF16和注意力机制,展示了在各种模型上相比PyTorch的显著加速效果。

0 人收藏 0 人点赞
#bf16

@charles_irl: @modal LLMEng Almanac 的另一页:低精度浮点数(从 bf16 到 fp4)探索器 https://modal.com/ll…

X AI KOLs Following · 2026-05-18 缓存

来自 Modal 的 LLM Engineer's Almanac,提供了一个互动探索器,用于理解 bf16 和 fp4 等低精度浮点数格式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈