标签
Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。
本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。
MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。
报告了在 PrismaQuant 上使用 Oculink 对 RTX Pro 4500 GPU 进行 INT4 Autoround 和 NVFP4 W4A4 量化模型的测试。
unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。
本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。
Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。
Unsloth AI 发布了新的 NVFP4 量化 Qwen3.6 模型,在 GPU 上运行速度提升 2.5 倍,并提高了准确性和工具调用能力。
Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。
一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。
红帽AI团队使用NVFP4和FP8量化发布了GLM-5.2的量化检查点,模型体积减小超过70%,同时在GPQA上保持高精度。该量化模型与DSpark推测器配合使用,可实现vLLM上的高效部署。
本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。
本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。
一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。
修复了vLLM中为四块DGX Spark配置GLM-5.2 NVFP4时的一个推测解码bug,解决了性能权衡问题,通过MTP4在128K上下文下实现了约24 tok/s。
一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。