标签
Qwen image 2.1,一个使用FP8以提高速度的AI模型,生成尺寸小于10GB的优质图像。它在Unsloth Studio上可用,该平台已更新以支持此版本。
InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。
DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。
本文描述了Z.ai的GLM-5.3-Flash模型的无审查版本,通过abliteration移除了安全对齐,作为block-FP8检查点发布,用于研究目的。
阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。
Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。
InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。
This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.
ComfyUI v0.27.0でネイティブ対応されたINT8 ConvRot量子化手法について、FP8を超える性能報告やモデル格納形式の分類を含む技術解説記事。
Laguna S 2.1 118B-A8B 模型在 DGX Station 上使用 NVFP4 和 FP8 KV 缓存运行,对于 10 个并行代理(每个拥有 256k 上下文)达到约 1k tokens/秒 的速度。
Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。
AlpinDale称,在4个节点的RTX 4090(48GB)上运行GLM-5.2-FP8,通过10吉比特以太网实现约28 tok/s的解码速度,并计划使用DSpark进行优化。
红帽AI团队使用NVFP4和FP8量化发布了GLM-5.2的量化检查点,模型体积减小超过70%,同时在GPQA上保持高精度。该量化模型与DSpark推测器配合使用,可实现vLLM上的高效部署。
腾讯发布了HY3,一个295B/21B参数的混合专家模型,具有256K上下文长度,Apache 2.0许可证,FP8量化,以及可切换的推理级别,将幻觉减少了一半。
在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。
将MTP推测解码引入采用FP8精度的Ornith 35B编码模型,实现了约18%的推断速度提升,且额外VRAM占用极少。
该基准测试将未量化的 Gemma 2 9B 模型与 FP8 量化变体在 NVIDIA L4 GPU 上进行比较,揭示了 FP8 量化引入了预填充代价(更高的 TTFT),但改善了解码延迟和显存使用,且在狭窄任务中语义漂移极小。
一条推文分享了一篇博客文章,讨论了LLM预训练中FP8的三种方法:per-tensor、blockwise和MXFP8,重点介绍了缩放因子的附加方式。
解释了LLM预训练中FP8缩放的三种主要方法——per-tensor、blockwise和MXFP8——重点关注scale的附加方式,并根据scale必须在matmul的收缩维度上保持恒定这一约束,推导出tile几何形状。