fp8

标签

Cards List
#fp8

Qwen image 2.1 (Fast FP8) 生成高品质图像

Reddit r/LocalLLaMA ↗ · 5天前

Qwen image 2.1,一个使用FP8以提高速度的AI模型,生成尺寸小于10GB的优质图像。它在Unsloth Studio上可用,该平台已更新以支持此版本。

0 人收藏 0 人点赞
#fp8

展示HN:InstinctFlash – 在Jetson Thor上实时运行5B世界动作模型

Hacker News Top ↗ · 5天前 缓存

InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。

0 人收藏 0 人点赞
#fp8

dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8

Hugging Face Models Trending ↗ · 2026-09-10 缓存

DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。

0 人收藏 0 人点赞
#fp8

orcarouter/GLM-5.3-Flash-Uncensored-FP8

Hugging Face Models Trending ↗ · 2026-08-29 缓存

本文描述了Z.ai的GLM-5.3-Flash模型的无审查版本,通过abliteration移除了安全对齐,作为block-FP8检查点发布,用于研究目的。

0 人收藏 0 人点赞
#fp8

@threerouter_com: 今晚 23 点阿里要在魔搭开源 Qwen3.8-Flash-Next,消息是准的。 但说实话,没跑分就放出来,我持保留态度。官方说是为了给完整 Qwen4 家族做适配,意思就是“你们先试用,我们后面再补成绩单”。架构看着是挺牛——Qwen…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。

0 人收藏 0 人点赞
#fp8

Qwen 3.8 27B 发布:开放权重,目前最好的本地稠密模型

Hacker News Top ↗ · 2026-08-14 缓存

Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。

0 人收藏 0 人点赞
#fp8

inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8

Reddit r/LocalLLaMA ↗ · 2026-08-04

InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。

0 人收藏 0 人点赞
#fp8

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top ↗ · 2026-08-04 缓存

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.

0 人收藏 0 人点赞
#fp8

Explanation of INT8 ConvRot (FP8 is no longer needed)

Hacker News Top ↗ · 2026-08-03 缓存

ComfyUI v0.27.0でネイティブ対応されたINT8 ConvRot量子化手法について、FP8を超える性能報告やモデル格納形式の分類を含む技術解説記事。

0 人收藏 0 人点赞
#fp8

@TheAhmadOsman: Laguna S 2.1 118B-A8B 在 DGX Station 上使用 - NVFP4 - FP8 KV 缓存,可运行 10 个并行代理,每个拥有 256k 上下文…

X AI KOLs Timeline ↗ · 2026-07-25 缓存

Laguna S 2.1 118B-A8B 模型在 DGX Station 上使用 NVFP4 和 FP8 KV 缓存运行,对于 10 个并行代理(每个拥有 256k 上下文)达到约 1k tokens/秒 的速度。

0 人收藏 0 人点赞
#fp8

@0xkeenz: 有意思,昨天刚好还在研究 Unsloth 和 NVIDIA 的 Qwen3.6 27B NVFP4 有什么区别,结果今天 Unsloth 就更新了! 新版 Unsloth 的量化思路和 NVIDIA 官方方案很类似:不再从 BF16 和 …

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。

0 人收藏 0 人点赞
#fp8

@AlpinDale: GLM-5.2-FP8在4个节点的4090-48GB上运行,解码速度约28 tok/s。这些节点通过以太网的互连速度为10吉比特……

X AI KOLs Following ↗ · 2026-07-08 缓存

AlpinDale称,在4个节点的RTX 4090(48GB)上运行GLM-5.2-FP8,通过10吉比特以太网实现约28 tok/s的解码速度,并计划使用DSpark进行优化。

0 人收藏 0 人点赞
#fp8

@RedHat_AI:红帽AI团队已为GLM-5.2创建量化检查点!https://huggingface.co/RedHatAI/GLM-5.2-NVF…

X AI KOLs Following ↗ · 2026-07-08 缓存

红帽AI团队使用NVFP4和FP8量化发布了GLM-5.2的量化检查点,模型体积减小超过70%,同时在GPQA上保持高精度。该量化模型与DSpark推测器配合使用,可实现vLLM上的高效部署。

0 人收藏 0 人点赞
#fp8

@AdinaYakup:腾讯刚刚发布了HY3 - 295B / 21B MoE, 256K上下文 - Apache 2.0 - 包含FP8版本 - 可切换推理:n…

X AI KOLs Following ↗ · 2026-07-06 缓存

腾讯发布了HY3,一个295B/21B参数的混合专家模型,具有256K上下文长度,Apache 2.0许可证,FP8量化,以及可切换的推理级别,将幻觉减少了一半。

0 人收藏 0 人点赞
#fp8

GLM 5.2 FP8 with FP8 KV - Terminal-Bench 2.1 = 79.8 (有一个超时未重新运行)

Reddit r/LocalLLaMA ↗ · 2026-07-05

在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。

0 人收藏 0 人点赞
#fp8

我将MTP引入本地SoTA智能编码模型Ornith 35B FP8 E4M3

Reddit r/LocalLLaMA ↗ · 2026-07-02 缓存

将MTP推测解码引入采用FP8精度的Ornith 35B编码模型,实现了约18%的推断速度提升,且额外VRAM占用极少。

0 人收藏 0 人点赞
#fp8

自托管 Gemma 2 9B 与前沿 API 基准测试:NVIDIA L4 上的 FP8 量化预填充代价与显存现实 [P]

Reddit r/MachineLearning ↗ · 2026-06-27

该基准测试将未量化的 Gemma 2 9B 模型与 FP8 量化变体在 NVIDIA L4 GPU 上进行比较,揭示了 FP8 量化引入了预填充代价(更高的 TTFT),但改善了解码延迟和显存使用,且在狭窄任务中语义漂移极小。

0 人收藏 0 人点赞
#fp8

@eisokant:来自@ArkadiiBessonov关于我们预训练团队的一篇精彩博客文章!

X AI KOLs Timeline ↗ · 2026-06-27 缓存

一条推文分享了一篇博客文章,讨论了LLM预训练中FP8的三种方法:per-tensor、blockwise和MXFP8,重点介绍了缩放因子的附加方式。

0 人收藏 0 人点赞
#fp8

@ArkadiiBessonov: LLM预训练中使用FP8的三种主要方法——区别主要在于scale的附加方式。per-tens…

X AI KOLs Timeline ↗ · 2026-06-27 缓存

解释了LLM预训练中FP8缩放的三种主要方法——per-tensor、blockwise和MXFP8——重点关注scale的附加方式,并根据scale必须在matmul的收缩维度上保持恒定这一约束,推导出tile几何形状。

0 人收藏 0 人点赞
#fp8

A100上Qwen3.6-27B-FP8运行缓慢

Reddit r/LocalLLaMA ↗ · 2026-06-21

Qwen3.6-27B-FP8模型在A100 GPU上运行时性能较慢

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈