nvidia-h100

标签

Cards List
#nvidia-h100

超快速 Qwen3-TTS:34毫秒首音频时间,每秒处理10个请求 [OSS]

Reddit r/LocalLLaMA · 2026-08-21 缓存

Nari Qwen3-TTS 是针对 Qwen3-TTS 模型的高性能服务实现,在单块 H100 GPU 上实现低于 50 毫秒的首音频时间,并每秒处理 10 个请求。

0 人收藏 0 人点赞
#nvidia-h100

@reprompting: 今天读到关于切片级激活重叠的文章 https://arxiv.org/pdf/2607.02521

X AI KOLs Timeline · 2026-08-15 缓存

本文介绍了基于 CUTLASS 的内核,将 SwiGLU 激活与 GeMM 在切片级进行融合,在 NVIDIA H100 上实现了高达 2.47 倍的加速,以用于高效 LLM 推理。

0 人收藏 0 人点赞
#nvidia-h100

@akshay_pachaar:GPU架构详解。普遍的假设是,更快的GPU意味着更强的计算能力,所以一款每秒能执行更多操作的芯片应该每秒能生成更多token……

X AI KOLs Timeline · 2026-08-15 缓存

本文以NVIDIA H100为例,阐明了GPU在AI推理中的性能受限于内存带宽而非算力,并解释了GPU架构及其对token生成速率的影响。

0 人收藏 0 人点赞
#nvidia-h100

从Token到瓦时:现代GPU上LLM推理的分析能耗估算

arXiv cs.LG · 2026-07-30 缓存

本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。

0 人收藏 0 人点赞
#nvidia-h100

大量AI算力即将上线,推动重大飞跃(赠阅文章)

Reddit r/artificial · 2026-07-29 缓存

NYT的一项分析详细介绍了全球前所未有的人工智能数据中心和芯片建设,预计到2028年人工智能算力将增长十倍,有望推动AI能力的重大突破。

0 人收藏 0 人点赞
#nvidia-h100

@no_stp_on_snek: 感谢 @_EldarKurtic、@mgoin_ 和 @RedHat_AI 关于 TurboQuant 的详尽报告。H100 上原生 F… 的数据

X AI KOLs Following · 2026-05-11

一次技术讨论验证了在配备 FP8 Tensor Core 的 NVIDIA H100 GPU 上 TurboQuant 的性能数据,并承诺将带来非 H100 测试的更多见解。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈