标签
Nari Qwen3-TTS 是针对 Qwen3-TTS 模型的高性能服务实现,在单块 H100 GPU 上实现低于 50 毫秒的首音频时间,并每秒处理 10 个请求。
本文介绍了基于 CUTLASS 的内核,将 SwiGLU 激活与 GeMM 在切片级进行融合,在 NVIDIA H100 上实现了高达 2.47 倍的加速,以用于高效 LLM 推理。
本文以NVIDIA H100为例,阐明了GPU在AI推理中的性能受限于内存带宽而非算力,并解释了GPU架构及其对token生成速率的影响。
本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。
NYT的一项分析详细介绍了全球前所未有的人工智能数据中心和芯片建设,预计到2028年人工智能算力将增长十倍,有望推动AI能力的重大突破。
一次技术讨论验证了在配备 FP8 Tensor Core 的 NVIDIA H100 GPU 上 TurboQuant 的性能数据,并承诺将带来非 H100 测试的更多见解。