@PyTorch:一个运行时,多种GPU架构,零厂商特定模型代码。在这篇博文中,TokenSpeed团队 @l…
摘要
TokenSpeed-Kernel是一个可移植、高性能的内核系统,用于LLM推理,实现零厂商特定模型代码,并支持多种GPU架构,在AMD MI355X上实现高达3.6倍的吞吐量提升。
查看缓存全文
缓存时间: 2026/06/25 19:25
一个运行时,多种 GPU 架构,零厂商定制模型代码。
在这篇博文中,TokenSpeed 团队 (@lightseekorg) 介绍了 TokenSpeed-Kernel,一个为现代 LLM 推理构建的可移植高性能内核系统。以 GPT-OSS 120B 为案例,他们展示了针对 @AIatAMD 和 @NVIDIAAI GPU 的专用内核如何通过通用 API 无缝共存。这种统一方法在 AMD MI355X 上实现了高达 3.6 倍的吞吐量提升,且无需对底层模型逻辑进行任何修改。
博文链接见评论区。
相似文章
@PyTorch: LightSeek (@lightseekorg) TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持…
LightSeek 的 TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持,支持 NVIDIA 和 AMD 加速器,基于 PyTorch 并与 vLLM 合作。
TokenSpeed:面向智能体工作负载的"光速"LLM推理引擎(5分钟阅读)
Lightseek发布TokenSpeed,一款面向智能体工作负载优化的高性能LLM推理引擎,采用编译器驱动的并行技术和先进的内核优化,相关技术已被vLLM采纳。
@PyTorch: 如何保持 @vllm_project 以光速运行,同时不排斥在多样化硬件上运行多样化模型的用户?
介绍了 vLLM 中的硬件无关层,以在确保跨多样化硬件可移植性的同时保持高性能,正如 PyTorch Foundation 博客文章中所宣布的。
@PyTorch:新芯片出货速度空前,但生态系统因需反复重写和调试代码而受阻…
在 PyTorch Conference North America 上的一场主题演讲将展示一个由 Mojo 和 MAX 驱动的异构计算开放软件平台,以解决在多样化硬件上部署 AI 模型时的生态系统挑战。
@PyTorch: 开源放大全栈优势,实现最低令牌成本。PyTorch就是一个典型例子:自推出以来……
NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。