@PyTorch: LightSeek (@lightseekorg) TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持…
摘要
LightSeek 的 TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持,支持 NVIDIA 和 AMD 加速器,基于 PyTorch 并与 vLLM 合作。
查看缓存全文
缓存时间: 2026/07/16 14:15
LightSeek (@lightseekorg) TokenSpeed 为 Thinking Machines Lab 的 Inkling 提供了 Day-0 优化的 FP4 推理支持,覆盖 @NVIDIA 和 @AMD 加速器。TokenSpeed 基于 PyTorch 基础设施构建,并与 @vllm_project 合作,为开源 AI 生态系统推进高性能、可复用的推理内核。
LightSeek Foundation (@lightseekorg): Thinking Machines Lab 今日发布了 Inkling。 我们很高兴与 Thinking Machines Lab 合作,为 TokenSpeed 带来 Inkling 的 Day-0 支持。 ✅NVIDIA (G)B200/(G)B300 (NVFP4) ✅AMD MI350X/MI355X (MXFP4) ✅原生 FP4 推理 ✅统一内核架构 ✅MTP + optimized
相似文章
TokenSpeed:面向智能体工作负载的"光速"LLM推理引擎(5分钟阅读)
Lightseek发布TokenSpeed,一款面向智能体工作负载优化的高性能LLM推理引擎,采用编译器驱动的并行技术和先进的内核优化,相关技术已被vLLM采纳。
@PyTorch:一个运行时,多种GPU架构,零厂商特定模型代码。在这篇博文中,TokenSpeed团队 @l…
TokenSpeed-Kernel是一个可移植、高性能的内核系统,用于LLM推理,实现零厂商特定模型代码,并支持多种GPU架构,在AMD MI355X上实现高达3.6倍的吞吐量提升。
@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…
SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。
@scaling01: DeepSeek 刚刚将其推理成本降低约5倍,吞吐量达50 TPS
DeepSeek 已将推理成本降低约5倍,同时保持每秒50个token的吞吐量。
@SuJinYan123:仅在DeepSeek开源Qwen DSpark权重6小时后,OpenInfer就已经在RTX 5…上支持DSpark运行
OpenInfer,一个纯粹的Rust+CUDA LLM推理引擎,快速添加了对DeepSeek的DSpark投机解码技术在RTX 5090上的支持,实现了每个用户近500 tok/s,并扩展至约2.4K聚合tok/s,在非随机工作负载上优于DFlash。