标签
LightSeek 的 TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持,支持 NVIDIA 和 AMD 加速器,基于 PyTorch 并与 vLLM 合作。
Qwen推理团队宣布了TokenSpeed,这是一个针对智能体工作负载的高性能LLM推理引擎,实现了540 TPS,并提供开源预览版。