@tenstorrent: 感谢东京!以下是我们在TT-Deploy Japan上宣布的所有内容:更快的AI推理 • Kimi K2.6 900 t/s/u,速度提升3倍…
摘要
Tenstorrent在TT-Deploy Japan上宣布,其硬件上对Kimi K2.6、LTX 2.3和DeepSeek-R1实现了更快的AI推理,此外还推出了可授权的TT-Ascalon S RISC-V CPU,用于生成式AI代理应用。
查看缓存全文
缓存时间: 2026/07/03 06:31
谢谢东京!以下是我们在 TT-Deploy Japan 上宣布的所有内容:
更快的AI推理
• Kimi K2.6 900 t/s/u,比GPU快3倍
• LTX 2.3 Fast 约6秒生成6秒视频,144帧,1080p,比GPU快4倍
• DeepSeek-R1-0528 671B 400+ t/s/u
TT-Ascalon S 今日可用
• 一款可授权的RISC-V CPU,专为下一代智能体AI应用打造
异构或独立部署
• 轻松将 Tenstorrent Galaxy 与现有基础设施一起部署,或独立部署
• @aiand_ 的自主异构推理平台,基于 Tenstorrent Galaxy™ 超级集群
相似文章
@HotAisle:Kimi K2.6 + DFlash:8×MI300X 上 508 tok/s,自回归基线 90 tok/s 提升至 5.6 倍
Kimi K2.6 搭配 DFlash 推理系统在 8×AMD MI300X 上实现 508 tokens/s,相比 90 tokens/s 基线零质量损失地提升 5.6 倍吞吐。
@JiaZhihao: 激动分享 Lithos 为 Kimi K2.7 Code 提供的服务栈,这是一个拥有1万亿参数的前沿编码模型。
Lithos 宣布其推理引擎服务 Kimi K2.7 Code,在单个8×B200节点上以原生精度实现每个用户每秒超过1000 token,速度比主流提供商快3.4-5.7倍。
@gnotuy:我们开源了 Kimi K2.6,测试时计算的下一个前沿不是更大的模型,而是更优的智能组织……
Moonshot AI 开源 Kimi K2.6,并指出测试时计算的下一个前沿在于更优的智能组织,而非单纯堆砌更大的模型。
@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
@YRSM_Simon: 这是个大新闻! kimi 2.6 是生成级的模型了,在 LLM 能力溢出的年代,速度要成为竞争的胜负手了,芯片领域又要“板块轮动”了吗
Cerebras is now running Kimi K2.6, a trillion-parameter model, in enterprise trials at ~1,000 tokens/s, the fastest frontier model performance ever measured by Artificial Analysis.