@Modular: 当今AI软件碎片化。每个加速器都有自己的编译器、内核库、运行时和开发路径…

X AI KOLs Timeline 新闻

摘要

Modular推出统一计算层以解决AI软件碎片化问题,通过与HTEC和d-Matrix合作,展示更快的硬件启用能力,将MAX和Mojo扩展到Google TPU等新加速器。

当今AI软件碎片化。每个加速器都有自己的编译器、内核库、运行时和开发路径。开发者承担了这种碎片化的成本。 在ModCon 2026技术演讲中,Modular首席科学家Abdul Dakkak介绍了我们的替代方案:一个统一的计算层,足够灵活,可以扩展到新模型、新模态和新硬件。 Abdul介绍了我们启用新硬件的方法,并通过三个示例演示: 1. AWS Trainium,通过我们自己的团队。端到端的Gemma 4 31B。 2. Google TPU v6e,通过我们的合作伙伴@HTECgroup。他们的团队成功启用,无需LLVM后端,没有Mojo或MAX内部知识的先验经验,且我们只提供了最少的支持。 3. d-Matrix Corsair,由@dMatrix_AI自己的团队在他们自己的栈上实现。周二获得仓库访问权限,下周一即可运行矩阵乘法。 感谢HTEC和d-Matrix的合作,以及Mihailo分享HTEC的经验。 阅读关于HTEC合作的详情:https://htec.com/insights/media-coverage/htec-and-modular-extend-max-and-mojo-to-google-tpu-cutting-ai-hardware-enablement-from-years-to-months/… 观看完整演讲:https://youtube.com/watch?v=hYjKbTAGOo0…
查看原文
查看缓存全文

缓存时间: 2026/09/08 23:39

当今的AI软件生态呈现碎片化现状。每款加速器都拥有自己的编译器、内核库、运行时及开发路径,开发者不得不承担这种碎片化带来的额外成本。

在ModCon 2026技术演讲中,Modular首席科学家Abdul Dakkak展示了我们的解决方案:构建统一计算层,使其能灵活扩展至新模型、新模态与新硬件。

Abdul通过三个案例展示了适配新硬件的实践路径:

  1. AWS Trainium:由Modular团队独立完成适配,实现Gemma 4 31B全流程部署
  2. Google TPU v6e:通过合作伙伴@HTECgroup实现适配,该团队在没有LLVM后端支持、未预习Mojo/MAX内部架构且Modular仅提供有限协助的情况下完成开发
  3. d-Matrix Corsair:由@dMatrix_AI团队基于自有技术栈实现适配,从获取仓库权限(周二)到实现矩阵乘法功能(次周一)仅用5天

特别感谢HTEC与d-Matrix的技术协作,以及Mihailo对HTEC实践经验的分享。

阅读HTEC合作详情:https://htec.com/insights/media-coverage/htec-and-modular-extend-max-and-mojo-to-google-tpu-cutting-ai-hardware-enablement-from-years-to-months/…

观看完整演讲:https://youtube.com/watch?v=hYjKbTAGOo0…


HTEC与Modular将MAX和Mojo扩展至Google TPU,AI硬件适配周期从年级缩短至月级 | HTEC

来源:https://htec.com/insights/media-coverage/htec-and-modular-extend-max-and-mojo-to-google-tpu-cutting-ai-hardware-enablement-from-years-to-months/ 通过先进编译器与运行时工程验证:无需重建软件栈即可快速、可复用地将AI工作负载迁移至新型芯片

加利福尼亚州帕洛阿尔托,2026年9月8日 — 全球AI优先工程技术服务商HTEC与Modular共同宣布,Modular的AI软件栈已成功在Google TPU架构上运行。这项在ModCon 2026展示的成果证明:通过扩展现有软件基础而非为每个加速器重建系统,即可实现对新芯片架构的支持。

该项目仅用数月时间将Modular的MAX/Mojo生态系统移植至Google TPU,而传统硬件适配工程通常需要数年时间。这为AI基础设施发展提供了可行新模式:可移植的软件层结合专业编译器与运行时工程,能加速新计算架构的落地应用。

随着AI算力需求激增,企业正突破单一硬件生态体系以寻求性能与可扩展性的提升,同时降低对成本、产能和供应链限制的依赖。而主要障碍往往来自软件层面——每个新加速器都需要在编译器、运行时及推理系统进行大量适配工作,才能有效运行AI负载。

Modular通过设计支持跨芯片AI负载的技术方案破解该障碍。HTEC运用其在编译器工程与运行时系统领域的专业能力,以较大技术自主权应对高难度技术要求,成功将基础架构扩展至Google TPU。

HTEC首席技术官Darko Todorovic表示:“我们证明了Modular的MAX/Mojo生态系统能在数月而非数年内触达新硬件平台。这既验证了Modular架构的先进性,也为企业快速采用新AI硬件提供了可落地路径。”

Modular首席执行官Chris Lattner补充道:“AI发展无法承受为每个新加速器重建整套软件栈的代价。HTEC在Google TPU上的实践表明,统一的软件基础能以前所未有的速度和规模将新芯片引入AI生态。这从根本上改变了芯片厂商的发展逻辑:他们可以将工程资源集中在硬件创新上,而非重复构建软件栈。”

除Google TPU里程碑外,该项目同时验证了HTEC在AI硬件适配领域的长期投入,以及Modular推行硬件无关AI软件的战略价值。此次合作进一步巩固了HTEC支持行业未来半导体与AI推理创新的能力。

关于HTEC

HTEC集团(https://htec.com/)是总部位于硅谷的全球技术工程公司,提供以AI为核心的全栈解决方案,帮助企业以可复制的方式从战略规划走向产品落地。融合顶尖工程能力与数字战略、设计及创业孵化服务,HTEC支持覆盖从构思到部署的全产品生命周期。

凭借超过15年企业级AI与机器学习实施经验,HTEC在从芯片到应用的完整技术栈中具备深厚专业知识,涵盖数据工程、模型优化与AI应用开发等领域。这确保了新兴技术能转化为可量化的投资回报、可扩展的增长与持续的商业价值。通过弥合愿景与执行之间的鸿沟,HTEC协助全球领先企业定义可能性并实现规模化落地。

媒体联系:[email protected]

相似文章