AMD 收购 Taalas,通过在硅片中蚀刻模型来提升推理性能
摘要
AMD 收购 AI 芯片初创公司 Taalas,后者将模型权重直接蚀刻进硅片,有望带来数量级的推理性能提升。此举被视为 AMD 挑战 Nvidia 在 AI 硬件领域主导地位的举措。
<a href="https://ir.amd.com/news-events/press-releases/detail/1296/amd-acquires-taalas-to-advance-compute-solutions-for-rapidly-growing-ai-inference-market" rel="nofollow">https://ir.amd.com/news-events/press-releases/detail/1296/am...</a><p><a href="https://chatjimmy.ai/" rel="nofollow">https://chatjimmy.ai/</a>
查看缓存全文
缓存时间: 2026/08/06 23:05
# AMD收购AI芯片初创公司Taalas,通过将模型蚀刻进硅片提升推理性能
Source: https://www.theregister.com/systems/2026/08/06/amd-acquires-ai-chip-startup-taalas-to-boost-inference-performance-by-etching-models-into-silicon/5284344
在AMD最新一次撼动Nvidia在AI硬件领域主导地位的尝试中,这家“Zen之家”收购了AI芯片公司Taalas。该公司的技术能将模型权重直接烧录进硅片中,这一工艺有望将推理性能提升一个数量级甚至更多。
该交易于周四收盘时宣布,其背景与去年12月Nvidia与Groq达成的200亿美元许可协议(https://www.theregister.com/on-prem/2025/12/31/why-did-nvidia-really-drop-20b-on-groq/2018042)颇为相似:让面向AI智能体(如代码助手)的高性能“高端”推理服务运行得更快、更便宜。AMD没有披露交易条款,但据我们了解,这是一次真正的收购,而非人才收购(acquihire)。
Taalas成立于2023年,总部位于多伦多。其推理方式与传统的GPU或支撑Groq LPU和Cerebras晶圆级加速器的数据流架构截然不同。
### 模型专用集成电路
这家初创公司的芯片并不依赖HBM来存储模型权重,而是将权重直接蚀刻进硅片中。从某种意义上说,Taalas的芯片其实是模型专用集成电路(MSIC)。
也许更重要的是,Taalas的技术并不只是概念性的。今年2月,这家初创公司公布了其首款测试芯片HC1,该芯片采用台积电6nm工艺制造。初步基准测试显示,该芯片能够以惊人的每秒16,960个token的速度运行Meta的Llama 3.1 8B——在今年2月公布时,这比Nvidia的GPU快48倍,比Cerebras的加速器快8.5倍。
尽管Llama 3.1以今天的标准来看已经很古老(它早在2024年年中就发布了),但这款掩模版尺寸的芯片实际上是为了验证这一概念。
Taalas对其芯片的实际工作原理一直讳莫如深,但我们知道其处理器由两个主要区域组成:一个是掩模ROM读取结构(mask-ROM recall fabric),模型权重就蚀刻在其中;另一个是SRAM读取结构(SRAM recall fabric),用于存储KV缓存和微调适配器。
对于定于今年夏天推出的第二代HC2芯片,Taalas的目标是将参数规模提升到200亿参数。这听起来可能不算多,但就像GPU处理更大模型一样,权重可以通过流水线并行简单地分布到多个加速器上。
若每颗芯片拥有200亿参数,只需50个加速器就能支持一个万亿参数模型。而AMD恰好拥有机架级计算平台和内部系统设计团队,可以轻松满足这一需求。
这比Nvidia最近发布的LPX系统在空间和功耗效率上要高出不少。Nvidia的LPX系统要运行同样的模型,需要几十块GPU和至少2000个Groq LPU(https://www.theregister.com/special-features/2026/03/19/a-closer-look-at-nvidias-groq-powered-lpx-rack-systems/5223364)。
据我们了解,AMD计划将其基于Instinct的Helios机架(https://www.theregister.com/systems/2026/07/23/amd-attacks-the-rack-with-helios-systems-that-rival-nvidias/5277246)与基于Taalas技术的芯片搭配使用。这暗示了一种解耦架构:计算密集型的提示处理由GPU完成,而token生成则卸载到基于Taalas的加速器上。
AMD也有可能采用一种类似“嘀-嗒”节奏的策略:客户先在Instinct加速器上部署和验证模型,一旦满意,再迁移到Taalas加速器。目前我们只能猜测,但AMD AI高级副总裁Vamsi Boppana在一份官方声明中这样表示:
“AMD正在构建一个全栈AI平台,让客户能够灵活地为每种AI工作负载部署合适的计算解决方案。”
### 你得真的非常喜欢那个模型
虽然这项技术快得惊人,但如果你还没意识到的话,它也有一个相当大的弊端。一旦芯片部署完成,你就被那个模型锁定了。任何超出LoRA适配器级别的改动都需要重新流片(re-spin),这不仅昂贵而且耗时。
AI热潮已持续近四年,新模型几乎每月都在推出。要想从Taalas的技术中受益,AMD的客户必须对自己的模型选择非常有把握,而这对于某些客户来说更容易,对另一些则不然。
不过,如果这家初创公司的话可信,情况并没有听起来那么糟糕。虽然新模型需要重新流片,但不必从头再来。只需更换两层金属层即可,这样成本低得多,也省时得多。
话虽如此,我们强烈怀疑这项技术将主要由AI模型开发者、其基础设施提供商以及少数推理服务商采用。今年2月,该公司在接受我们姊妹网站The Next Platform(https://www.nextplatform.com/compute/2026/02/19/taalas-etches-ai-models-onto-transistors-to-rocket-boost-inference/4092140)采访时表示,将模型权重蚀刻进硅片的成本比训练一个前沿模型便宜100倍。
AMD无疑有能力谈判这类交易。OpenAI、Anthropic和Meta都是Instinct的主要客户。鉴于模型公司与芯片设计商之间的紧密合作关系,看到GPT或Claude部署在Taalas与Instinct加速器的组合上也就不足为奇了。
这项技术对模型开发也有影响。开发者减少幻觉的方法之一是用时间换准确性。这种技术称为测试时缩放(test-time scaling),实际操作相当简单,就是让模型在回答前“思考”更长时间。
测试时缩放的一个缺点是会消耗多得多的token,这使得成本高昂,而且用户需要等待更长的时间才能获得聊天机器人、代码助手或智能体的回复。如果AMD收购Taalas能降低每token成本并将输出速度提升10倍或20倍,模型开发者可能会选择进一步延长推理时间。
无论如何,我们可能很快就能看到Taalas如何融入AMD更宏大的愿景。该交易预计将在第四季度完成,尚待监管部门批准。®
相似文章
AMD将收购AI芯片初创公司Taalas(4分钟阅读)
AMD已达成最终协议,收购总部位于多伦多的AI芯片初创公司Taalas,该公司专注于将AI模型硬连线到定制硅上,以实现高效推理。该交易旨在以差异化的推理性能和效率强化AMD的AI产品组合。
@QuixiAI:推理硬件不断被吞并。我理解想要退出的想法。但我们需要这些显卡大规模生产,并进入消费者的……
QuixiAI 就 Taalas Inc 加入 AMD 发表评论,表示希望高性能推理硬件能够面向消费者,而不是仅限于数据中心,并引用了 Taalas 的收购公告。
AMD的小型AI PC预示着模型推理向本地化未来的转变
AMD的Ryzen AI Max平台配备128GB统一内存,可本地推理高达2000亿参数的大模型,旨在将AI工作负载从云端转移到紧凑的个人硬件上。
AMD与Cerebras推出AI推理解决方案(10分钟阅读)
AMD与Cerebras宣布联合推出AI推理解决方案,该方案将AMD Helios机架级解决方案与Cerebras晶圆级引擎相结合,旨在实现超低延迟和高吞吐量。这种解耦式推理工作流预计每瓦每秒可处理的token数量提升高达5倍。
OpenAI与Broadcom发布专为LLM推理优化的芯片
OpenAI与Broadcom发布了Jalapeño,一款专为LLM推理定制的芯片,每瓦性能显著优于当前最先进水平,从零开始为当前及未来AI模型设计。