揭秘我们的计算系统:内部探秘

Hacker News Top 新闻

摘要

Waymo详细介绍了其为自动驾驶定制的计算系统,采用5纳米ASIC和异构架构,以确保低延迟、坚固和冗余的性能。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/21 19:29

# 探秘引擎盖之下:Waymo的计算核心 来源:https://waymo.com/blog/2026/08/look-under-our-trunk/ 计算系统是Waymo Driver的"大脑",负责将原始传感器数据转化为实时驾驶指令。要在道路上安全运行可验证的物理AI(https://waymo.com/blog/2025/12/demonstrably-safe-ai-for-autonomous-driving/),需要从根本上转向为确定性、低延迟性能而设计的系统。过去十年间,我们协同设计硬件、传感器与算法,共同攻克真实世界边缘计算的独特挑战。今天首次揭开引擎盖,分享我们的计算架构理念、定制芯片设计,以及如何与行业领导者协作打造最强大的车载计算系统。 自动驾驶的计算系统需处理高度多样化的工作负载。Waymo正在设计一套堪称数据中心级别的尖端系统,同时还要应对车载运行域与实时性要求带来的额外复杂性。与传统驾驶辅助计算不同,我们的系统在没有人类接管的情况下完成全部驾驶任务,性能要求高出数倍。基于超过2亿英里的全自动驾驶经验,我们围绕三个不可妥协的需求构建计算体系: - **即时响应**:为实现实时驾驶决策,自主系统完全在车端运行,始终在毫秒级时间内完成决策处理。我们的技术栈经过超低延迟优化,最大限度缩短从首个像素输入到动作执行的延迟。在关键毫秒内,先进的机器学习模型构建高保真环境感知,评估最安全的行进路径。这不仅需要强大的原始算力——八年内算力提升20倍——还需深度优化的软件栈高效驾驭算力。 - **极端可靠**:我们的计算系统专为适应物理世界而设计,从组件到系统层面均具备卓越的耐久性与可靠性。硬件需在持续振动、冲击和极端温度环境下稳定运行。通过直接集成车辆液冷系统,无论在中西部严寒冬季还是凤凰城酷暑环境中,我们都能保持峰值性能。 - **双重冗余**:由于没有人类后备驾驶员,主动安全与冗余机制被原生集成到系统中。我们的计算系统设计如双引擎——通常作为整体并行处理工作负载,一旦某个引擎发生故障,另一个将无缝接管。 通过优化全频谱动态工作负载,我们显著降低了Waymo Driver的"像素到执行"延迟(红色到蓝色区域的优化)。这赋予系统在复杂高密度环境中安全导航所需的敏捷反应能力。 从通用组件到定制系统的演进,要求我们重新思考物理与架构设计。高度集成的系统在不牺牲乘客体验的前提下,提供强大处理能力,最大限度提升电池效率,同时保留充足后备箱空间并实现静音运行。我们构建了以机器学习为核心的架构,以最小延迟运行先进神经网络。为管理编排、数据搬运、日志记录等关键非机器学习任务,同时最大化机器学习计算时间,我们将机器学习技术与最优的CPU、GPU及加速器结合,最终形成均衡的异构系统。 **Waymo定制5纳米ASIC芯片** 为处理涌入核心机器学习引擎前的海量原始数据,我们隆重推出专用的5纳米ASIC芯片。这款芯片是我们多项激动人心的定制组件之一,作为专业的机器学习处理核心,专为实时处理、融合原始传感器数据并运行先进神经网络而设计。芯片、传感器与算法的协同开发,使我们能够突破传感器保真度、带宽效率与量化的边界,执行从稀疏卷积到密集Transformer的多样化模型。 该ASIC的专用加速器可从激光雷达、雷达与摄像头原始数据流中即时提取关键信息,包括用于增强低光感知的时间域降噪。数据随后输入我们专用的推理引擎,运行传感器融合机器学习模型,实现更高效率且不损失保真度。虽然单颗ASIC已为前端处理与机器学习模型提供超过1,000 TOPS的机器学习性能,但我们仍优化全栈以实现最佳性能表现,尤其在我们常运作的小批量计算场景中。 通过芯片、传感器与算法的协同设计,我们实现了无与伦比的效率与性能。最新系统(右图)可同时实时处理来自13个高分辨率摄像头的高保真数据,提供卓越的低光感知能力,呈现传统摄像头(左图)无法捕捉的关键环境细节。 除自主研发芯片外,我们与行业领导者紧密合作,其世界级计算解决方案为技术规模化提供了强大基础。我们自豪地与AMD、美光、英伟达、三星、闪迪、Socionext和台积电等伙伴携手,共同交付最强大的自动驾驶计算系统。 这仅是未来的一瞥。随着我们探索Waymo Driver的新应用场景,AI技术栈持续演进,对高效能、高性能计算的需求只会不断增长。 如果您希望深入了解Waymo的计算架构,请参加我们在Hot Chips (https://hotchips.org/advance-program/) 的演讲。 您也可通过访问waymo.com/careers (http://waymo.com/careers) 加入我们的团队,共同推动技术边界。

相似文章

AMD BC-250 与低成本计算探索

Reddit r/LocalLLaMA

一位开发者逆向工程了 AMD BC-250 板卡(回收的 PS5 APU),解锁全部 40 个计算单元,通过自定义 HIP 内核在 LLM 推理中实现了显著的性能提升。该项目展示了低成本 AI 计算的潜力。

AMD与Cerebras推出AI推理解决方案(10分钟阅读)

TLDR AI

AMD与Cerebras宣布联合推出AI推理解决方案,该方案将AMD Helios机架级解决方案与Cerebras晶圆级引擎相结合,旨在实现超低延迟和高吞吐量。这种解耦式推理工作流预计每瓦每秒可处理的token数量提升高达5倍。

@LinQingV: 之前做LLM推理芯片架构探索的时候,我把四大AI推理ASIC公司的架构都翻过一遍。Groq、SambaNova、Tenstorrent、Cerebras。前三家的思路虽然各有侧重,但底层逻辑都在同一个框架里:片上大SRAM + dataf…

X AI KOLs Timeline

The article analyzes the AI inference ASIC architectures of Groq, SambaNova, Tenstorrent, and Cerebras, highlighting Cerebras's unique wafer-scale engine design. It discusses the benefits of deterministic latency and high bandwidth for LLM inference, while noting challenges like yield, cost, and KV cache bottlenecks.

数据中心移动到你的设备上(4分钟阅读)

TLDR AI

Perplexity在2026年台北国际电脑展上发布了一款混合本地-云端推理系统,该系统能智能地在设备端模型和云端模型之间路由查询,基于其早前的Personal Computer agent构建。