Arm的C2-Ultra、G2-Ultra NX和CSS N4 IP(8分钟阅读)

TLDR AI 新闻

摘要

Arm宣布推出新的C2-Ultra CPU和G2-Ultra NX GPU IP核心,用于移动设备,以及用于数据中心的CSS N4,并包括技术改进和与之前架构的比较。

Arm即将推出的C2-Ultra CPU和G2-Ultra NX GPU IP将在旗舰手机中广泛使用。
查看原文
查看缓存全文

缓存时间: 2026/09/08 23:55

# Arm的C2-Ultra、G2-Ultra NX与CSS N4 IP 来源:https://chipsandcheese.com/p/arms-c2-ultra-g2-ultra-nx-and-css **编者按(2026年9月8日):***Arm已联系澄清,在文末所示参数下,C2-Ultra核心相对于C1-Ultra核心的最大IPC性能提升为7%,且内存带宽提升未计入IPC性能增长。文章已相应编辑。* 各位互联网上的朋友们好, 在Arm上次发布其专注于数据中心的新款CPU——Arm AGI CPU之后,他们最新的一系列公告将焦点放得更广。即将推出的C2-Ultra CPU和G2-Ultra NX GPU IP将在旗舰手机中广泛应用,其中后者G2 Ultra已于8月24日随小米XRING O3芯片一同出货。而新的Neoverse CSS N4 IP则将应用于数据中心领域。 希望大家喜欢! 首先,我们将C2-Ultra与Arm提供给我们有限信息的上一代Cortex X925进行对比——这是我们拥有详实数据的上一代ARM核心。相比两代前的Cortex X925,我们看到的变化有限。 [](https://substackcdn.com/image/fetch/$s_!zh-c!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fcde87d95-0663-422d-bdf7-a0a3e5993547_2746x1443.png) C2-Ultra的示意图及已公开的结构尺寸。 [](https://substackcdn.com/image/fetch/$s_!antv!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa7650892-030e-45d9-b45f-8dff46371b19_1222x614.png) Cortex X925的示意图及实测结构尺寸。加载和存储队列的实测尺寸与公开尺寸可能存在差异,这可能是类似Zen架构的机制所致,使得队列看起来比实际更大。 两款核心的整体布局相同,均采用10宽解码、8个简单ALU、6路浮点单元、3个分支端口以及相同的4加载/2存储配置。因此,C2-Ultra为实现性能提升,主要采取了针对分支预测器和乱序缓冲区等关键结构的渐进式改进。 [](https://substackcdn.com/image/fetch/$s_!lf_2!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F96c3848e-dc9e-46be-9067-aeb4405014c9_1243x700.png) 遗憾的是,Arm对于如何实现分支预测器改进的表述非常模糊。我们不知道他们是否修改了BTB大小、返回栈,或是整体的分支算法。 [](https://substackcdn.com/image/fetch/$s_!G1wc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F10f7075f-7c57-48b6-8e1a-8aeb1237010a_1384x790.png) 同样,他们提到C2-Ultra相比C1-Ultra具有更大的执行窗口和改进的推测执行能力,但未提供具体细节。 [](https://substackcdn.com/image/fetch/$s_!BC8d!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F78f35eb6-04eb-4fc3-aa5e-dee1ad9dcba4_2184x1237.png) 所有这些意味着C2-Ultra相比C1-Ultra减少了等待数据的时间。 现在来看Arm宣称的从C1-Ultra到C2-Ultra的性能提升:Arm声称峰值性能提升15%,在传统基准测试和工作负载中平均提升12%。 [](https://substackcdn.com/image/fetch/$s_!2ERV!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F510c281b-c595-4671-9c29-37ae59768471_1387x789.png) 然而,脚注为这些说法提供了重要的背景信息。 [](https://substackcdn.com/image/fetch/$s_!1ULd!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff5db5b69-2652-4a01-ba26-501245bcfbbd_1393x789.png) 首先,这些数字来自FPGA仿真,实际硬件可能看到不同的提升。其次,C2-Ultra平台的结果是基于比C1-Ultra高8.5%的时钟频率以及更大的3MB L2缓存估算得出的。而C1-Ultra平台在小米的XRING O3和三星的Exynos 2600中确实以3MB L2配置出货。根据Arm的说法,虽然内存系统为CPU基准测试提供了近两倍的带宽,但内存子系统的改进并未计入性能提升。 在考虑时钟频率提升后,C2-Ultra相比C1-Ultra的平均提升为3.2%,这个增幅确实包含了C2-Ultra额外的1MB L2缓存,这可能会在某些工作负载中带来性能增益。 关于Arm联系告知的C2-Ultra相对于C1-Ultra最高7%的IPC提升,我推测这个数字也可能计入了L2缓存的增加。Geekbench 6确实似乎受益于更大的L2缓存(https://chipsandcheese.com/p/evaluating-geekbench-6),而3MB的L2似乎能捕获大多数L1未命中,较小的L2缓存可能做不到。 在我看来,在测试的工作负载中,C2-Ultra的平均每时钟性能相比C1-Ultra似乎并未显著提升,某些工作负载得益于更大的L2缓存,这是某些设计者可能会选择的。 [](https://substackcdn.com/image/fetch/$s_!e-sg!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffd697064-9a45-4c68-aa9c-e4c28e64151e_2199x1246.png) Arm表示,C2-Ultra的功耗比C1-Ultra低38%。然而,这个数字考虑了制程和实现方面的改进,因此这38%的降幅中有多少来自微架构改进尚不确定。 Arm还宣布了C2-Nano和C2-Pro,但这些核心与C1-Nano和C1-Pro核心使用相同的底层微架构。 转向GPU IP,Arm表示Mali G2-Ultra NX是“七代以来GPU IP最大规模的重新设计”。 [](https://substackcdn.com/image/fetch/$s_!scC-!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F902cdf29-18c4-4d4a-9ff6-0d95d627988e_1547x1495.png) 我对搭载矩阵加速器的G2-Ultra着色器核心的推测。 G2-Ultra NX着色器核心的计算能力并未改变。它仍然拥有128个FMA单元,相当于每时钟周期256个FP32浮点运算或512个FP16浮点运算。G2-Ultra NX GPU允许的着色器核心最大数量——24个G2-Ultra NX着色器核心——也没有变化。 [](https://substackcdn.com/image/fetch/$s_!Q9st!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0760698a-7be3-4d73-91d9-e436ab0d4a17_2382x1342.png) G2-Ultra NX将线程束可访问的寄存器数量从64个增加到128个,并提升了寄存器访问的粒度,使得G2-Ultra现在可以按16个寄存器为单位进行分配。伴随着这些改进,寄存器文件的大小也增加了25%。 [](https://substackcdn.com/image/fetch/$s_!Dsl1!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fba510116-c237-48b8-b07a-dd43a1742848_1973x1105.png) Arm还改进了G2-Ultra NX中的光线追踪单元,使其处理的三角形结构更加紧凑。根据Arm的说法,这减少了13%的DRAM流量,因为消除了冗余数据,从而可以将更多数据装入缓存。 [](https://substackcdn.com/image/fetch/$s_!2OZw!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F6c76464d-03c9-4ca1-93fb-7b4d781616af_1984x1103.png) Arm还在G2-Ultra NX中加入了不透明度微映射,将这项桌面GPU功能引入了移动领域。 [](https://substackcdn.com/image/fetch/$s_!DQYK!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff41f0ea5-eb22-4f3d-acad-e9b0a88d498c_1528x864.png) Arm整合到G2-Ultra NX中的另一项桌面GPU功能是在着色器核心中集成矩阵加速器。该矩阵加速器每时钟周期可执行最多1,024次INT8 MAC运算或512次INT16 MAC运算,且其时钟频率最高可达执行引擎时钟频率的两倍。然而,一个明显的缺失是矩阵加速器仅支持INT8和INT16,不支持像FP8这样的低精度格式,也不支持虽较大但非常流行的BF16格式,标准ALU也不支持BF16。 Arm并不要求G2-Ultra NX GPU中的每个着色器核心都配备矩阵加速器,但要求“Ultra”品牌至少包含6个“NX核心”。 小米在其全新的XRING O3中实现G2-Ultra NX时,决定只有一半的着色器核心配备矩阵加速器。 比较有无矩阵加速器的核心结构尺寸,带有NX单元的G2-Ultra NX着色器核心面积约为1.88平方毫米,而没有矩阵单元的G2-Ultra着色器核心约为1.55平方毫米,这意味着矩阵单元使着色器核心的面积增加了约21%。 增加的矩阵单元使Arm能够推出其基于机器学习的升频版本——神经超级采样(NSS)。 [](https://substackcdn.com/image/fetch/$s_!Yumc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F605f1887-1e15-4950-982f-3bc307980615_1713x963.png) Arm还随着G2代推出了其帧率提升技术。 [](https://substackcdn.com/image/fetch/$s_!SuS0!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc7ba462a-8176-4a3f-9676-8a8d9f3a6f87_1731x968.png) 凭借对GPU IP的所有这些改变,Arm声称相比上一代,游戏性能提升最高可达14%,光线追踪基准测试性能提升最高可达24%。 [](https://substackcdn.com/image/fetch/$s_!Eapx!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F46721697-fd1a-47a5-a0b1-0a189bcb745c_1708x958.png) 然而,在这些对比中,G2-Ultra NX GPU的时钟频率比G1-Ultra GPU高出约11%,这意味着这些改动可能对非光线追踪游戏的提升不大。 [](https://substackcdn.com/image/fetch/$s_!YZNv!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe577385a-cc66-46b6-918d-07a0ba96d440_1727x967.png) 在服务器端,Arm还宣布Neoverse N4 CSS将向其合作伙伴开放。 [](https://substackcdn.com/image/fetch/$s_!QUEI!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F8591b20a-8825-4f6d-97f9-c2c1eaa68bab_2640x1510.png) 遗憾的是,这是Arm关于Neoverse CSS N4的唯一一张幻灯片。当被问及时,Arm确实提供了更多信息: - **CPU:** 每个芯片8-128个Neoverse N4核心,这是Neoverse CSS中提供的最广泛核心数量范围,频率最高可达3.8 GHz。 - **扩展性:** 支持多芯片模块和多插槽设计,以实现超出单个芯片规模的扩展。 - **L1缓存:** 每个核心64KB指令缓存和64KB数据缓存。 - **L2缓存:** 每个核心最高2MB私有L2缓存。 - **系统级缓存:** 每个芯片最高256MB共享缓存。 - **内存:** 支持DDR5或LPDDR6,在容量、带宽、功耗和系统设计方面提供灵活性。 - **I/O:** 最多128条PCIe Gen 6/7和CXL 4.0通道。 - **芯片模块互连:** Arm芯片到芯片互连,支持UCIe或合作伙伴特定的物理层。 仍然有许多问题,比如N4使用的核心是什么、单个芯片上的内存总线宽度是多少、单个芯片上的PCIe通道数量是多少等。 我应该提到的一点是,Arm这次的技术披露令人失望。值得肯定的是,Arm在被提问时确实回答了问题,这种响应速度值得赞赏,然而令人沮丧的是,这些问题本应在演示文稿中得到解答,而不是现在这样需要额外提问来填补空白。如果我们能获得与Arm之前发布相当质量的信息,我们会花更多时间以我们更典型的方式来分析微架构。 C2-Ultra就是这个问题的一个例子,关于改进的分支预测和推测执行的说法几乎没有提供任何实际改变的信息,而性能数字则将这些核心改进与更高的时钟频率、更大的L2缓存和更多的内存带宽结合在一起。转向包含制程和实现改进的功耗数字,我们不禁要问,新微架构对功耗降低的贡献有多少。这些数字对于关于CPU IP的发布尤其令人沮丧,因为在这种发布中,在等效时钟和内存配置下进行比较会很有用。 G2-Ultra NX提供了更多细节,特别是在寄存器分配、矩阵加速器的添加以及光线追踪单元的改进方面,然而将其描述为“七代以来GPU最大规模的重新设计”设定了一个技术深度方面的期望,而这并未被完全满足。矩阵加速器有限的精度支持也引发了关于其在Arm选择的目标工作负载之外的实用性问题,我本希望Arm在演示中花时间解释原因。而CSS N4则将细节的缺乏推向了极致,其产品基本信息仅通过一张幻灯片展示,且需要通过提问才能获得。 Arm拥有值得谈论的IP和产品,但演示在传达这些内容方面做得不好。技术实质内容应该从一开始就在演示文稿中,而不是需要通过后续问题和电子邮件来拼凑。

相似文章