Arm Mali G2-Ultra NX GPU:桌面级移动游戏与AI原生图形

Hacker News Top 产品

摘要

Arm推出了Mali G2-Ultra NX GPU,这是其首款AI原生GPU,将神经加速集成到图形管线中,以提供桌面级移动游戏体验和AI增强图形。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/08 06:37

# 探秘Arm Mali G2-Ultra NX GPU:以AI原生图形实现桌面级移动游戏体验 来源:https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics 移动用户的需求持续增长。他们期待更丰富的视觉效果、更流畅的帧率以及日益沉浸的体验。对开发者而言,挑战复杂而艰巨:他们需要在满足这些期望的同时,严格遵循移动设备在功耗、散热和带宽方面的限制。 传统渲染能提供高质量图像,但要在移动设备的约束下达到桌面级视觉保真度,必须大幅提升效率。神经图形技术提供了另一条路径:利用AI重建细节、生成中间帧、优化图像,同时降低GPU负载和整体系统负担。 然而,将神经图形引入主流移动体验,需要深度整合GPU架构和开发者生态。凭借迄今为止超过140亿颗Mali GPU的出货量,Arm具备足够的规模与经验,为下一代移动设备提供这些能力。 这一转变的核心正是Arm Mali G2-Ultra NX GPU (https://www.arm.com/products/silicon-ip-multimedia/gpu/mali-g2-ultra-nx)。作为首款AI原生Mali GPU,它将神经加速直接集成到图形管线中,帮助开发者在移动功耗限制内提供更丰富、响应更迅捷的视觉体验,并更快将神经图形技术推向实际应用。 ## 面向神经图形的AI原生GPU Mali G2-Ultra NX从底层为神经图形设计,神经加速器与着色器核心紧密集成,使神经图形负载能与图形和计算负载并行运行。这种紧密集成复用了GPU内存系统、一致性缓存和控制结构,有助于减少数据移动,提升整体管线效率。 Arm Mali G2-Ultra NX概览:展示其紧密集成的神经加速器、新型执行引擎、第三代光线追踪单元、开放软件栈及生态系统支持。Mali G2-Ultra NX结合了专用神经加速、新型执行引擎和第三代光线追踪,为移动端AI原生图形提供支持。以下三项Mali G2-Ultra NX集成的神经技术展现了其能力: - **神经超级采样(NSS)**:从低分辨率渲染中重建高分辨率图像,减少生成高质量最终图像所需的常规渲染工作量。 - **神经帧率提升(NFRU)**:生成中间帧以提高帧率,带来更流畅的游戏体验。 - **神经超级采样与降噪(NSSD)**:将神经超分辨率与降噪相结合,提升复杂光线追踪场景(具有复杂光照与阴影)的图像质量。 神经超级采样示意图:展示低分辨率颜色、运动与深度数据输入神经网络,神经网络利用时序帧历史重建细节并输出抗锯齿、超分辨率的画面。NSS从低分辨率输入重建高分辨率图像,结合时序数据与集成抗锯齿技术,在移动端高效提升图像质量。神经帧率提升示意图:展示两帧渲染画面、深度与运动数据输入神经网络,生成一帧AI中间帧,硬件加速的光流辅助运动估计。NFRU利用运动、深度与渲染帧数据生成高质量中间帧,为移动端游戏带来更流畅的体验。由Arm与Sumo Digital合作开发的《Neural Dawn》(https://newsroom.arm.com/news/announcing-neural-dawn)展示了开发者如何将NFRU与NSSD集成至实际游戏管线,实现高达4倍的性能效率提升,并将外部内存流量降低多达70%。这些提升使得虚幻引擎MegaLights等先进技术在移动设备上得以实际应用。 阐释《Neural Dawn》游戏中NFRU与NSSD如何协同工作以提升移动端图形效果。通过结合传统渲染与神经图形,开发者能在保持图像质量的同时降低GPU与系统级负载。对玩家而言,这意味着在移动设备的限制内,获得更清晰的画面、更流畅的帧率、更丰富的场景以及响应更迅捷的游戏体验。 ## 新型执行引擎扩展图形性能空间 除神经加速外,Mali G2-Ultra NX引入了全新执行引擎——这是Mali GPU七代以来最大的指令集架构升级,旨在处理日益复杂的图形负载并提升性能。其每个warp的寄存器数量最多增加两倍,帮助GPU更高效地处理要求更高的场景。这为开发者提供了更多空间来实现更丰富的视觉效果和更复杂的特效,同时保持帧率稳定。 架构图展示神经加速器集成于Mali G2-Ultra NX着色器核心内,与执行引擎、内存系统和控制结构并存,支持INT8与INT16处理、光流加速及共享GPU资源。Mali G2-Ultra NX在着色器核心内直接集成专用神经加速,共享GPU内存与控制结构,提升神经图形负载的效率。架构改进使基准测试性能提升高达24%,非AI游戏性能提升14%。将架构改进与神经加速(通过NFRU)结合,支持以高达120 FPS的帧率进行更长时间的移动游戏,带来更流畅、响应更灵敏的游戏体验。 并排对比展示在Mali G2-Ultra NX上,借助NFRU实现更高帧率如何提升视觉流畅度。 ## 第三代光线追踪单元更高效呈现丰富光影 Mali G2-Ultra NX推出Arm第三代硬件光线追踪,支持在移动设备上实现更复杂的光照、阴影、反射与几何效果。新型GPU架构在领先光线追踪基准测试中,将DRAM流量降低多达13%,随着场景复杂度提升,减轻内存压力。 同时,硬件支持的不透明微映射(O micromaps)能更高效地处理复杂透明几何体,使移动端可呈现更丰富的植被、更细致的织物、分层表面及其他复杂场景元素。在Arm的一个演示中,使用不透明微映射使帧率提升30%,光线追踪负载降低多达70%,展示了该技术如何使复杂几何体在移动端更具实用性。 利用不透明微映射实现实时光线追踪阴影,在Moku的中央花园中创造栩栩如生的环境,同时保持性能稳定。神经图形进一步补充了光线追踪的进步。将新的光线追踪硬件与神经技术(如NFRU)结合,有助于在移动渲染限制内更高效地呈现更丰富的视觉细节。 ## 为开发者提供将神经图形更快推向生产的实用路径 然而,新图形硬件只有通过开发者熟悉的工具和工作流才能发挥价值。Arm在Mali G2-Ultra NX发布前两年就开始准备软件生态系统,推出Arm Neural Technology (https://www.arm.com/technologies/neural-technology)和开放的神经图形开发套件。这些工具使内容开发者、工具开发者及游戏引擎提供商能提前接触神经技术,从而在硬件就绪前将其集成到现有工作流中。 腾讯游戏和Unity中国阐述他们如何将神经图形融入熟悉的开发工作流,助力AI原生移动图形从技术走向生产。如今,Arm Neural Graphics Development Kit (https://developer.arm.com/mobile-graphics-and-gaming/neural-technology)提供将这项工作推向生产所需的软件与工具,涵盖主流图形API、游戏引擎及自定义工作流。开发者工具包包含NSS和NFRU,以及针对Vulkan的机器学习扩展和针对主流游戏引擎(包括虚幻引擎)的插件。SDK支持自定义引擎集成,同时性能分析、图形优化、训练与模型优化工具帮助开发者评估和微调神经图形负载。 所有这些资源提供了从实验到生产的路径,无需工作室构建专用研究基础设施或改变现有开发工作流。 正如《燕云十六声》引擎负责人周礼所言:“通过与Arm的合作,我们正将Arm Neural Technology集成至 Messiah 引擎并应用于实际游戏开发。《燕云十六声》将成为首批向玩家呈现Arm Neural Technology的游戏之一,标志着从引擎级集成到实际部署的重要一步。我们共同为神经图形在游戏生态中的更广泛开发者采用铺平道路。” ## Arm CSS for Mobile 2的AI原生图形基础 先进的移动图形需要整个系统的优化,而不仅仅是GPU。在Arm CSS for Mobile 2 (https://newsroom.arm.com/blog/arm-css-for-mobile-2-and-c2-cpu-cluster)内,Mali G2-Ultra NX将AI原生图形与计算、内存、软件和实现优化相结合,帮助芯片合作伙伴在移动功耗与散热限制内管理日益高要求的负载。 结合已准备好将这些能力投入生产的生态系统,这提升了移动图形的上限,为数十亿移动设备提供更丰富的视觉效果与更流畅的体验。 #### Arm Mali G2-Ultra NX 通过将神经加速器直接集成至图形管线,推动移动图形进步。

相似文章

推出 Gemma 3n 预览版:功能强大、高效、移动优先的 AI

Google DeepMind Blog

Google 推出 Gemma 3n 预览版,这是一个移动优先的开源 AI 模型,针对手机、平板电脑和笔记本电脑上的本地推理进行了优化。该模型采用与高通和联发科等硬件合作伙伴共同开发的新架构,利用分层嵌入等创新技术,在最少内存占用(2-3GB)的情况下实现快速性能,同时支持多模态功能。

AMD的Instinct MI455X:志在巅峰

Hacker News Top

AMD推出了Instinct MI455X GPU,这是其首款专为机架级部署设计的AI加速器,基于全新的CDNA5架构,性能高达40.26 PFLOP,配备432 GB HBM4内存,以及Helios机架级解决方案支持72 GPU集群。