Sakeena Fiza 助力 NVIDIA 硬件实现规模化成功
摘要
Sakeena Fiza 是 NVIDIA 的验证工程师,她确保像 NVIDIA Rubin GPU 这样的硬件系统在大规模生产之前能够在规模上正确运行,凸显了验证在AI基础设施中的重要性。
<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">当 Sakeena Fiza 描述她在 NVIDIA 作为验证工程师的工作时,她用的术语更像是侦探故事,而非世界级工程实验室。</span></p>
<p><span style="font-weight: 400;">“验证工程师会深入暗处,照亮每一个角落,”Fiza 说。“每次我们拿到一个系统,第一个想法就是:它会怎么坏掉?”</span></p>
<p><span style="font-weight: 400;">而当它真的坏掉时? </span></p>
<p><span style="font-weight: 400;">“我总喜欢把它当作一个待解的谜题,”她说。</span></p>
<p><span style="font-weight: 400;">在 NVIDIA,Fiza 和她在数据中心系统工程实验室的同事们所研究的系统是AI时代的引擎。她的工作在外界知道产品存在之前就开始了——在实验室里,当新系统第一次通电时。</span></p>
<p><span style="font-weight: 400;">组件逐个启动,电路板被集成,固件和软件团队蜂拥而至,工程师们观察着最初的生命迹象。 </span></p>
<p><span style="font-weight: 400;">Fiza 在 NVIDIA 工作中最早且最深刻的记忆之一,是当她看到 </span><a target="_blank" href="https://www.nvidia.com/en-us/data-center/technologies/rubin/"><span style="font-weight: 400;">NVIDIA Rubin GPU</span></a><span style="font-weight: 400;"> 首次在系统层面运行时,所体验到的集体喜悦。</span></p>
<p><span style="font-weight: 400;">“它真的只显示了‘NVIDIA Corporation Device’,”她回忆道。“然后所有人都在欢呼庆祝,因为这是世界上第一次 Rubin GPU 在系统层面被识别。”</span></p>
<p><span style="font-weight: 400;">那些时刻,尽管令人激动,但只是开始。从此,系统必须变得可靠:从托盘到机架,到集群,到生产线,再到客户AI工厂。 </span></p>
<p><span style="font-weight: 400;">Fiza 将验证——确保物理设备在大规模生产开始前正确运行的过程——描述为成为“产品的首批客户”,在其他人依赖它之前,在各种现实条件下将硬件推至极限。</span></p>
<p><span style="font-weight: 400;">“目标总是在客户发现问题之前捕获问题,”她说。 </span></p>
<figure id="attachment_98469" aria-describedby="caption-attachment-98469" style="width: 1200px" class="wp-caption aligncenter"><img fetchpriority="high" decoding="async" class="size-large wp-image-98469" src="https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-1680x1121.png" alt="" width="1200" height="801" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-1680x1121.png 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-960x640.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-1280x854.png 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-1536x1025.png 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01-630x420.png 630w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_01.png 2048w" sizes="(max-width: 1200px) 100vw, 1200px" /><figcaption id="caption-attachment-98469" class="wp-caption-text">在实验室之外,Fiza 和同事们在圣克拉拉的共享办公空间中合作。</figcaption></figure>
<p><span style="font-weight: 400;">Fiza 在加州大学尔湾分校获得学士学位后加入 NVIDIA,在那里她学习计算机科学与工程。她进入硬件领域是源于对系统日益增长的迷恋。 </span></p>
<p><span style="font-weight: 400;">在迪拜长大时,她通过 Logo 编程语言接触编码,促使她未来探索系统设计,包括在高中机器人营中建造火星车,以及在大学期间从事无人飞行器的工作。</span></p>
<p><span style="font-weight: 400;">吸引她从事数据中心系统工作的是有机会与整台机器打交道。她说,在 NVIDIA,验证正处于这个交叉点:固件、硬件、软件、机械设计、热行为、制造和客户体验。</span></p>
<p><span style="font-weight: 400;">“我想当机械工程师时就能当,”她说。“我想当电气工程师时就能当。我想当固件工程师时就能当。”</span></p>
<p><span style="font-weight: 400;">她追寻的故障可能巨大或微小。机架级问题可能涉及高速信号、热裕量或电源完整性。另一个问题可能源于螺丝拧得太紧或客户设施中的灰尘水平。</span></p>
<p><span style="font-weight: 400;">“解决方案可能难以捉摸,”Fiza 说。“我们必须跟随线索,忽略错误线索,并知道该看哪里。”</span></p>
<p><span style="font-weight: 400;">当日志显示某事如何失败时,Fiza 的工作是找出原因。验证工程师重现问题,改变条件,调查固件,移除机械变量,探测信号,研究示波器截图,并缩小可能的原因。</span></p>
<p><span style="font-weight: 400;">一块电路板可能包含数万个组件;一个机架可能接近五十万个。这些部件不能仅仅共存。它们必须在压力下作为一个系统运行,在规模上,在多样化AI工厂配置的复杂现实生产与部署中。</span></p>
<p><span style="font-weight: 400;">“我希望人们理解 AI 所需运行的硬件有多复杂,”Fiza 说。</span></p>
<p><span style="font-weight: 400;">对于 Fiza 来说,工作的压力与快乐不可分割。她说,启动过程“就像复仇者联盟集结”:架构师、设计师、软件工程师、固件工程师、验证工程师,都在房间里,竞相打造一个可工作的系统。</span></p>
<p><span style="font-weight: 400;">“我知道来上班时的一件事是,我从不孤单,”她说。 </span></p>
<p><span style="font-weight: 400;">成为一名验证工程师就是实践一种有纪律的怀疑:相信系统能工作,然后尝试构想它可能无法工作的每种方式。 </span><span style="font-weight: 400;">这份工作需要伟大侦探的执着,以及全科医生的诊断能力,以及以他人对待填字游戏的方式来面对灾难性故障的性情。 </span></p>
<p><span style="font-weight: 400;">每个项目带来一个新谜题,一个新的故障模式,从而有机会让下一个系统变得更好。</span></p>
<p><span style="font-weight: 400;">“对于我们在管线中的产品,我非常兴奋,”Fiza 说。“它们将改变世界。”</span></p>
<p><img decoding="async" class="aligncenter size-large wp-image-98470" src="https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-1680x1121.png" alt="" width="1200" height="801" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-1680x1121.png 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-960x640.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-1280x854.png 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-1536x1025.png 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02-630x420.png 630w, https://blogs.nvidia.com/wp-content/uploads/2026/09/Sakeena-Fiza_NVIDIA-Life_02.png 2048w" sizes="
查看缓存全文
缓存时间: 2026/09/23 21:03
# 萨基娜·菲扎如何助力英伟达硬件实现大规模成功
来源:https://blogs.nvidia.com/blog/nvidia-life-sakeena-fiza/
当萨基娜·菲扎描述自己在英伟达担任验证工程师的工作时,她的用词更像在讲述侦探故事,而非世界级工程实验室的日常。
“验证工程师就像在暗处寻找线索,将光芒照进每个角落,”菲扎说,“每次拿到新系统时,我们首先想到的是:它会如何崩溃?”
如果真的崩溃了呢?
“我总喜欢把这看作一个待解的谜题,”她说道。
在英伟达,菲扎和数据中心系统工程实验室同事们研究的系统正是人工智能时代的核心引擎。她的工作始于产品在实验室首次通电的时刻——此时世界尚未知晓该产品的存在。
组件逐一启动,电路板进行集成,固件和软件团队蜂拥而至,工程师们屏息观察着生命的第一个征兆。
菲扎在英伟达工作初期最深刻的记忆之一,是看到英伟达Rubin GPU (https://www.nvidia.com/en-us/data-center/technologies/rubin/)首次在系统层面运行时,团队共同分享的喜悦。
“屏幕上只显示了‘NVIDIA Corporation Device’字样,”她回忆道,“但所有人都在欢呼庆祝,因为这是Rubin GPU首次在系统层面被成功识别。”
然而这样激动人心的时刻仅仅是开始。从这一刻起,系统必须变得坚韧可靠——从托盘到机架,从集群到生产线,最终抵达客户的AI工厂。
菲扎将验证工作——即确保物理设备在量产前正常工作——描述为成为“产品的首批用户”,在其他人依赖硬件之前,先在各种现实条件下将硬件性能推至极限。
“我们的目标始终是在客户发现问题前解决问题,”她表示。
实验室之外,菲扎与同事们在圣克拉拉办公区的协作空间共同工作。她毕业于加州大学欧文分校计算机科学与工程专业,加入英伟达后正式踏入硬件领域。对系统工程日渐浓厚的兴趣引导她走上了这条道路。
在迪拜长大的她,最初通过Log编程语言接触编程,这激发了她后续对系统设计的探索:在高中机器人夏令营中制造火星车,大学期间参与无人机项目。
数据中心系统对她的吸引力在于能够接触完整的机器体系。菲扎表示,在英伟达,验证工作恰好处于这种交汇点:固件、硬件、软件、机械设计、热工性能、制造工艺与客户体验在此融合。
“需要时我可以是机械工程师,需要时也可以成为电气工程师,需要时还能化身固件工程师,”她说道。
她追踪的故障可能极其宏观或极其微观。机架级问题可能涉及高速信号、热裕量或电源完整性;而另一个故障可能仅仅源于螺丝拧得太紧,或是客户设施中的灰尘浓度。
“解决方案往往难以捉摸,”菲扎说,“我们必须追踪线索,排除干扰信息,并精准定位排查方向。”
当日志显示故障现象时,菲扎的工作是深究根本原因。验证工程师通过复现问题、调整条件、研究固件、排除机械变量、探测信号、分析示波器波形,逐步缩小可能的原因范围。
单块电路板可能包含数万个组件,机架级的组件数量可能逼近五十万。这些部件不能仅是共存,而必须在压力测试、规模化部署以及多样化工厂配置的复杂现实环境中,协同运作成一个有机整体。
“我希望大家能理解AI运行所依赖的硬件是何等复杂,”菲扎强调。
对菲扎而言,工作的压力与乐趣密不可分。系统启动阶段,“就像复仇者联盟集结”:架构师、设计师、软件工程师、固件工程师、验证工程师齐聚一堂,向着可工作的系统全速冲刺。
“上班时我很清楚自己绝不是孤军奋战,”她说。
验证工程师需要践行一种严谨的怀疑精神:先相信系统能够正常工作,再设想所有可能的故障场景。这份工作既需要伟大侦探般的执着,也要求全科医师般的诊断能力,更要具备以面对填字游戏般从容应对灾难性故障的心态。
每个项目都带来新的谜题、新的故障模式,进而让下一代系统变得更优秀。
“看到产品线上的这些创新成果,我无比兴奋,”菲扎说,“它们将改变世界。”
相似文章
保障智能基础设施
NVIDIA宣布与SB Energy和OpenAI合作,为AI工厂确保大规模电力基础设施,强调计算资源在推动AI经济中的战略重要性。
@CNET:Nvidia CEO 黄仁勋在 GTC 2026 详解 Vera Rubin 系统
在 Nvidia GTC 2026 上,CEO 黄仁勋发布了下一代 Vera Rubin 系统;Supermicro 也推出基于 Nvidia Blackwell GPU 的全栈 AI Factory 产品组合,实现企业级 AI 一站式部署。
Ilya Sutskever 的 Safe Superintelligence 与 Nvidia 合作以扩展其 AI 研究
Safe Superintelligence,由 Ilya Sutskever 创立的 AI 实验室,宣布与 Nvidia 建立长期合作,包括数十亿美元的投资以及获取 Nvidia 的 Vera Rubin GPU 平台的权限,以扩展其在安全超级智能方面的研究。
AI Infra Summit:NVIDIA Vera Rubin 与 DSX 平台进展展示优化 AI 工厂每瓦特令牌的能效
在 AI Infra Summit 上,NVIDIA 展示了 Vera Rubin 和 DSX 平台的进展,重点通过新的合作和技术优化 AI 工厂的每瓦特令牌能效。
你对SSI与NVIDIA的合作有何看法?
SSI这家由Ilya Sutskever领导的AI公司已与NVIDIA合作,以规模化一项机器学习和AI领域的新发现。