# NVIDIA与微软合作,为AI代理部署打造统一技术栈——从Windows设备到云端再到本地
来源:https://blogs.nvidia.com/blog/microsoft-build-windows-local-cloud-devices/
代理式AI时代已经到来,但要实现其承诺,仅靠优秀模型远远不够,还需要高速硬件、安全运行时、响应式数据层以及针对长时推理优化的模型。NVIDIA与微软正在为Windows设备、Azure云和本地部署的开发者提供完整的这一技术栈。
在Microsoft Build大会上,NVIDIA创始人兼CEO黄仁勋通过直播从台北连线参与了微软董事长兼CEO萨提亚·纳德拉的主题演讲,共同讨论了这一扩展合作:NVIDIA RTX Spark(https://nvidianews.nvidia.com/news/nvidia-microsoft-windows-pcs-agents-rtx-spark)和DGX Station for Windows(https://nvidianews.nvidia.com/news/nvidia-rtx-station-with-windows-puts-a-trillion-parameter-ai-supercomputer-on-every-enterprise-desk)、NVIDIA GPU加速的Microsoft Fabric、Microsoft Foundry上的NVIDIA开放模型、GitHub Copilot中的NVIDIA OpenShell(https://build.nvidia.com/openshell)安全运行时,以及下一代NVIDIA驱动的AI工厂。
## **为代理重塑Windows:从RTX Spark到DGX Station for Windows**
NVIDIA和微软正在重新构想AI代理时代的Windows PC。借助RTX Spark笔记本和小型台式机,以及DGX Station for Windows桌面级AI超级计算机,开发者可以在Windows原生环境下构建、调优和运行AI代理。
RTX Spark是一个全新起点,赋能全球首批专为个人AI代理打造的Windows PC,具备1 petaflop AI算力、高达128GB统一内存、全天候续航,并且在不插电情况下仍能保持完整AI与图形性能。融合了NVIDIA超过30年的创新成果,包括CUDA、RTX、DLSS和TensorRT,这些系统将于今年秋季从Microsoft Surface、ASUS、戴尔、惠普、联想和MSI等厂商推出。
DGX Station for Windows是性能最强大的桌面级AI超级计算机,专为在Windows企业应用和工作流中构建和运行AI代理而设计。它搭载NVIDIA GB300 Grace Blackwell Ultra Desktop超级芯片,拥有高达748GB一致性内存和20 petaflops FP4算力,可运行高达1万亿参数的尖端模型,支持7x24小时的企业级AI代理。系统预计于第四季度从ASUS、戴尔、技嘉、惠普、MSI和超微等厂商推出。这两款产品均运行NVIDIA OpenShell——一个面向自主AI代理的、从设计上确保安全的运行时。
更多详情请参阅微软博客:“Introducing a powerful new chapter for Windows PCs, accelerated by NVIDIA RTX Spark(https://blogs.windows.com/windowsexperience/2026/05/31/introducing-a-powerful-new-chapter-for-windows-pcs-accelerated-by-nvidia-rtx-spark/)”
## **借助Microsoft Foundry上的NVIDIA开放模型,以企业级规模驱动代理工作流**
代理式AI运行在一个模型系统之上。随着NVIDIA、Anthropic和OpenAI的模型——加上Hermes专用代理——现已在Foundry Agent Service的托管代理中可用,企业可以在Azure上构建代理系统,并内置身份验证与治理能力。Anthropic的Claude模型现在已原生运行在Azure的NVIDIA GB300 Blackwell Ultra系统上,客户将在未来几周内可用。
NVIDIA Nemotron 3 Ultra是一款新的开放前沿推理模型,专为跨编程、研究和企业工作流的长时运行代理设计,本月将在Foundry托管计算上可用,同时还有用于语音识别的Nemotron 3.5 ASR和Nemotron 3.5内容安全模型。开发者可以将Nemotron与前沿模型和本地模型组合使用,优化每个工作流的成本与质量。
NVIDIA在Foundry上的开放模型组合现已涵盖代理式、物理和科学AI。NVIDIA Cosmos 3(https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai)是首个完全开放的物理AI全模态模型,具备视觉推理、世界模拟和行为生成能力。NVIDIA Earth-2 AI天气预报模型现可通过Microsoft Planetary Computer Pro和Foundry(https://aka.ms/MPCP_GA)获取,用于企业级预测与风险分析。
NVIDIA Agent Toolkit(https://nvidianews.nvidia.com/news/enterprise-software-leaders-build-ai-agents-with-nvidia)和NVIDIA NemoClaw(https://www.nvidia.com/en-us/ai/nemoclaw/)蓝图为开发者提供了开源平台,用于在Foundry上构建生产级AI代理。NVIDIA CUDA-X库(包括cuDF、cuOpt、AI-Q和NeMo)现在可作为领域特定技能供AI代理使用。
在Build分论坛中了解更多:“Orchestrate Special Agents with NVIDIA Nemotron Models on Microsoft Foundry(https://build.microsoft.com/en-US/sessions/BRKSP94?source=sessions)”
## **加速AI时代的企业数据仓库**
数据驱动代理式AI,快速访问数据至关重要。
NVIDIA加速计算现已集成到Microsoft Fabric Data Warehouse中,微软内部基准测试显示,在高并发工作负载下,SQL执行速度比基于CPU的基线快达6倍,比另外三家领先云数据仓库供应商快达7倍。
企业数据层现在能够跟上持续查询和推理数据的AI代理的步伐,这是NVIDIA与微软多年深度工程协作(从研究到生产)的成果。
更多详情请参阅微软博客:“Microsoft Build 2026: Building agentic apps with Microsoft Fabric and Microsoft Databases(https://aka.ms/Azure-Data-Build26)”
## **推进物理AI与自主系统**
物理AI是AI代理的下一个前沿。
微软正在将NVIDIA的开源物理AI技能与工具(https://nvidianews.nvidia.com/news/nvidia-releases-major-collection-of-open-source-agent-tools-and-skills-for-physical-ai)与Azure及其Physical AI Toolchain(https://github.com/microsoft/physical-ai-toolchain)集成。开发者将获得一个统一平台,由Cosmos 3的混合Transformer架构驱动,用于模拟、训练和部署自主系统,包括机器人、自动驾驶汽车以及能够感知、推理、规划并在物理世界中行动的工业系统。在视觉推理、世界生成和行为生成等关键基准测试中,Cosmos 3在开放模型中排名第一。
## **通过NVIDIA RTX PRO 6000 Blackwell Server Edition和Nemotron模型增强Azure Local和Foundry Local**
代理式AI正在超越云端。
微软正在将Azure Local上的Foundry Local引入NVIDIA RTX PRO 6000 Blackwell Server Edition平台。结合NVIDIA Nemotron开放模型家族,企业可以在数据所在位置运行高性能AI工作负载——无论是在本地、混合还是主权环境中——而无需牺牲性能或治理能力。
Azure Local上的Foundry Local现在支持多节点部署和vLLM运行时,能够扩展制造、能源、主权数据中心以及其他对延迟敏感场景中的推理能力。
在微软博客中了解更多:“Unlocking the possibilities of physical AI with Foundry Local and Azure Local(https://aka.ms/PhysicalAIBuildblog)”,“Scale On-Prem AI with Foundry Local on Azure Local(https://aka.ms/FoundryLoca_Techcommunity_Build_blog)”
## **通过NVIDIA OpenShell将安全代理开发引入GitHub Copilot**
随着AI代理从代码辅助转向自主执行,它们需要真正的能力,但不应直接暴露真实凭证。https://build.nvidia.com/openshell
现已集成到GitHub Copilot中的NVIDIA OpenShell解决了这一问题:每个AI代理在其独立的沙盒容器中运行,每个出站调用在访问文件、网络或凭证之前都会根据策略进行评估。策略以代码形式编写,在仓库中进行版本控制,并可随时更新。OpenShell在Apache 2.0许可证下开源,模型无关,并支持本地、混合和云环境。
在Build闪存会议中了解更多:“Secure Agent Workflows with GitHub Copilot and NVIDIA OpenShell.(https://build.microsoft.com/en-US/sessions/DEMSP387?source=sessions)”
## **威斯康星州费尔沃特AI工厂上线,通过NVIDIA Vera Rubin验证**
微软位于威斯康星州费尔沃特的AI工厂现已上线(https://x.com/i/status/2044767391293509761),进度提前,以单一AI工厂形式运行数十万NVIDIA Grace Blackwell系统,并与佐治亚州的类似AI工厂互联,为最尖端的模型提供可扩展、分布式的AI系统。通过在电力、冷却、NVIDIA Spectrum-X以太网以及新的Multipath Reliable Connection(MRC)(https://blogs.nvidia.com/blog/spectrum-x-ethernet-mrc/)传输协议方面的联合工程,微软的费尔沃特AI数据中心设计正在优化token经济学。
此外,微软已经验证了NVIDIA Vera Rubin平台(现已全面投产)(https://nvidianews.nvidia.com/news/vera-rubin-full-production-agentic-ai-factory),计划在Azure数据中心部署。
Vera Rubin可与Blackwell无缝配合使用,无需改造,每兆瓦推理吞吐量提升高达10倍,并将每代理token的成本降低一个数量级。内置的NVIDIA机密计算可在代理大规模推理时保护模型和数据。NVIDIA Dynamo(https://www.nvidia.com/en-us/ai/dynamo/)推理框架将这些优势扩展到软件层面,加速AKS上的模型冷启动,并通过NVIDIA Grove(https://developer.nvidia.com/grove)实现Kubernetes原生分布式推理编排。
在微软博客中了解更多:“Scaling multi-node LLM inference with NVIDIA Dynamo-Grove on AKS (Part 4)(https://aka.ms/aks-dynamo-blog-part4)”
*探索Microsoft Build上的**NVIDIA全部会议、演示和实践实验室**(https://www.nvidia.com/en-us/events/microsoft-build/)*
在微软 Build 2026 大会上,CEO Satya Nadella 将 Windows 与 Nvidia 全新 RTX Spark 芯片共同置于舞台中央,将 Windows PC 上的本地 AI 计算定位为云端 AI 工作负载的高性价比替代方案。此次合作旨在实现强大的端侧 AI 智能体,RTX Spark 能够在本地运行 1200 亿参数的模型。