@MATLAB:使用 @NVIDIA Cosmos 配合 RoadRunner、MATLAB 和 Simulink,工程师可以在保持…的同时生成逼真的驾驶场景。

X AI KOLs Timeline 新闻

摘要

工程师可以使用 NVIDIA Cosmos 配合 RoadRunner、MATLAB 和 Simulink 生成逼真的驾驶场景,用于自动驾驶开发,结合控制仿真和生成式AI以增加视觉多样性。

使用 @NVIDIA Cosmos 配合 RoadRunner、MATLAB 和 Simulink,工程师可以在保持道路几何、车辆位置和运动的同时生成逼真的驾驶场景。 了解世界场景视频(WSV)如何帮助推进自动驾驶工作流程:https://t.co/a5XDfGQbmB https://t.co/LeQlBLRUgw
查看原文
查看缓存全文

缓存时间: 2026/08/19 02:36

使用 @NVIDIA Cosmos 结合 RoadRunner、MATLAB 和 Simulink,工程师可以在保持道路几何形状、车辆位置与运动状态的同时,生成逼真的驾驶场景。了解世界场景视频(WSV)如何助力推进自动驾驶工作流:https://t.co/a5XDfGQbmB https://t.co/LeQlBLRUgw


借助 RoadRunner、MATLAB 和 NVIDIA Cosmos 从高精地图生成照片级真实驾驶视频

来源:https://blogs.mathworks.com/autonomous-systems/2026/08/13/from-hd-maps-to-photorealistic-driving-video-with-roadrunner-matlab-and-nvidia-cosmos/?s_eid=psm_bl&source=15308

本文改编自 MathWorks 日本应用工程团队的演讲《使用 RoadRunner/MATLAB 为 Cosmos Transfer 生成输入视频》,该演讲于 2026 年 7 月 15 日的研讨会上进行。

为自动驾驶和高级驾驶辅助系统(ADAS)开发收集足够真实的测试数据可能颇具挑战,尤其是在危险场景或复杂环境条件下。例如,变道或紧急制动事件可能需要在白天、夜间、雪天或强眩光环境下进行评估。动态地图平台(DMP)、NVIDIA 和 MathWorks 联合展示了一种替代方案:在仿真中定义驾驶场景,然后利用生成式 AI 创建照片级真实感的视觉变体。

该工作流连接了高精地图、RoadRunner、MATLAB 与 Simulink,以及 NVIDIA Cosmos-Transfer2.5 Auto Multiview

高精地图或 RoadRunner 场景 → 驾驶场景 → 世界场景视频 → 照片级真实感多摄像头视频

RoadRunner 提供道路环境和交通场景。MATLAB 将场景和参与者信息转换为创建**世界场景视频(WSV)**所需的结构化数据,为 Cosmos-Transfer2.5 Auto Multiview 提供空间条件约束。Cosmos 随后将 WSV 与文本提示相结合,生成照片级真实感的多摄像头视频。

理解该工作流的一个有效方式是:仿真定义“发生了什么”。生成式 AI 定义“看起来如何”。

WSV 有助于保留道路几何形状、车道结构、车辆位置和运动等要素,而文本提示则控制天气、光照和时间段等视觉外观。Simulink 还可将车辆动力学引入工作流。由于摄像头安装在车身上,急刹车、路面扰动和悬挂运动都会影响摄像头位姿。RoadRunner-Simulink 联合仿真可将这种真实的车辆运动传递到用于 WSV 生成的摄像头轨迹中。

在将 WSV 送入生成模型之前,工作流还可以将其与 Unreal Engine 参考视频进行验证,以检查摄像头视场以及车道、道路特征和物体的对齐情况。

该演示基于相同的底层驾驶场景生成了多种视觉变体,包括晴天、眩光、夜间和雪天。这提供了一种探索可能难以或无法通过实车测试重复再现的条件的方法。

结果说明了仿真与生成式 AI 如何相互补充进行合成数据生成:仿真提供了对环境、场景和车辆行为的工程控制,而生成式 AI 则扩展了生成数据的视觉多样性。

[上方示例为一个雪地环境的六摄像头驾驶视频,包含左前、前、右前、左后、后和右后视图。Cosmos-Transfer2.5 Auto Multiview 从包含道路、标识和建筑物等静态元素的 RoadRunner 场景,以及包含车辆和行人等动态参与者的场景数据生成了该视频。]

想了解工作流如何构建?

以下部分逐步介绍 RoadRunner、MATLAB、Simulink 和 NVIDIA Cosmos 如何协同工作——从场景创建和世界场景视频生成,到验证和照片级真实感视频生成。

请继续阅读以下技术深度解析:

  1. 从高精地图到真实视频
  2. 什么是世界场景视频?
  3. 世界场景视频生成流程
  4. 导出场景与场景数据
  5. 生成世界场景视频
  6. 验证生成的 WSV
  7. 配置与运行 Cosmos-Transfer2.5 Auto Multiview
  8. 结果展示
  9. 总结

**注意:**NVIDIA Cosmos 的最新版本是 Cosmos 3,这是一个集成语言、图像、视频、音频和动作的全模态模型。单视图迁移(Single View Transfer)已在 Cosmos 3 中可用,Auto Multiview 支持预计将在未来的 Cosmos 3 版本中推出。但在撰写本文时,Auto Multiview 仅在 Cosmos-Transfer2.5 中可用,因此本工作流使用的是 Cosmos-Transfer2.5 Auto Multiview。

1 从高精地图到真实视频

工作流始于环境创建。道路场景可以:

  • 直接在 RoadRunner 中创建
  • 使用 RoadRunner Scene API 通过编程方式生成
  • 借助 AI 代理辅助创建
  • 从高精地图数据导入,例如由动态地图平台提供的数据

随后使用 RoadRunner Scenario 定义车辆和行人运动。根据场景和场景数据,MATLAB 生成创建**世界场景视频(WSV)**所需的数据。

WSV 为 NVIDIA Cosmos-Transfer2.5 Auto Multiview 提供空间和时间条件约束,该模型生成照片级真实感的多摄像头驾驶视频。这意味着高精地图中捕获的真实道路几何形状可以成为许多视觉差异化驾驶数据集的基础,而无需为每个环境进行手动重建。

例如,相同的场景可以渲染为:

  • 晴朗白天
  • 雨天
  • 雪天
  • 雾天
  • 夜间
  • 眩光环境

交通几何结构和车辆运动仍由仿真定义,而视觉外观可通过生成模型进行更改。


关键点在于:RoadRunner 场景可以从高精地图自动生成,然后通过 Cosmos-Transfer2.5 Auto Multiview 转换为照片级真实感视频。 这种方法能够高效生成真实视频变体,无需付出通常构建高细节数字孪生环境所需的大量手工劳动。

2 什么是“世界场景视频”?

工作流的关键要素是世界场景视频(WSV)。Cosmos-Transfer2.5 Auto Multiview 并不单独依赖文本提示。它还使用一个结构化的控制视频来描述底层的驾驶场景。

WSV 使用黑色背景,并将以下信息投影到每个摄像头视图中:

  • 车道标线
  • 道路边界
  • 交通信号灯和标识位置
  • 车辆
  • 行人
  • 3D 物体边界框

概念上,生成过程变为:

文本提示 + 世界场景视频 → 照片级真实感多摄像头视频

两种输入扮演不同的角色。世界场景视频约束场景几何形状和物体运动,而文本提示控制视觉外观和环境条件。这种分离对于工程应用特别有用。

与其要求生成模型同时构思场景及其外观,工程师可以明确定义场景,并主要使用生成式 AI 来创建逼真的视觉变体。


使用 Cosmos-Transfer2.5 Auto Multiview 需要世界场景视频。 因此,本工作流的核心问题是如何从高精地图数据以及 RoadRunner 场景和场景数据创建 WSV。

3 世界场景视频生成流程

该工作流将 RoadRunner 场景和场景信息转换为 Cosmos-Transfer2.5 Auto Multiview 所期望的格式。主要有三个阶段:

1)创建场景和场景数据 用户准备:

  • 一个 RoadRunner 场景或高精地图
  • RoadRunner Scenario 中的车辆和行人运动

场景包含道路环境,而场景描述参与者如何在其中移动。

2)在 MATLAB 中转换 RoadRunner 数据 一个为此演示开发的 MATLAB 工具 convertRRHD2CosmosWSV.m 读取 RoadRunner HD 场景数据和场景轨迹信息。然后,它将信息转换为以 Parquet 格式存储的场景注解。这些注解包括生成 WSV 所需的道路几何形状、参与者信息、轨迹和摄像头配置。

3)渲染世界场景视频 NVIDIA 在 Cosmos-Transfer 工作流中提供了 generate_control_videos.py。该 Python 工具读取场景注解,并为每个配置的摄像头渲染世界场景视频。结果是一组几何一致的控制视频,可提供给 Cosmos-Transfer2.5 Auto Multiview。


WSV 创建过程在 NVIDIA 官方文档中有详细说明。 https://github.com/nvidia-cosmos/cosmos-transfer2.5/blob/main/docs/world_scenario_video_generation.md

4 导出场景与场景数据

有两种方式可以将场景的车辆运动数据导出为 CSV。


  • 选项 1:导出预定义场景运动 – 直接从 RoadRunner Scenario 将预定义运动导出为 CSV。当需要快速创建 WSV 时使用此选项。
  • 选项 2:导出基于车辆动力学的运动 – 使用 RoadRunner-Simulink 联合仿真,将车辆动力学模型计算出的轨迹和车辆姿态导出为 CSV。

本工作流使用 simulationPathFollowing14DoF.m,这是一个 14 自由度的车辆动力学模型。

4-1. 为何车辆动力学重要:摄像头运动跟随车身运动

摄像头刚性安装在车身上,因此悬挂偏转和车辆俯仰直接影响摄像头的运动和方向。工作流形成了一个“RoadRunner 路面模型 -> 控制器 -> 车辆动力学”的闭环,车辆对路面轮廓和控制输入的响应被传递到摄像头位姿。


通过使用已知的车辆动力学参数将物理车辆运动传播到摄像头位姿,训练和验证工作流可以使用包含物理合理、数值模拟的车辆运动的传感器图像。

4-2. 运行 RoadRunner-Simulink 联合仿真

simulationPathFollowing14DoF.m 的主要输入参数:

  • scenarioName:保存在 RoadRunner 项目中的场景名称
  • outputFolder:CSV 文件的输出文件夹
  • 可选的名称-值参数:rrProjectDir(RoadRunner 项目文件夹)、rrInstallDir(RoadRunner 安装文件夹)、egoVehicleName(自车的名称;省略时使用参与者 ID 0)
% 指定场景名称和输出文件夹,然后运行
% 示例:
simulationPathFollowing14DoF('FourWayTraffic_sample', 'output_FourWay', egoVehicleName='ego');
simulationPathFollowing14DoF('CCRs40_TenVehicles', 'output_CCRs40', maxSimulationTime=8.5);

5 生成世界场景视频

当场景(RRHD)和场景数据(CSV)准备好后,即可生成 WSV。

步骤 1:在 MATLAB 中转换为 Parquet 运行 convertRRHD2CosmosWSV.m,从 RRHD 文件和场景 CSV 为 Cosmos-Transfer2.5 Auto Multiview 生成 Parquet 场景注解文件。

步骤 2:在 Python 中渲染 WSV

python cosmos-transfer2.5/scripts/generate_control_videos.py \
  -i <input_parquet_dir> \
  -o <output_wsv_dir>

6 验证生成的 WSV

虽然此步骤是可选的,但可以验证生成的 WSV,以确认其使用了预期的摄像头视场(FOV),并且投影的线条和立方体与相应的道路特征和物体对齐。

generateSceneRGB.m 使用 Unreal Engine 创建一个 RGB 参考视频,而 validate_wsv_overlay.py 将 WSV 叠加到该参考视频上。

通过将 WSV 叠加到 Unreal Engine 视频上,您可以验证配置的视场是否正确,以及投影的线条和立方体是否与相应的道路特征和物体对齐。 在实际工作流中,在将控制输入传递给生成式 AI 模型之前检查其质量至关重要。


7 使用 NVIDIA Cosmos 生成照片级真实感视频

世界场景视频生成后,每个摄像头的 WSV 被分配到 Cosmos-Transfer2.5 Auto Multiview 配置中对应的摄像头输入。

Cosmos-Transfer2.5 Auto Multiview 的配置 JSON 示例:

{
  "name": "cutin_daytime",
  "prompt_path": "prompt_daytime.txt",
  "num_conditional_frames": 0,
  "enable_autoregressive": true,
  "num_chunks": 3,
  "chunk_overlap": 1,
  "save_combined_views": false,
  "front_wide": {"control_path": "world_scenario_videos/camera_front_wide_120fov.mp4"},
  "cross_left": {"control_path": "world_scenario_videos/camera_cross_left_120fov.mp4"},
  "cross_right": {"control_path": "world_scenario_videos/camera_cross_right_120fov.mp4"},
  "rear_left": {"control_path": "world_scenario_videos/camera_rear_left_70fov.mp4"},
  "rear_right": {"control_path": "world_scenario_videos/camera_rear_right_70fov.mp4"},
  "rear": {"control_path": "world_scenario_videos/camera_rear_tele_30fov.mp4"},
  "front_tele": {"control_path": "world_scenario_videos/camera_front_tele_30fov.mp4"}
}

主要生成参数如下表所示。

参数描述
num_conditional_frames用于条件约束的初始 RGB 帧数。当仅使用控制视频时,设置为 0
enable_autoregressive启用通过使用多个片段进行较长视频的自回归生成
num_chunks要生成的视频片段数。对于较长序列,使用 2 或更多
chunk_overlap相邻片段之间的重叠帧数
save_combined_views将所有摄像头视图保存为单个组合视频

较长视频的示例计算:每个片段包含 29 帧(10 fps,即 2.9 秒)。当 num_chunks=3chunk_overlap=1 时,总长度为 29 * num_chunkschunk_overlap * (num_chunks – 1) = 29 * 3 – 1 * (3 – 1) = 85 帧,约 8.5 秒。

文本提示描述场景的期望外观。例如,提示可以指定:

  • 时间段
  • 天气
  • 路面外观
  • 光照
  • 能见度
  • 周边城市环境

研讨会上用于白天变道场景的示例提示: “*一个由自车前向车载摄像头拍摄的真实白天城市驾驶场景。自车在晴朗的日光下平稳地通过一个多车道城市交叉路口。环境包括干燥的沥青路面、清晰可见的车道标线、车道边界、交通信号灯、路标、人行道、路缘石、电线杆以及道路两侧的中高层城市建筑。**场景开始时,一辆前车在自车右前方车道同向行驶。该前车随后切入自车前方,造成潜在的碰撞风险。自车刹车以避免与变道车辆相撞,然后继续驶向交叉路口。**另一辆车从左侧接近交叉路口,并在自车减速后穿越自车的路径。在自车左前方区域,从视频开始就有三辆车停在车道上。这些停车部分遮挡了从左侧进入交叉路口的车辆。*该视频应类似自然的车载摄像头影像,具有真实的白天曝光、平衡的光照、清晰的能见度、稳定的摄像头运动、一致的道路几何形状、连贯的车辆位置、真实的车辆比例和流畅的时间一致性。自车在遵循道路布局和周边交通的同时继续通过交叉路口。请保留输入控制视频中的车道结构、交叉口几何形状、车辆位置和运动”。 该提示定义了场景外观、变道和减速等事件、周边车辆位置以及“保留”的指令。

(翻译完成)

相似文章

NVIDIA/cosmos

GitHub Trending (daily)

NVIDIA Cosmos 是一个开放平台,提供世界模型、数据集和工具,旨在帮助开发者为机器人、自动驾驶车辆和智能基础设施构建物理AI应用。

nvidia/Cosmos3-Edge

Hugging Face Models Trending

NVIDIA 发布了 Cosmos3-Edge,这是一个全模态世界基础模型,能够从文本、图像、视频和动作轨迹输入生成视频、图像、音频和动作命令,面向机器人、自动驾驶和智能空间等物理 AI 应用。

nvidia/Cosmos3-Nano

Hugging Face Models Trending

NVIDIA 发布 Cosmos3-Nano,一个用于物理 AI 的全能世界模型,能够从文本、图像、视频和动作输入生成视频、图像、音频和动作指令,面向机器人、自动驾驶和智能空间应用。

NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入手术机器人

Hugging Face Blog

NVIDIA推出Cosmos-H-Dreams,这是一个实时动作条件生成式模拟器,专为手术机器人设计,是从更大的Cosmos-H-Surgical-Simulator中提炼而来。它使用FlashDreams推理库,在单张RTX PRO 6000 GPU上运行,支持用于训练和评估的交互式闭环控制。