Qwen-Drive (GitHub 仓库)

TLDR AI 模型

摘要

Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在一个统一框架中整合了3D感知、视觉问答和运动规划,在基准测试中表现出色。

Qwen-Drive 是一个旨在创建用于自动驾驶的视觉语言基础模型的项目。该项目采用分阶段训练策略,整合了感知、语言和规划目标。该模型在实现专门的驾驶能力的同时,保持了广泛的视觉理解和指令遵循能力。建议使用具有24 GB以上内存的GPU。
查看原文
查看缓存全文

缓存时间: 2026/09/08 23:54

自动驾驶领域迈向视觉语言基础模型的初始步骤

通义千问团队 · 华中科技大学

📑 技术报告 | 📖 博客 | 🤗 Hugging Face | 🤖 ModelScope

相似文章

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。

Qwen的具身世界建模 (28分钟阅读)

TLDR AI

Qwen-RobotWorld技术报告提出了一种统一的、语言条件化的视频世界模型,用于具身智能,能够从当前观测中预测未来视频,涵盖机器人、自动驾驶、导航等多个领域,并应用于合成数据生成、策略评估和规划。