Qwen-Drive (GitHub 仓库)
摘要
Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在一个统一框架中整合了3D感知、视觉问答和运动规划,在基准测试中表现出色。
Qwen-Drive 是一个旨在创建用于自动驾驶的视觉语言基础模型的项目。该项目采用分阶段训练策略,整合了感知、语言和规划目标。该模型在实现专门的驾驶能力的同时,保持了广泛的视觉理解和指令遵循能力。建议使用具有24 GB以上内存的GPU。
查看缓存全文
缓存时间: 2026/09/08 23:54
自动驾驶领域迈向视觉语言基础模型的初始步骤
通义千问团队 · 华中科技大学
📑 技术报告 | 📖 博客 | 🤗 Hugging Face | 🤖 ModelScope
相似文章
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索
Qwen-Drive-1.0是一款面向自动驾驶的视觉语言基础模型,通过共享表征与分阶段训练,统一了三维感知、视觉问答和运动规划能力。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
Qwen的具身世界建模 (28分钟阅读)
Qwen-RobotWorld技术报告提出了一种统一的、语言条件化的视频世界模型,用于具身智能,能够从当前观测中预测未来视频,涵盖机器人、自动驾驶、导航等多个领域,并应用于合成数据生成、策略评估和规划。
Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
@AdinaYakup: 这是新动态 👀 @Alibaba_Qwen 刚刚在 @huggingface 上发布了一个用于自动驾驶的开放 VLM 基础模型 - 4B / A…
阿里巴巴Qwen在Hugging Face上发布了一款开源的4B参数视觉语言模型,专为自动驾驶设计,集成了3D检测、占用预测和BEV功能,同时保留了强大的视觉语言能力。