@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…
摘要
LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。
查看缓存全文
缓存时间: 2026/07/07 23:38
LingBot-VLA 2.0 现已开源 —— 我们的下一代具身基础模型。
6 万小时高质量预训练数据 —— 结合精选机器人演示与第一人称人类操作视频
20 种机器人配置,覆盖 17 个品牌 —— Astribot、乐聚、宇树、Franka、傅利叶、睿尔曼等
全身自由度:头部、腰部、灵巧手、移动底盘 —— 实现远超以往的复杂任务场景
RTX 4090 上推理速度低于 130 毫秒 —— 开发者活动即将启动
#EmbodiedAI #Robotics #OpenSource #VLA
相似文章
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
@rohanpaul_ai: 大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。LingBot-VA 2.0 fr…
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
@AdinaYakup: 由新的LingBot Vision驱动 https://huggingface.co/collections/robbyant/lingbot-vision… - Apache 2.0 - 4个版本…
LingBot Vision是一个新的视觉基础模型,在Apache 2.0许可下发布,提供四种尺寸(small, base, large, giant),并使用掩码边界建模进行预训练。它驱动了一个在多个基准测试中名列前茅的深度估计系统。
@_akhaliq: LingBot-Video 已在 Hugging Face 上发布——基于 MoE 的视频基础模型,专为具身智能打造,300亿参数,仅……
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
robbyant/lingbot-world-v2-14b-causal-fast
LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。