标签
本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
LingBot-Video提出了一个基于DiT的视频预训练框架,采用Mixture-of-Experts架构、专用数据增强和多维奖励系统,用于具身智能应用。
一项发表在Cell Reports上的北京大学研究发现,人脑可以通过VR训练适应虚拟非人类肢体(翅膀),显示出枕颞皮层的动态可塑性。
前阿里巴巴千问团队负责人林俊阳的AI实验室完成首轮融资,投后估值达20亿美元。高榕资本和红杉中国各投资1亿美元,腾讯追加2000万美元。该实验室将专注于世界模型和具身智能,而非通用大语言模型。
本文深入探讨了具身智能的概念、思想源头(哲学、认知科学、AI机器人)和历史发展(符号主义的失败与Brooks的包容架构),分析了它与纯粹软件AI的区别及面临的挑战。
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
分享了一份开发者生态信息差报告,内容包括将openclaw类项目迁移到AI眼镜和指环等可穿戴设备、机器人与具身智能的开源数据与模型,以及AI API中转站与路由的开源应用。
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
Fei-Fei Li警告,AI过度关注语言模型,强调世界是物理的、视觉的、空间的,并且大部分经济依赖于具身智能。