标签
本文综述了智能眼镜作为统一的第一人称智能平台,提出了针对受限硬件和多样化应用的感知-状态-交互-行动循环系统框架及评估协议。
本综述论文回顾了大语言模型(LLMs)、知识库(KBs)和推理能力(RA)在通用具身智能(GEI)中的整合,提出一个统一框架,并指出未来发展的关键挑战。
中国29家具身智能机器人公司在早期融资阶段就已进行125笔对外投资,其中AgiBot一家投资37个项目,通过资本提前锁定技术、团队和市场位置。
SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
阿里云呈现了Qwen模型家族从大语言模型到具身智能演化的视觉导览,突出展示了Model Studio的功能与集成。
本文认为,Edmund C. Berkeley与David L. Heiserman提出的机器智能架构对具身机器人认知仍具有现实意义,强调逻辑状态、近硬件控制及模块化感知运动结构。
本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
LingBot-Video提出了一个基于DiT的视频预训练框架,采用Mixture-of-Experts架构、专用数据增强和多维奖励系统,用于具身智能应用。
一项发表在Cell Reports上的北京大学研究发现,人脑可以通过VR训练适应虚拟非人类肢体(翅膀),显示出枕颞皮层的动态可塑性。
前阿里巴巴千问团队负责人林俊阳的AI实验室完成首轮融资,投后估值达20亿美元。高榕资本和红杉中国各投资1亿美元,腾讯追加2000万美元。该实验室将专注于世界模型和具身智能,而非通用大语言模型。
本文深入探讨了具身智能的概念、思想源头(哲学、认知科学、AI机器人)和历史发展(符号主义的失败与Brooks的包容架构),分析了它与纯粹软件AI的区别及面临的挑战。
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
分享了一份开发者生态信息差报告,内容包括将openclaw类项目迁移到AI眼镜和指环等可穿戴设备、机器人与具身智能的开源数据与模型,以及AI API中转站与路由的开源应用。
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
Fei-Fei Li警告,AI过度关注语言模型,强调世界是物理的、视觉的、空间的,并且大部分经济依赖于具身智能。