embodied-ai

标签

Cards List
#embodied-ai

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers · 3天前 缓存

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

0 人收藏 0 人点赞
#embodied-ai

小米开源具身智能基础模型Xiaomi-Robotics-1(4分钟阅读)

TLDR AI · 3天前 缓存

小米开源了Xiaomi-Robotics-1,这是一个在超过10万小时的UMI数据上预训练,并在1万小时以上的跨具身数据上后训练的具身AI基础模型。此次发布包含完整的真实机器人后训练与部署流程,旨在挑战Figure AI和Tesla的专有机器人模型。

0 人收藏 0 人点赞
#embodied-ai

UniNav:用于视觉导航的统一世界-动作扩散模型

arXiv cs.AI · 4天前 缓存

UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。

0 人收藏 0 人点赞
#embodied-ai

从被动视频到可编辑体验:面向具身智能的物理接地体验合成

arXiv cs.AI · 2026-07-31 缓存

介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。

0 人收藏 0 人点赞
#embodied-ai

Google 发布 Gemini Robotics 2.0,承诺提升灵巧性与安全性

Ars Technica · 2026-07-30 缓存

Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。

0 人收藏 0 人点赞
#embodied-ai

@_philschmid: 哔噗哔噗…… 向 Gemini Robotics ER 2 打个招呼吧!ER 2 不仅在具身推理上胜过竞品前沿模型……

X AI KOLs Following · 2026-07-30 缓存

Gemini Robotics ER 2 基于 Gemini 3.5 Flash 构建,现已发布,具备最先进的具身推理、亚秒级机器人流式传输和多机器人协同调度支持,并在 Boston Dynamics Spot 上进行了演示。

0 人收藏 0 人点赞
#embodied-ai

Gemini Robotics ER 2:利用视频理解、任务编排和多机器人协作,驱动机器人技术

Google DeepMind Blog · 2026-07-30 缓存

Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。

0 人收藏 0 人点赞
#embodied-ai

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。

0 人收藏 0 人点赞
#embodied-ai

@Tsinghua_Uni: 革新可穿戴手部传感技术!清华大学创新团队推出WRISTPP:一种腕带传感器,可重建手部姿态…

X AI KOLs Timeline · 2026-07-29 缓存

清华大学推出WRISTPP腕带传感器,可实时重建精确的手部姿态和接触压力,性能优于头戴式摄像头,减少手臂疲劳,应用于具身AI和机器人遥操作。

0 人收藏 0 人点赞
#embodied-ai

HumanCLAW:视觉-语言模型能否通过身体行动?

Hugging Face Daily Papers · 2026-07-29 缓存

本文介绍HumanCLAW评估框架,该框架将动作决策与底层执行解耦,用以评估视觉-语言模型能否通过物理身体行动。在41个场景的1218个试验片段中测试了九种最先进的VLM,最佳模型成功率仅为16.8%,表明当前VLM缺乏具身自我意识。

0 人收藏 0 人点赞
#embodied-ai

MEMENTO: 记忆引导的模因代码即策略进化

arXiv cs.LG · 2026-07-28 缓存

MEMENTO引入了一种记忆引导的模因框架,用于进化机器人控制程序(代码即策略),在长时域具身任务中优于现有方法如Eureka和REvolve,并展示了从仿真到真实的迁移。

0 人收藏 0 人点赞
#embodied-ai

空中MLLM智能体的零样本任务级评估

arXiv cs.CL · 2026-07-27 缓存

MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。

0 人收藏 0 人点赞
#embodied-ai

@Alacritic_Super: MIT 刚刚免费提供了最好的计算机视觉书籍之一。如果你对机器人、具身AI感兴趣,…

X AI KOLs Timeline · 2026-07-22 缓存

MIT 已将教科书《计算机视觉基础》免费在线提供。该书涵盖从图像形成到视觉语言模型的广泛主题,面向机器人、具身AI、自动驾驶和视觉AI领域的学生和实践者。

0 人收藏 0 人点赞
#embodied-ai

@caixin:尽管在世界人工智能大会上涌入大量资本和炫目展示,人形机器人仍……

X AI KOLs Timeline · 2026-07-21 缓存

在世界人工智能大会上展示的人形机器人仍面临重大技术瓶颈和成本上升问题,尽管资本和参与公司增多,但尚未成熟到可大规模商业部署。

0 人收藏 0 人点赞
#embodied-ai

RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型

Hugging Face Daily Papers · 2026-07-20 缓存

RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。

0 人收藏 0 人点赞
#embodied-ai

openbmb/MiniCPM-RobotTrack

Hugging Face Models Trending · 2026-07-18 缓存

OpenBMB发布了MiniCPM-RobotTrack,这是一个基于MiniCPM4-0.5B构建的紧凑型视觉-语言-动作模型,用于自然语言条件的目标跟踪,在unitree Go2上实现5+ FPS,并采用质量驱动的自进化数据和高效的板载推理。

0 人收藏 0 人点赞
#embodied-ai

HRO:基于大型语言模型的零样本物体目标导航层次化房间到物体框架

arXiv cs.AI · 2026-07-16 缓存

提出了HRO,一种由大型语言模型驱动的层次化框架,用于零样本物体目标导航,模拟人类从粗到细的空间推理,在Gibson和HM3D数据集上实现了卓越的成功率和泛化能力。

0 人收藏 0 人点赞
#embodied-ai

UESF-Bench:面向统一具身搜索与跟随的基准测试与探测

arXiv cs.AI · 2026-07-16 缓存

本文介绍了UESF-Bench,一个面向统一具身人类搜索与跟随的大规模基准,并提出了SeekFollow-VLA,一个视觉-语言-动作框架,该框架处理语义引导的探索以及搜索与跟随之间的可靠行为切换。

0 人收藏 0 人点赞
#embodied-ai

SPINE:用智能体AI弥合虚实鸿沟

arXiv cs.AI · 2026-07-16 缓存

SPINE是一个智能体框架,能够系统化地调试和部署双臂机器人,减少对专家标定的依赖,并提升跨平台的操作化成功率。

0 人收藏 0 人点赞
#embodied-ai

BadWAM: 当 World-Action Models 正确想象却错误行动

Hugging Face Daily Papers · 2026-07-16 缓存

BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈