robotic-manipulation

标签

Cards List
#robotic-manipulation

@RuohanZhang76:很高兴介绍由 @EvansXuHan 主导的 StereoPolicy。StereoPolicy 是一种为现代机器人策略模型添加几何线索的有效方法……

X AI KOLs Following ↗ · 2026-06-03 缓存

介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。

0 人收藏 0 人点赞
#robotic-manipulation

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers ↗ · 2026-05-31 缓存

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

0 人收藏 0 人点赞
#robotic-manipulation

Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。

0 人收藏 0 人点赞
#robotic-manipulation

频率引导的子频率流形遍历动作扩散

Hugging Face Daily Papers ↗ · 2026-05-27 缓存

本文介绍了频率引导算子(Frequency Guidance Operator, FGO),一种用于扩散策略的方法,通过引导噪声样本通过中间子频率流形来平滑动作生成,从而提升机器人操作任务的性能。

0 人收藏 0 人点赞
#robotic-manipulation

AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。

0 人收藏 0 人点赞
#robotic-manipulation

何时信任想象:世界行动模型的自适应动作执行

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

本文介绍了 FFDC,一种用于世界行动模型的轻量级验证器,它通过检查预测观察与实际观察之间的一致性,实现了自适应动作块大小,从而提高了机器人操作的效率和鲁棒性。

0 人收藏 0 人点赞
#robotic-manipulation

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers ↗ · 2026-04-15 缓存

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈