robotic-manipulation

标签

Cards List
#robotic-manipulation

TurboVLA:在RTX 4090上以32 Hz运行且显存占用小于1 GB的实时视觉-语言-动作模型

Hugging Face Daily Papers · 2026-07-29 缓存

TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。

0 人收藏 0 人点赞
#robotic-manipulation

TableVerse:一个具有真实世界基础布局的大规模桌面数据集,用于可泛化操作

Hugging Face Daily Papers · 2026-07-23 缓存

TableVerse 引入了一个完全自动化的 Real2Sim 流水线,将非结构化、野外图像转换为高保真、可模拟的桌面环境,具有精确的度量标准和物理稳定性,同时提供了一个大规模数据集(TableVerse-100K),用于可泛化的机器人操作。

0 人收藏 0 人点赞
#robotic-manipulation

面向机器人操作的视觉-语言-动作模型中的双潜在记忆

Hugging Face Daily Papers · 2026-07-08 缓存

LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。

0 人收藏 0 人点赞
#robotic-manipulation

RynnWorld-4D: 面向机器人操作的4D具身世界模型

Hugging Face Daily Papers · 2026-07-07 缓存

RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。

0 人收藏 0 人点赞
#robotic-manipulation

PhysisForcing:面向机器人操作的物理增强世界模拟器

Hugging Face Daily Papers · 2026-06-26 缓存

PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。

0 人收藏 0 人点赞
#robotic-manipulation

Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测

Hugging Face Daily Papers · 2026-06-22 缓存

Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。

0 人收藏 0 人点赞
#robotic-manipulation

EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略

Hugging Face Daily Papers · 2026-06-18 缓存

EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。

0 人收藏 0 人点赞
#robotic-manipulation

Qwen-RobotManip技术报告:对齐实现机器人操控基础模型规模化

Hugging Face Daily Papers · 2026-06-17 缓存

介绍Qwen-RobotManip,一个用于机器人操控的视觉-语言-动作基础模型,通过在表征、运动和行为维度上的统一对齐实现泛化,从而能够在多样化的数据源上进行大规模训练。它在多个分布外基准测试中优于先前的最先进模型,并展现出涌现能力,如零样本指令跟随和跨本体迁移。

0 人收藏 0 人点赞
#robotic-manipulation

PAIWorld: 面向机器人操作的三维一致世界基础模型

Hugging Face Daily Papers · 2026-06-16 缓存

PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。

0 人收藏 0 人点赞
#robotic-manipulation

WEAVER:更好、更快、更长 —— 一种有效的机器人操作世界模型

Hugging Face Daily Papers · 2026-06-11 缓存

WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。

0 人收藏 0 人点赞
#robotic-manipulation

AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Hugging Face Daily Papers · 2026-06-04 缓存

AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。

0 人收藏 0 人点赞
#robotic-manipulation

@RuohanZhang76:很高兴介绍由 @EvansXuHan 主导的 StereoPolicy。StereoPolicy 是一种为现代机器人策略模型添加几何线索的有效方法……

X AI KOLs Following · 2026-06-03 缓存

介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。

0 人收藏 0 人点赞
#robotic-manipulation

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers · 2026-05-31 缓存

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

0 人收藏 0 人点赞
#robotic-manipulation

Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模

Hugging Face Daily Papers · 2026-05-28 缓存

Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。

0 人收藏 0 人点赞
#robotic-manipulation

频率引导的子频率流形遍历动作扩散

Hugging Face Daily Papers · 2026-05-27 缓存

本文介绍了频率引导算子(Frequency Guidance Operator, FGO),一种用于扩散策略的方法,通过引导噪声样本通过中间子频率流形来平滑动作生成,从而提升机器人操作任务的性能。

0 人收藏 0 人点赞
#robotic-manipulation

AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆

Hugging Face Daily Papers · 2026-05-18 缓存

AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。

0 人收藏 0 人点赞
#robotic-manipulation

何时信任想象:世界行动模型的自适应动作执行

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了 FFDC,一种用于世界行动模型的轻量级验证器,它通过检查预测观察与实际观察之间的一致性,实现了自适应动作块大小,从而提高了机器人操作的效率和鲁棒性。

0 人收藏 0 人点赞
#robotic-manipulation

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers · 2026-04-15 缓存

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈