SoftVTBench: 一个面向可变形物体操作的变形感知视觉触觉数据集与基准测试
摘要
SoftVTBench 呈现了一个同步的视觉触觉数据集和变形感知基准测试,用于评估可变形物体操作中的物理交互质量,包含4,000个演示和一个新的成功指标。
查看缓存全文
缓存时间: 2026/08/20 04:01
论文页面 - SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准测试
来源:https://huggingface.co/papers/2608.18701 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SoftVTBench 推出了一个同步化的视觉-触觉数据集与形变感知基准测试,旨在评估可变形物体操作过程中的物理交互质量。
物理交互质量是可变形物体操作(https://huggingface.co/papers?q=deformable-object%20manipulation)的核心,然而大多数基准测试仅评估任务成功与否。一个策略可能完成任务,但同时允许打滑或造成过度挤压。一个主要瓶颈在于缺乏视觉-触觉数据集(https://huggingface.co/papers?q=visuo-tactile%20dataset),这类数据集应将策略可见的接触观测与完整任务中的独立物理真值配对。我们推出了 SoftVTBench,一个用于物理交互感知可变形物体操作(https://huggingface.co/papers?q=deformable-object%20manipulation)的视觉-触觉数据集(https://huggingface.co/papers?q=visuo-tactile%20dataset)。它包含 4,000 个专家示范和超过 50 个资产,包括体积型可变形物体和视觉匹配的刚性孪生体。在 20 Hz 频率下,每个片段同步了多视角 RGB、双指触觉 RGB 与标记点运动、本体感觉、语言以及二元和连续的夹持器动作,同时还包含仅用于评估的有限元(FEM)状态。基于此数据集,我们建立了一个闭环基准测试,该测试使用固定的物体特定标定来定义形变感知成功率(Deformation-aware Success Rate (DSR)),仅当一次执行完成任务并将峰值归一化形变保持在容差范围内时,才计为成功。在 Diffusion Policy(https://huggingface.co/papers?q=Diffusion%20Policy)、π₀.₅ 和 FastWAM 这三种策略上测试,所有 12 个分布内配置均包含违反形变容差的成功执行,占每个配置成功总数的 0.7%–24%。在分布偏移情况下,视觉-触觉变体在所有六个策略套件比较中均实现了更高的任务成功率,并在五个比较中获得了更高的 DSR,而其分布内优势则表现不一。这些结果表明,仅仅提供触觉信息并不能确保有效的多模态融合(https://huggingface.co/papers?q=multimodal%20fusion)。因此,SoftVTBench 提供了一个通用的视觉-触觉资源,用于研究的不仅是策略是否成功,还包括它如何与可变形物体进行物理交互,以及触觉在何时能改善这种交互。
查看 arXiv 页面 (https://arxiv.org/abs/2608.18701) 查看 PDF (https://arxiv.org/pdf/2608.18701) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18701)
在您的智能体中获取本文:
hf papers read 2608.18701
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2608.18701 以从本页链接它。
引用本文的数据集 0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.18701 以从本页链接它。
引用本文的 Spaces 0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2608.18701 以从本页链接它。
包含本文的收藏 0
没有收藏包含本文
将本文添加到收藏(https://huggingface.co/new-collection)以从本页链接它。
相似文章
Deform360:面向可变形世界模型的大规模多视角视触觉数据集
Deform360是一个大规模视触觉数据集,包含198个物体、超过215小时的观测数据,用于研究可变形物体动力学,支持在机器人操作中比较2D视频与3D粒子世界模型。
H2R-Bench:世界模型中的人到机器人操作视频生成基准
H2R-Bench 是一个新的基准,用于评估视频世界模型将人类操作视频转换为以机器人为中心的演示的能力,跨六类操作行为和两种机器人形态测试具身约束与交互保真度。
RoboStressBench:具身场景中VLM对物理视觉压力鲁棒性的基准测试
RoboStressBench提出了一个基准,用于评估视觉语言模型在具身场景中对物理视觉压力(材质、视点、光照、几何)的鲁棒性,并识别特定于压力的失效模式。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。