TouchThinker:利用大规模数据和动作感知表示将触觉常识推理扩展到开放世界

arXiv cs.AI 论文

摘要

TouchThinker 引入了百万量级的触觉推理数据集和基准,利用动作感知表示实现高效推理,将触觉常识推理扩展到开放世界场景。

arXiv:2606.11637v1 公告类型:新 摘要:触觉是具身智能体理解物理世界的关键模态。尽管最近的工作已将触觉信号整合到语言系统中以进行触觉常识推理,但将此类系统扩展到现实开放世界场景仍面临两个关键瓶颈:(1)当前的触觉推理数据集在格式和规模上仍然有限,为从触觉观察到物理常识的推理提供的监督不足,阻碍了可迁移触觉常识的学习;(2)触觉信号本质上是冗余且动作特定的,然而现有方法常常忽略这些特性,导致表示效率低下且语义表达能力有限。为了解决这些局限性,我们提出 TouchThinker,一个从数据和表示两个角度将触觉常识推理扩展到开放世界的触觉-语言框架。首先,我们构建了 TouchThinker-1M,一个百万量级、多源的触觉推理数据集,涵盖 **415** 个物体、**8** 个场景和 **7** 种传感器类型,为开放世界泛化提供了坚实的数据基础。我们进一步引入了 TouchThinker-Bench,一个具有更真实和多样化任务的开放世界基准。然后,我们提出动作感知建模机制,以提高触觉表示效率并实现高效推理。实验结果表明,TouchThinker 在多个数据集上达到了与最先进模型相当的性能。我们的代码和数据集将在 https://github.com/lvkailin0118/TouchThinker 上提供。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:48

#  TouchThinker:通过大规模数据与行为感知表征将触觉常识推理扩展至开放世界  
来源:https://arxiv.org/html/2606.11637  

Kailin Lyu¹,³, Di Wu¹, Pengwei Zhang¹, Yuhang Zheng², Yingxin Lai⁴, Long Xiao¹, Kangyi Wu⁵, Pengna Li⁵, Chen Gao², Lianyu Hu⁶, Weihao Yuan⁷, Xiaobin Hu²,🖂, Jie Hao¹,🖂, Ce Hao³,🖂, Shuicheng Yan²,🖂  

¹中国科学院自动化研究所  
²新加坡国立大学  
³中关村学院  
⁴厦门大学  
⁵西安交通大学  
⁶南洋理工大学  
⁷南京大学  

🖂通讯作者  

######  摘要  

触觉是具身智能体理解物理世界的关键模态。尽管近期研究已将触觉信号融入语言系统以进行触觉常识推理,但将此类系统扩展至现实开放世界场景仍面临两大瓶颈:(1) 当前触觉推理数据集在格式和规模上均有限,无法为从触觉观测到物理常识的推理提供充分监督,阻碍了可迁移触觉常识的学习;(2) 触觉信号本质上具有冗余性且与行为强相关,然而现有方法常忽略这些特性,导致表征效率低下、语义表达能力有限。  

为解决这些问题,我们提出TouchThinker,一个从数据和表征两个维度将触觉常识推理扩展至开放世界的触觉-语言框架。首先,我们构建了TouchThinker-1M,一个百万级、多源的触觉推理数据集,覆盖415个物体、8种场景和7类传感器,为开放世界泛化提供了坚实的数据基础。我们还引入了TouchThinker-Bench,一个包含更真实多样任务的开放世界基准。随后,我们提出行为感知建模机制,以提高触觉表征效率并实现高效推理。实验结果表明,TouchThinker在多个数据集上均取得了与最先进模型相媲美的性能。我们的代码和数据集将在https://github.com/lvkailin0118/TouchThinker 公开。  

![[未标注图片]](https://arxiv.org/html/2606.11637v1/Figure/touchthinker_logo.png)  

## 1 引言  

在人类感官中,触觉是感知和交互物理世界的基础。它提供视觉无法可靠捕获的物理线索,包括材料属性、表面纹理和接触状态,从而支持物理推理和动作决策(Li et al., 2024b)。例如,当人触摸到硬米粒时,可以推断其未成熟;同样,触摸柔软的海绵时,可根据上下文推断其适合擦拭。因此,将触觉信息融入常识推理框架,并在开放世界场景中发展触觉推理,对于推进具身智能至关重要。  

近期多项研究开始将触觉感知与大语言模型结合(Yu et al., 2024, 2025; Xie et al., 2026; Cheng et al., 2026),使机器人能够在自然语言指令下执行触觉理解任务。尽管取得进展,现有方法在开放世界环境中仍难以实现可靠鲁棒的触觉推理,主要受限于数据和表征两方面。(1) 在数据方面,现有公开触觉推理数据集在格式和规模上均有限(Yu et al., 2024, 2025; Xie et al., 2026),阻碍了模型在开放世界环境中进行触觉推理。具体而言,多数依赖有限的预定义属性和问答模板,缺乏从触觉观测到物理属性再到物理常识的因果推理监督,易引发幻觉(Ishmam et al., 2024)。此外,这些数据集通常只覆盖一至三种传感器类型,使模型难以区分传感器特有的表征偏差与跨传感器共享的物理属性变化,从而限制了可迁移触觉常识及跨传感器物理推理的学习。(2) 在表征方面,现有方法仍难以有效建模触觉特征。首先,与视觉信号相比,触觉交互流通常包含大量静态帧和过渡帧,而任务相关属性仅集中在少数高信息量片段中(Abad and Ranasinghe, 2020),导致显著冗余。其次,触觉信号本质上具有行为特异性:按压主要揭示硬度,滑动捕获摩擦力,旋转暴露纹理。然而,现有方法通常采用均匀采样或全帧编码,无差别地建模所有帧,难以抑制低信息帧的噪声,也无法显式对齐行为类型与问题语义,导致表征效率低下、语义表达能力有限。  

为解决这些挑战,我们提出TouchThinker,一个在数据和表征两方面均有突破的开放世界触觉-语言框架。在数据方面,我们构建了TouchThinker-1M,整合多源视触觉数据,并通过系统预处理、标注统一和问答扩展,提供语义一致的触觉推理监督。在表征方面,我们设计了行为感知建模机制:首先在问题引导下融合触觉令牌,然后执行行为感知高斯混合专家建模以识别查询相关的行为片段并降低表征冗余。在此基础上,我们进一步开发了两阶段触觉-语言训练范式,在大语言模型中将触觉证据与基于语言的推理对齐。在多个基准(包括VTV-150K(Xie et al., 2026)和我们新构建的TouchThinker-Bench)上的实验表明,TouchThinker比最先进方法实现了更高的推理准确率,并支持可靠开放世界触觉推理。  

总之,我们的贡献如下:  

- **框架**:提出TouchThinker,一个触觉-语言推理框架,通过行为感知建模机制对齐触觉线索与任务语义,实现高效触觉表征。  
- **数据集**:构建TouchThinker-1M,一个百万级、多源数据集,从多个维度扩展触觉数据以支持开放世界触觉推理。我们还引入TouchThinker-Bench,一个系统化基准,覆盖多种触觉传感器和任务类型,用于对开放世界触觉常识推理进行严格的多维度评估。  
- **实践**:TouchThinker在多个主流数据集和子任务上优于现有触觉-语言模型,并展示出更可靠的物理推理。这些结果突显了其在开放世界环境中机器人交互的潜力,并为未来触觉智能研究提供了新见解。  

## 2 相关工作  

**触觉传感与感知**。近年来,触觉传感从早期电容阵列、压阻传感器和磁传感器发展到先进的基于视觉的系统,能够捕获高分辨率接触信息(Meribout et al., 2024; Li et al., 2025)。视触觉传感器因能记录接触表面精细时空变形而受到越来越多关注。代表性系统包括DIGIT、GelSight和Tac3D(Abad and Ranasinghe, 2020)。基于这些进展,许多研究使用视触觉传感推断多维触觉属性,从而支持材料分类、抓取、插入等灵巧操作任务(Lyu et al., 2026; Zheng et al., 2026)。近期研究转向触觉数据的表征学习。UniTouch(Yang et al., 2024)和T3(Zhao et al., 2024)采用视觉自监督目标进行细粒度特征提取,而UniT(Xu et al., 2025)引入VQGAN(Esser et al., 2021)进行紧凑触觉潜在空间建模。为解决传感器异质性,多项研究采用联合训练和对齐策略以鼓励跨传感器的一致表征(Xie et al., 2026; Feng et al., 2025)。相比之下,我们识别出触觉信号中的表征冗余,并强调触觉信息的行为特异性。基于这一观察,我们旨在学习更高效的触觉表征,并释放其在复杂触觉推理中的潜力。  

**触觉常识推理**。多模态大语言模型联合建模语言和视觉信息,显著改善了跨模态推理,重塑了研究范式(Yin et al., 2024; Li et al., 2024a; Wu et al., 2025)。虽然早期工作主要关注视觉语言模型(Du et al., 2022; Zhang et al., 2024a; Deng et al., 2025),但近期研究开始利用大语言模型的推理和理解能力对触觉信号进行建模,逐步建立了用于具身交互的触觉语言建模范式。代表性研究如Octopi(Yu et al., 2024)、Octopi 1.5(Yu et al., 2025)和VTV-LLM(Xie et al., 2026)为触觉推理引入了重要方法和基准数据集。然而,总体而言,现有研究仍受限于数据集(如传感器、规模和格式),且直接迁移基于视觉的方法忽视了触觉感知的独特属性。受此差距驱动,我们整理并发布了TouchThinker-1M,据我们所知,这是迄今为止最大的触觉常识推理数据集。它从多个维度扩展数据,大幅超越现有基准,从而提供了更强的数据基础。结合我们的方法改进,TouchThinker增强了触觉常识推理在开放世界场景中的实际适用性和泛化能力。  

参见图注  

图2:TouchThinker-1M和TouchThinker-Bench的数据统计。(a) TouchThinker-1M与代表性触觉推理数据集在传感器类型、物体覆盖、样本规模和任务形式方面的规模对比。(b) TouchThinker-1M中触觉传感器类型的分布。(c) TouchThinker-1M中场景类别的分布。(d) TouchThinker-Bench的语义分类和类别分布。  

## 3 构建TouchThinker-1M数据集  

**多源触觉数据收集**。为解决现有触觉推理数据集在格式和规模上的局限,这些局限限制了模型的推理能力,我们构建了**TouchThinker-1M**,一个用于开放世界触觉常识推理的大规模多源视触觉数据集。它系统整合了来自九个数据集的主流视触觉数据源,包括代表性来源如TacQuad(Feng et al., 2025)、PHYSICLEAR(Yu et al., 2024)和VTV-150K(Xie et al., 2026),总计约100万帧。异构源的纳入显著拓宽了触觉信号的分布,为学习可泛化的触觉语义表征提供了基础。如图2所示,TouchThinker-1M在五个互补维度上显著提升了触觉数据的规模和多样性:传感器类型、交互行为、物体覆盖、样本规模和任务形式。数据集详情见附录A.1.1。  

**触觉属性标注与统一**。由于不同触觉数据集的标注模式各不相同,直接合并会导致语义空间不一致,阻碍稳定触觉概念的学习。为此,我们适配了VTV-150K(Xie et al., 2026)的模式,构建了一个统一的四维触觉属性空间,涵盖硬度、凸起度、弹性和摩擦力。对于已有标注的数据,我们将原始标签映射到这一统一模式;对于未标注数据,我们根据物体外观、触觉观测和变形模式手动分配属性。每个样本由多名标注者独立标注,交叉验证,并在出现分歧时仲裁。排除触觉证据不足的样本,从而获得跨数据集和传感器一致的可靠监督。  

**触觉视频标准化处理**。我们将所有样本标准化为统一的视频格式,以捕获接触期间的触觉交互动态。对于现有触觉视频,我们保留有效接触区间,去除无接触、噪声或冗余片段。对于静态触觉图像,我们根据物体类别和接触状态组织帧序列以构建短视频,捕获变形演变过程。所有视频进一步经过接触区域裁剪、帧率重采样、插值、时间截断和长度归一化处理,生成约6至8秒的剪辑,使TouchThinker-1M能够以一致格式编码多样的触觉动态。  

**问答格式扩展**。为减少模板化触觉问答(Yu et al., 2024; Xie et al., 2026)导致的浅层语义学习,TouchThinker-1M额外引入了两种互补格式:思维链

相似文章

GRASP:在多人物非语言交互中建立社交推理的根基

Hugging Face Daily Papers

GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。