Tactus:基于低成本压力阵列的开放词汇物体识别
摘要
本文介绍了Tactus,一种开放词汇触觉识别模型,将低成本压力阵列数据映射到文本嵌入,在STAG基准上仅使用187条训练记录且无分类器头的情况下,匹配甚至超过了监督式闭集CNN基线。
arXiv:2608.04043v1 公告类型:新
摘要:电阻式压力阵列是最便宜且出货量最大的触觉传感器,但触觉表示学习一直集中于对变形凝胶成像的光学传感器。我们提出了Tactus,一个仅凭压力数据就能回答文本查询的开放模型:在STAG基准(27个物体,留出记录)上,它在四次运行中达到0.771 ± 0.062的top-1准确率(top-3为0.935),匹配甚至在最佳情况下超过了该数据集监督式闭集CNN的0.76,且无需训练分类器头。其秘诀在于小数据:187条训练记录,在144k个无标签同传感器帧上进行掩码自编码器预训练,以及传感器自身的校准仿射变换,后者恢复的准确率超过所有架构更改的总和。已发布模型的错误集中在少数接触模糊的类别中,与文本目标的几何形状不相关(702个类别对上的Spearman rho <= 0.05),并且在改写甚至仅使用名称的查询下,性能差异在一个点以内;两个不同的帧可恢复八帧准确率的89%。失败也被同样精确地报告:跨传感器预训练池化没有带来增益,视觉协同训练损害了触觉性能,而一个错误归一化的输入流水线在产生看似合理的中间结果的同时,静默丢弃了传感器97%的动态范围。权重、代码以及模型所接入的记忆层均已开放发布。
查看缓存全文
缓存时间: 2026/08/06 07:44
# 从低成本压力阵列进行开放词汇物体识别
来源:https://arxiv.org/html/2608.04043
###### 摘要
电阻式压力阵列是成本最低且发货量最大的触觉传感器,然而触觉表示学习一直集中在用于对变形凝胶成像的光学传感器上。我们提出了 Tactus,一个仅从压力数据回答文本查询的开放模型:在 STAG 基准(27 个物体,留出录音)上,四次运行的平均 top-1 达到 0.771±\pm0.062(top-3 0.935),与数据集上 0.76 的有监督闭集 CNN 相当,且某些情况下更优,而无需训练分类头。该方案属于小数据范畴:187 条训练录音、在 144k 未标注同类传感器帧上的掩码自编码器预训练,以及传感器自身的校准仿射变换——后者恢复的精度比所有架构更改加起来还要多。发布模型的错误集中在少数接触模糊类别上,与文本-目标几何不相关(702 个类别对的 Spearmanρ≤0.05\rho\leq 0.05),并且对释义甚至裸名称查询的响应在约一个百分点以内;两个不同帧可恢复八帧精度的 89%。失败也以同样精度报告:跨传感器预训练池化无增益、视觉协同训练损害触觉、以及一个错误归一化的输入流水线在产生看似合理中间结果的同时静默丢弃了传感器 97% 的动态范围。权重、代码以及模型接入的记忆层均已开源。
## I 引言
触觉能告诉机器人视觉无法知道的信息:抓取是否稳定、当相机被遮挡时手中是什么、何时发生接触滑动。最有可能大规模出货的触觉传感器是低维电阻式和 taxel 阵列,它们成本仅数美元,且已出现在手套、鞋垫、纺织品和机器人手中。那么,为什么触觉基础模型只读取光学传感器[6 (https://arxiv.org/html/2608.04043#bib.bib6),7 (https://arxiv.org/html/2608.04043#bib.bib7),8 (https://arxiv.org/html/2608.04043#bib.bib8),9 (https://arxiv.org/html/2608.04043#bib.bib9)]——这是一种要求每个指尖都配备相机级硬件的信号类别?压力阵列领域已有强大的闭集分类器[1 (https://arxiv.org/html/2608.04043#bib.bib1),10 (https://arxiv.org/html/2608.04043#bib.bib10)],并且最近出现了野外自我中心基准[13 (https://arxiv.org/html/2608.04043#bib.bib13)],但还没有将信号与语言连接起来的开放模型。
Tactus 填补了这一空白。它将短时间窗口的压力帧映射到多模态模型(通过融合嵌入系列[2 (https://arxiv.org/html/2608.04043#bib.bib2)]的 Qwen3-VL-Embedding-2B)的冻结文本嵌入空间,因此识别是通过余弦排序对文本查询进行的。由于同一空间承载文本、图像、视频、音频和惯性运动,触觉成为跨模态、可语言搜索的机器人记忆中的一种感觉,而不是一个孤立的分类器。
这一设定刻意与规模化对抗:一个传感器、187 条训练录音、27 个类别,以及一个冻结的语言侧,触觉头必须在其所在位置与之匹配。我们将这种对抗性视为实验工具。在数据如此之少的情况下,每个方案决策都可以单独测量,论文在正反两个方向报告了由此得到的阶梯:有效的杠杆(其余保持固定时逐一量化)和失败的杠杆(每个都附有最能解释其失败机制的说明)。
我们的贡献:
- •一个开放的压力阵列到语言模型,在开放词汇的基础上匹配并有时超过 STAG 的有监督闭集基线(top-1 0.771±\pm0.062 对比 0.76)(表 I (https://arxiv.org/html/2608.04043#S5.T1))。
- •一个经过测量的小数据方案:传感器校准归一化、聚类采样抓取窗口、以及同类传感器掩码自编码器预训练,每个都单独量化(表 II (https://arxiv.org/html/2608.04043#S5.T2))。
- •对发布模型的误差分析表明,残余错误由接触而非语言驱动:混淆集中在接触模糊的类别对中,与文本-目标相似性不相关(ρ≤0.05\rho\leq 0.05, n=702n{=}702 个类别对),并且对查询措辞不敏感(第 VI 节 (https://arxiv.org/html/2608.04043#S6))。
- •两个免费的推理时改进:元组投票,对四个独立采样的抓取窗口的嵌入进行平均(发布检查点上的 top-1 +4.1,表 I (https://arxiv.org/html/2608.04043#S5.T1)),以及两个不同帧即可恢复八帧精度的 89%(图 4 (https://arxiv.org/html/2608.04043#S6.F4))。
- •量化的负面结果,包括一个跨传感器池化消融,独立地在新的传感器系列中重现了已发表的跨传感器退化(第 VII 节 (https://arxiv.org/html/2608.04043#S7)),以及对一个输入归一化缺陷的取证式说明,该缺陷静默造成的精度损失超过了任何建模选择所恢复的量(第 VIII 节 (https://arxiv.org/html/2608.04043#S8))。
参见 图 1:Tactus 仅凭 32×\times32 压力图即可识别物体,方法是在共享的多模态嵌入空间中对文本查询进行排序:无需相机,也无需训练分类头。四个帧是真实留出的 STAG 测试抓取及其真实查询短语;显示了每个类别激活度最高的测试帧(总压力最大)。在整个测试划分中,模型在 27 个查询上的平均 top-1 为 0.771,top-3 为 0.935(表 I (https://arxiv.org/html/2608.04043#S5.T1))。
## II 相关工作
光学触觉表示学习。TVL[6 (https://arxiv.org/html/2608.04043#bib.bib6)] 将 DIGIT 图像与视觉和语言对齐;Sparsh[7 (https://arxiv.org/html/2608.04043#bib.bib7)] 在 460k 张光学触觉图像上预训练自监督表示;UniTouch[8 (https://arxiv.org/html/2608.04043#bib.bib8)] 通过传感器特定 token 将基于相机的触觉传感器绑定到预训练图像嵌入空间;T3[9 (https://arxiv.org/html/2608.04043#bib.bib9)] 在传感器特定编码器和任务特定解码器之间用共享主干覆盖十三个传感器。所有这些都通过视觉主干消费变形的弹性体 RGB 图像;它们都不接受本文所针对的低维力阵列。我们的迁移问题也有本质上的不同:不是统一许多丰富传感器,而是探究单个廉价传感器在朝向语言的方向上能推多远。
压力阵列识别。STAG[1 (https://arxiv.org/html/2608.04043#bib.bib1)] 建立了基于 548 taxel 手套的有监督物体识别;已发表的后续工作在同一数据上重复而非超过其精度。STAT[10 (https://arxiv.org/html/2608.04043#bib.bib10)] 为 taxel 手套动作分类增加了时空注意力与时间顺序预训练任务;TouchFormer[11 (https://arxiv.org/html/2608.04043#bib.bib11)] 融合 taxel 力通道进行材质感知;共形触觉纺织品[12 (https://arxiv.org/html/2608.04043#bib.bib12)] 将同一信号类别扩展至服装。OpenTouch[13 (https://arxiv.org/html/2608.04043#bib.bib13)] 贡献了一个带跨模态检索基准的野外自我中心压力手套数据集;它为这一信号类别提供了数据和评测,而非一个发布压力到语言模型。上述分类系统都是闭集:识别需要针对部署词汇训练的分类器。Tactus 保留了传感器类别并移除了该约束。
跨传感器触觉迁移。HTT[4 (https://arxiv.org/html/2608.04043#bib.bib4)] 通过每传感器编码器和平衡目标在异构传感器上预训练,并报告称掩码预训练在传感器内部有帮助,而跨模态对齐可能损害 taxel 分类;TacVerse[5 (https://arxiv.org/html/2608.04043#bib.bib5)] 测量了朴素跨传感器迁移下的严重退化,即使是在同一传感器的变体之间也是如此。我们的池化消融(第 VII 节 (https://arxiv.org/html/2608.04043#S7))独立地在压力阵列上重现了这一发现。
针对文本的零样本识别。Tactus 的评分端是 CLIP 式零样本分类[14 (https://arxiv.org/html/2608.04043#bib.bib14)]:类别名称作为自然短语嵌入,通过余弦排序进行预测。第 VI 节 (https://arxiv.org/html/2608.04043#S6) 表明这一继承在此处异常稳健:释义、模板集成,甚至裸类别名称都会使精度变化约一个百分点,因为误差在触觉信号中,而非文本几何中。
## III 传感器与任务
STAG[1 (https://arxiv.org/html/2608.04043#bib.bib1)] 记录了一个 548 taxel 电阻式手套,以约 30 Hz 光栅化为 32×\times32 帧,同时佩戴者操作 26 个物体外加一个空手类别。本文使用的分类子集包含 135,187 帧:训练划分为 101,615 帧,留出测试录音为 33,572 帧。帧带有三个容易混淆的标注,而这一区别在实际中很重要:hasValidLabel 标记可用的 88,269 帧(65%,覆盖全部 27 个类别),其物体标签可用,并且是正确的抓取过滤器;isGrasp 是一个稀疏的已标注瞬间标记,仅覆盖 448 帧,将两者相交会使数据集坍缩到 77 帧。早期实验将 isGrasp 视为抓取过滤器,从而静默丢弃了语料库。姊妹子集(盲戴、负重)增加了相同 27 个物体在不同操作条件下的 132 条录音;我们仅将它们折入训练,将训练池从 55 条录音增长到 187 条,绝不放进测试划分——测试划分始终是主要子集的留出录音。
任务是 27 路开放词汇识别:给定一个压力帧窗口,在冻结文本空间中以余弦相似度对 27 个自然语言抓取短语(例如“一只人类手牢牢抓住一个杯子”)进行排序,且没有在标签集上训练分类器。该数据上的有监督上限是数据集作者自己的 CNN,top-1 0.76,这是一个对每个类别都有训练过的决策边界的闭集模型。随机猜测概率为 0.037。
## IV 方法
架构。每个 32×\times32 帧通过一个 ResNet-18 宽度主干(3×\times3 stem,四个阶段);一个抓取窗口的 K=8K{=}8 帧通过在其拼接特征图上学习的 1×\times1 卷积融合,池化,并投影(512→\rightarrow1024→\rightarrow2048)到冻结文本空间(图 2 (https://arxiv.org/html/2608.04043#S4.F2))。头部总计 16.2M 个训练参数(13.5M 主干,2.6M 投影器);语言侧从不更新。架构本身毫无奇特之处;每个组件都是通过第 VII 节 (https://arxiv.org/html/2608.04043#S7) 中与其他替代方案的消融选择的,其中几个替代方案更时髦却更差。
数据路径。帧使用传感器自身的校准仿射变换进行归一化:clip((raw−500)/150,0,1)\mathrm{clip}((\mathrm{raw}-500)/150,\,0,\,1),遵循 STAG 参考实现;第 VIII 节 (https://arxiv.org/html/2608.04043#S8) 报告了在此正确完成之前发生了什么。训练窗口使用 STAG 的聚类采样,从他们的 ObjectClusterDataset 移植而来:每条录音的有效帧通过 PCA 降为八维,全局 min-max 缩放,并用 kk-均值聚类为 K=8K{=}8 个簇;每个有效帧成为包含来自其他每个簇的一个随机帧的训练元组的锚点。30 Hz 下的连续帧几乎是重复的,因此 8 帧连续窗口携带的信息比一帧多不了多少;簇元组是将相同预算花在八个真正不同的手-物配置上。这一变化将有效训练集从 7.7k 个近重复窗口提高到 74,226 个多样元组,并且每 500 步按原始方法重新采样。
文本目标。每个类别通过该家族的规范文本读出作为自然抓取短语嵌入,并进行 L2 归一化。27 个短语共享大部分措辞,因此其嵌入带有很大的公共成分:平均非对角线余弦为 0.504,最近干扰项间隔为 0.354。移除类别质心并重新归一化可将目标散布到非对角线均值 -0.038-0.038(27 个单位向量的最大值)和间隔 0.777。训练是在温度 0.07 下针对这些目标的标签交叉熵(16k 步,AdamW,带 warmup 的余弦调度,空间和时间增强)。
预训练。主干通过掩码自编码器预训练[3 (https://arxiv.org/html/2608.04043#bib.bib3)]在 144k 同类传感器帧上初始化,包括 47k 个标签无法用于监督的帧,掩码比 0.6(HTT[4 (https://arxiv.org/html/2608.04043#bib.bib4)] 的 taxel 设置)和逐补丁归一化目标;监督测试帧排除在池外。逐补丁归一化还带来了一个免费诊断:均值预测编码器被固定在 loss 1.0,因此重建目标的坍缩在损失曲线上可见,而不是在下游发现。预训练在一个 A10G 上大约耗时 65 分钟。
评估。测试录音用固定种子分成簇元组;每个元组通过与 27 个类别短语的余弦排序来打分。我们报告元组级 top-1/top-3 以及合并每个测试录音最多 64 帧的录音级分数。均值聚合了超参数相同的独立运行。每个数字都伴随一个注意事项:聚类采样改变测试总体以及训练集,因此元组级精度只能在同一协议内比较。录音级分数不使用任何采样地合并录音的有效帧,是与协议无关的锚点;当我们在全新环境中重放发布检查点时,它也是重现到小数点后四位的数字(第 VI 节 (https://arxiv.org/html/2608.04043#S6))。
参见 图 2:校准后的压力窗口经过训练的主干、帧融合和投影器进入共享多模态嵌入空间;识别是针对同一空间的自然语言查询,该空间承载文本、图像、视频、音频和运动。只有 16.2M 参数的头部被训练;语言侧冻结,因此空间中的每个现有嵌入都保持不变。
## V 主要结果
表 I (https://arxiv.org/html/2608.04043#S5.T1) 报告了 STAG 留出测试录音上的 27 路识别,以开放词汇方式评分。方案均值超过了原始有监督闭集 CNN,尽管差距小于一个标准误差;因此我们将结果定性为匹配并在最优情况下超过原始基线,同时执行更难的任务。Top-3 在均值上为 0.935,在发布检查点上为 0.951。我们的评估镜像了 STAG 的聚类采样测试协议,但并非作者的逐字节相同测试装置。
表 I:STAG 分类,27 个物体,留出测试录音。Top-1 均值带有 ±\pm 一次样本标准差,来自独立运行;其他列是同一批运行的均值。粗体标记主要结果;缩进行是四个方案运行之一(发布检查点),使用单次抓取窗口抽取和四次抽取的元组投票评估。表 II (https://arxiv.org/html/2608.04043#S5.T2) 追溯精确方案:每一行是一个测量到的变化,其余保持固定。数据路径修正贡献超过所有架构更改之和;最大的单步是修复输入归一化,第二是同类传感器预训练。表 II (https://arxiv.org/html/2608.04043#S5.T2) 中规则以上的所有内容都是在传感器动态范围的 3% 上测量的;相似文章
无需训练的多模态大语言模型密集手部接触估计
本文提出ContactPrompt,一种利用多模态大语言模型进行密集手部接触估计的免训练零样本方法,无需训练即优于监督方法。
N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。
N_0-TWAM:面向接触丰富操作的触觉原生世界-动作模型规模化
N₀-TWAM 是一个面向接触丰富操作的触觉原生世界-动作模型,基于来自 6 个具身和 450 个任务的视触觉数据进行了规模化训练。作者公开了代码和预训练检查点,将其定位为首个规模化训练的触觉世界-动作模型。
LV-ROVER: 多流Tesseract投票用于马耳他语段落OCR
本文介绍了LV-ROVER,一个用于马耳他语OCR的多流Tesseract集成系统,通过合成数据训练和后处理,字符错误率降低了70%,解决了马耳他语低资源OCR的挑战。
封闭-开放工业检测场景的统一:新的大规模基准、挑战与基线
介绍了MMIOC-1M,一个用于工业缺陷检测的大规模多模态基准,并提出了RTVPNet,一种精细的文本-视觉提示网络,实现了最先进的性能。