TacForcing:流式动作生成与执行时触觉反馈
摘要
TacForcing是一种流式动作生成框架,它在执行过程中为接触丰富的操作任务集成实时触觉反馈,在模拟和真实环境中实现比现有方法更高的成功率。
查看缓存全文
缓存时间: 2026/08/28 15:26
论文页面 - TacForcing:基于执行时触觉反馈的流式动作生成
来源:https://huggingface.co/papers/2608.25798 作者:
,
,
,
,
,
,
,
,
,
摘要
TacForcing 是一个流式动作生成框架,通过流式动作专家和执行感知触觉注意力,在执行过程中集成实时触觉反馈,从而改善接触丰富的操作任务。
接触丰富的操作(https://huggingface.co/papers?q=Contact-rich%20manipulation)需要适应在动作时间范围内可能显著演化的接触状态。然而,基于块的视觉-语言-动作模型(https://huggingface.co/papers?q=vision-language-action%20models)根据执行前收集的观测信息预测完整的动作块,导致在执行过程中触觉条件信息(https://huggingface.co/papers?q=tactile%20conditioning)变得过时。现有的触觉反应方法通常依赖于单独的高频控制器,这增加了架构和训练的复杂性。在本文中,我们引入了 TacForcing,这是一个能有效融合执行时触觉反馈的流式动作生成框架。TacForcing 没有采用独立的反应控制器,而是用流式动作专家(https://huggingface.co/papers?q=streaming%20action%20expert)替代了标准动作专家,以根据执行过程中获取的、不断演化的触觉观测信息来生成动作。TacForcing 还引入了执行感知触觉注意力(Execution-Aware Tactile Attention, EATA)(https://huggingface.co/papers?q=Execution-Aware%20Tactile%20Attention%20(EATA)),将触觉条件信息(https://huggingface.co/papers?q=tactile%20conditioning)限制在即将执行的动作上,从而减少了触觉信息获取与动作执行之间的时间不匹配。在六个模拟的 UniVTAC 任务和三个真实世界的接触丰富的操作(https://huggingface.co/papers?q=contact-rich%20manipulation)任务中,TacForcing 分别取得了 65% 和 69% 的平均成功率,在这两种设置下均优于强基线方法。
查看 arXiv 页面 (https://arxiv.org/abs/2608.25798) 查看 PDF (https://arxiv.org/pdf/2608.25798) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.25798)
在您的代理中获取此论文:
hf papers read 2608\.25798
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.25798,以从此页面关联它。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.25798,以从此页面关联它。
引用此论文的空间1
包含此论文的收藏1
相似文章
流式力控视频生成
StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。
OmniTacTune:策略无关的真实世界强化学习用于视觉策略的触觉残差适配
OmniTacTune引入了一种两阶段强化学习管道,用于将触觉反馈适配到预训练的视觉机器人策略,在接触丰富的操作任务中,在40-80分钟内实现85-100%的成功率。
TACO:面向智能体工具使用的工具增强信用优化
TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。
N_0-TWAM:面向接触丰富操作的触觉原生世界-动作模型规模化
N₀-TWAM 是一个面向接触丰富操作的触觉原生世界-动作模型,基于来自 6 个具身和 450 个任务的视触觉数据进行了规模化训练。作者公开了代码和预训练检查点,将其定位为首个规模化训练的触觉世界-动作模型。
一种基于观测上下文压缩的高效终端智能体自我演化框架
TACO 提出了一种自我演化压缩框架,可自动学习压缩冗余的终端交互历史,在 TerminalBench 及其他代码智能体基准上将 token 开销降低约 10%,准确率提升 1–4%。