Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测
摘要
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。
查看缓存全文
缓存时间: 2026/06/23 09:41
论文页面 - Foresight:基于动作条件世界模型隐变量的长时程机器人操作故障检测
来源:https://huggingface.co/papers/2606.23085
摘要
一种针对长时程机器人任务的故障检测框架,利用动作条件世界模型和函数保形预测,仅通过最终任务标签即可监控操作轨迹。
长时程任务(https://huggingface.co/papers?q=Long-horizon%20tasks)在实际机器人部署中很常见,然而针对这类任务的故障检测(https://huggingface.co/papers?q=failure%20detection)尚未得到充分探索。检测长时程机器人任务中的故障尤其具有挑战性,因为故障发生往往模糊不清,且通常缺乏密集的时间注释。我们提出Foresight,一种故障检测(https://huggingface.co/papers?q=failure%20detection)框架,利用来自动作条件世界模型(https://huggingface.co/papers?q=action-conditioned%20world%20model)的隐表示(https://huggingface.co/papers?q=latent%20representations)来监控操作轨迹(https://huggingface.co/papers?q=manipulation%20trajectories)。Foresight仅使用最终任务级别的成功或失败标签进行训练。通过利用预测性世界模型嵌入(https://huggingface.co/papers?q=predictive%20world-model%20embeddings),我们的方法为不同策略下的故障检测(https://huggingface.co/papers?q=failure%20detection)提供了一个统一框架。我们进一步使用函数保形预测(https://huggingface.co/papers?q=functional%20conformal%20prediction)(FCP)来自适应校准检测阈值。我们在模拟环境中使用最先进的视觉-语言-动作策略(https://huggingface.co/papers?q=vision-language-action%20policies)在LIBERO-Long、ManiSkill-Long和BEHAVIOR-1K上评估Foresight,与最先进的故障检测(https://huggingface.co/papers?q=failure%20detection)方法进行比较,并在真实机器人上使用ReactorX-200臂进行三个长时程任务(https://huggingface.co/papers?q=long-horizon%20tasks)以及Franka臂进行一个任务验证。我们的结果表明,动作条件世界模型嵌入为长时程操作中的可靠故障监控提供了一种可扩展的表示。
查看arXiv页面(https://arxiv.org/abs/2606.23085)查看PDF(https://arxiv.org/pdf/2606.23085)项目页面(https://haoranzhangumich.github.io/Forsight_web/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.23085)
在你的智能代理中获取本文:
hf papers read 2606.23085
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.23085以从此页面链接。
引用本文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.23085以从此页面链接。
引用本文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.23085以从此页面链接。
包含本文的收藏集0
没有收藏集包含此论文
将本文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
何时信任想象:世界行动模型的自适应动作执行
本文介绍了 FFDC,一种用于世界行动模型的轻量级验证器,它通过检查预测观察与实际观察之间的一致性,实现了自适应动作块大小,从而提高了机器人操作的效率和鲁棒性。
RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略
RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。
Learning More from Less: 从后见之明中进行强化学习
介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。
从世界到手腕:面向精细机器人操作的任务条件未来手腕建模
介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。