使用基于深度学习的视觉和事件驱动有限状态机的以设备为中心的近实时工件定位

arXiv cs.LG 论文

摘要

本文提出了一种以设备为中心的框架,利用基于深度学习的视觉和事件驱动有限状态机在热锻工厂中定位工件,在运行环境中实现了高检测精度和低延迟。

arXiv:2608.05744v1 公告类型:新 摘要:工件连续定位对于热锻中的可追溯性和过程协调至关重要,但由于极端温度、表面退化和不规则路径,直接跟踪不可靠。本研究提出了一种以设备为中心的框架,通过多台静态2D摄像头观察到的搬运设备来推断工件位置。该框架估计平面图空间中的3D设备坐标,并识别抓取和释放活动。事件驱动有限状态机将这些活动验证为离散处理事件,并持续更新工件状态和位置。集成到3D卷积神经网络中的关键点引导注意力机制通过聚焦功能相关的设备区域来提高活动识别。在实际运行的热锻工厂中的评估实现了在33秒容差窗口内100%的事件检测准确率、平均定位误差317.8毫米以及平均系统延迟21秒。该框架将基于视觉的感知与可解释的事件驱动推理相结合,支持工件转移可视化和设备操作的定量分析。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:52

# 基于深度学习视觉与事件驱动有限状态机的以设备为中心的近实时工件定位
Source: https://arxiv.org/abs/2608.05744
查看 PDF (https://arxiv.org/pdf/2608.05744)

> 摘要:在热锻过程中,连续的工件定位对于可追溯性和工艺协调至关重要,但由于极端温度、表面退化和不规则路径,直接跟踪并不可靠。本研究提出了一种以设备为中心的框架,通过多台静态2D摄像机观测搬运设备来推断工件位置。该框架估计平面图空间中的3D设备坐标,并识别抓取和释放活动。事件驱动的有限状态机将这些活动验证为离散的搬运事件,并持续更新工件状态和位置。集成到3D卷积神经网络中的关键点引导注意力机制通过聚焦于功能相关的设备区域来提升活动识别性能。在一家实际运行的热锻工厂进行的评估实现了在33秒容差窗口内100%的事件检测准确率,平均定位误差为317.8毫米,平均系统延迟为21秒。该框架将基于视觉的感知与可解释的事件驱动推理相连接,并支持工件转移可视化和设备操作的量化分析。

## 提交历史

来自:Dohyeon Kong 先生 [查看邮件](https://arxiv.org/show-email/2be91386/2608.05744) **\[v1\]** 2026年8月6日星期四 08:27:48 UTC(3,901 KB)

相似文章

使用物理信息深度学习从显微图像预测钢材疲劳寿命

arXiv cs.LG

本文介绍了 FatigueCV,一个物理信息深度学习框架,可在65毫秒内从光学显微图像预测钢材疲劳寿命,使用带不确定性估计的CNN。在合成显微图像上的验证显示出强劲性能(R²=0.93),但现实世界验证被列为未来工作。