ProcAgent:一种在边缘设备上支持人在回路中的程序性任务指导的智能体框架

arXiv cs.AI 论文

摘要

ProcAgent 是一个完全在设备端运行的、基于视觉的智能体程序助手,采用提出-验证架构,在 NVIDIA Jetson AGX Orin 上实现实时自适应指导。它支持反应式和主动式两种模式,并支持人在回路中的确认,实现响应式交互,并在用户研究中获得积极评价。

arXiv:2607.24770v1 公告类型:新 摘要:诸如家具组装和家庭维修等程序性任务对用户提出了巨大的认知负担,因为用户需要在执行物理动作的同时理解指令、跟踪任务进度、推理空间状态以及从错误中恢复。先前的多模态助手在程序性指导方面显示出了潜力,但大多数依赖于云端推理和固定的始终在线感知,这使得它们不适用于隐私敏感、延迟关键的室内环境。我们提出了 ProcAgent,一个完全在设备端运行的、基于视觉的智能体程序助手,在单个 NVIDIA Jetson AGX Orin 上实现实时自适应指导。ProcAgent 采用提出-验证架构,结合了低延迟连续感知、符号任务图、按需视觉语言验证以及基于 LLM 的交互智能体。系统持续提出用户进度,仅当出现歧义或可能的偏差时才调用昂贵的视觉推理,并支持带有人的确认回环的反应式问答和主动干预。我们从四个维度评估了 ProcAgent:感知准确性、推理能力、任务级性能和用户体验。尽管完全在设备端运行,系统仍保持响应式交互,纯文本查询大约在 2 秒内解决,视觉接地查询大约在 8 秒内解决。在一项由 10 名参与者完成组装任务的用户研究中,ProcAgent 在可理解性、可操作性和隐私舒适度方面获得了积极评价。这些结果表明,自适应程序性辅助可以在不牺牲可用性的情况下完全在边缘硬件上实现。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:51

# 一种带人在回路的边缘过程任务指导的代理框架  
来源:https://arxiv.org/html/2607.24770  
Subrata BiswasWorcester Polytechnic InstituteWorcesterUSAsbiswas@wpi\.edu (https://arxiv.org/html/2607.24770v1/mailto:[email protected])  
Bashima IslamWorcester Polytechnic InstituteWorcesterUSAbislam@wpi\.edu (https://arxiv.org/html/2607.24770v1/mailto:[email protected])  
Sai Swaminathansswamin6@utk\.edu (https://arxiv.org/html/2607.24770v1/mailto:[email protected])  
University of Tennessee KnoxvilleKnoxvilleUSA  

###### 摘要。步骤性任务(如家具组装和家庭维修)对用户提出了巨大的认知负担——用户需要一边执行物理操作,一边解析说明、追踪任务进度、推理空间状态,并从错误中恢复。先前的多模态助手在过程指导方面展现了潜力,但多数依赖云端推理和固定、始终开启的感知,难以适用于隐私敏感、延迟苛刻的家庭场景。我们提出**ProcAgent**,一个完全在设备端运行的、基于视觉的代理式过程助手,可在单个NVIDIA Jetson AGX Orin上实现实时自适应指导。**ProcAgent**采用“提议-验证”架构,融合了低延迟持续感知、符号化任务图、按需的视觉语言验证以及基于LLM的交互代理。系统持续提议用户进度,仅在出现模糊或可能偏差时调用代价高昂的视觉推理,并支持响应式问答和带人在回路确认的主动介入。我们从感知精度、推理能力、任务级表现和用户体验四个维度评估**ProcAgent**。尽管完全在设备端运行,系统仍保持响应式交互,纯文本查询约2秒内解决,视觉定位查询约8秒内解决。在10名参与者完成组装任务的用户研究中,**ProcAgent**在可理解性、可操作性和隐私舒适度方面获得了正面评价。这些结果表明,自适应过程辅助完全可以在边缘硬件上实现,而无需牺牲可用性。†† ccs:Human-centered computing†† ccs:Human-centered computing Ubiquitous and mobile computing†† ccs:Human-centered computing Ubiquitous and mobile computing systems and tools

## 1. 引言  

参照图注  
图1. 部署在家用助手设备上的ProcAgent,支持响应式和主动式两种家具组装辅助模式。在**响应式模式**(A-C)中,用户明确请求帮助、询问下一步组装步骤,并接收关于桌腿对齐的视觉验证。在**主动式模式**(D-E)中,ProcAgent监控任务并在错误发生时进行干预,确认桌腿是否牢固安装以及桌子在提起前是否已翻转,从而防止步骤性错误。(F)展示了ProcAgent在家用助手设备上的部署及其硬件配置,包括摄像头、扬声器、麦克风,以及用于感知、交互和计算的NVIDIA Jetson AGX Orin模块。

步骤性任务,如家具组装、家庭维修、实验室协议、手工制作,共享简单的结构:一系列离散的物理动作,将组件转化为完成品。然而执行这些任务会带来显著的认知负担。用户必须同时解析说明、维护当前状态的心智模型、定位零件、规划下一步行动,并监控错误——这一切都在进行物理操作的同时 (Eesee et al., 2025)。这种对工作记忆、空间推理和注意力的并发负荷对非专业人士尤其繁重 (Sewell et al., 2016)。这种负担在任务中并非均匀分布。一个用户执行直截了当的步骤时不需要帮助;一个用户在38步中的第17步被模糊的示意图卡住时,需要立即、空间定位的指导。静态手册无法做出这种区分,而AR覆盖或预录视频虽然更丰富,但依然是非自适应的:它们无法检测错误、无法从偏差中恢复,也无法回答基于当前工作空间状态的自由形式问题 (Hartanto et al., 2019)。因此,需要的是一个即时助手,能够监控进度、检测困惑,并仅在必要时进行干预。  

越来越多的研究开始满足这一需求。最近的数据集如 ProMQA-Assembly (Hasegawa et al., 2025) 和 CaptainCook4D (Peddiet al., 2024) 建立了过程性问答和错误检测的基准,而像 PrISM-Q&A (Arakawa et al., 2024) 这样的系统展示了结合多模态过程追踪与大语言模型的步骤感知语音助手,CHEF-VL (Wang et al., 2025) 则显示视觉语言模型能够检测烹饪中的认知排序错误。其他工作将任务辅助局限于单次示范或推动实时动作识别到嵌入式平台 (Meng et al., 2008; Luo et al., 2025)。总体而言,这些结果验证了基于LLM和VLM的过程助手既可行又有用。然而,先前的工作存在两个局限性。  

首先,大多数系统依赖云端推理来运行LLM或VLM组件 (Meng et al., 2008),这对于必须持续观察用户工作空间的基于视觉的助手来说是有问题的。将视频流式传输到远程服务器会引发家庭环境中充分记录的隐私和“监控焦虑”问题 (Dourish, 2004),引入5-10秒的往返延迟打断了即时教学循环,并使得系统在网络受限环境中无法使用。其次,步骤性任务本质上是多模态的:某些回合仅需要语言推理,另一些需要视觉定位,还有一些需要知识检索,很多则三者都需要。现有系统要么将感知视为始终开启(招致持续的计算和热耗),要么将其视为固定流水线,均匀应用于每一个回合而不管复杂性。这两种方式都无法扩展到持续的实时交互。  

缺失的是一种**代理式**架构,能够动态地按回合选择适当的工具——只在需要空间验证时调用视觉,只在需要过程细节时检索知识,否则仅依赖语言推理,并且完全在设备端完成。在商用边缘硬件(如NVIDIA Jetson类设备)上实现这一点并非易事:持续运行数十亿参数的VLM推理会耗尽统一内存并在几分钟内触发热节流,而轻量级检测器则缺乏足够的语义粒度来可靠区分细粒度的过程状态,比如部分对齐的桌腿与完全固定的桌腿 (Huang et al., 2025)。因此,架构问题不在于LLM智能体**能否**协助过程任务——先前的工作已经表明它们可以——而在于如何在隐私、延迟和边缘计算能力的联合约束下提供代理式智能。  

我们通过**ProcAgent**来应对这些约束,它是一个完全在设备端运行的、基于视觉的代理式过程助手,用于家庭环境中的实时自适应辅导。**ProcAgent**完全运行在单个NVIDIA Jetson AGX Orin上,并围绕**“提议-验证”**范式构建。一个轻量级感知模块,通过对比图像预训练并在少量任务特定步骤描述上微调,持续运行并提出它认为用户正在做什么。这些提议被视为暂定假设,不会直接更新系统对进度的理解。相反,一个符号化任务表示——一个包含步骤及其顺序规则的显式图——决定了哪些提议是合理的、哪些需要确认。当需要时,按需调用视觉语言模型来验证当前状态,从而只在关键时刻使用高保真视觉推理,而非持续使用。一个基于LLM的代理处理与用户的交互,决定何时干预、询问什么,以及何时将判断权交给用户。  

如图1所示,**ProcAgent**支持**响应式**和**主动式**两种交互模式。在响应式模式下,代理响应用户发起的查询,提供步骤指导或按需验证动作。在主动式模式下,代理持续监控任务进度,仅在检测到可能偏离预期顺序时进行干预,使用简短的确认来在错误传播之前纠正错误。这些组件共同将**感知跟踪**与**语义推理**解耦,使每个组件能够以适合其角色的延迟和保真度运行。代理还推理何时需要视觉定位,然后再调用视觉模型(例如,从任务模型回答“我的下一步是什么?”,同时将视觉保留给“这个对齐正确吗?”)。此外,**ProcAgent**引入了人在回路的确认策略,当感知与过程结构不一致时(例如,在纠正可疑错误前简短地请求确认)将决定权交给用户。这一设计反映了一个关键的交互原则:在自愿使用场景中,错误干预的代价通常高于错过干预。  

我们从四个维度评估**ProcAgent**:感知精度、推理能力、任务级表现和用户体验。在单个NVIDIA Jetson AGX Orin上,系统完全在设备端运行并支持实时交互,纯文本查询约2秒内响应,视觉定位推理约8秒内响应。在不同代理后端之间,我们观察到响应质量与工具使用可靠性之间明显的权衡,我们选择的模型提供了最一致的表现。在10名参与者完成组装任务的用户研究中,**ProcAgent**在可理解性、可操作性和隐私舒适度方面获得广泛正面评价,参与者特别看重系统在设备端的运行。这些结果表明,自适应、代理式过程辅助完全可以在边缘硬件上实现,而无需牺牲可用性,表明隐私、延迟和能力之间的权衡是架构性的而非根本性的。  

我们的工作做出以下贡献:  
1. **一个端到端、完全在设备端运行的代理式过程辅助系统**。我们提出**ProcAgent**,一个基于视觉的过程助手,将感知、结构化任务跟踪和基于语言的交互集成到一个统一系统中,完全在边缘硬件上运行。我们证明,无需云端推理即可实现实时、自适应的过程指导,同时保留可用性和用户信任。  
2. **一个使多模态过程助手在边缘设备上高效且可靠的框架**。我们展示了如何通过轻量级、始终开启的模型持续提议用户的动作,并仅在需要时调用昂贵的视觉推理,同时任务结构和用户确认在我们提出的框架下保持正确性,而不是持续运行感知和推理。  
3. **对设备端过程助手的性能与用户交互的实证表征**。通过系统消融实验和用户研究,我们展示了不同组件如何贡献于感知精度、过程正确性、资源效率和用户体验。我们的结果识别出人在回路的确认是序列遵循度的关键驱动因素,并表明设备端部署显著改善了用户对隐私和信任的感知。  

## 2. 相关研究  

### 2.1. 基于视觉的助手  

早期的基于视觉的助手依赖固定标记、深度传感器或结构光来在受控制造环境中跟踪零件位置并推断组装状态 (Re et al., 2016; Radkowski et al., 2015)。虽然这些系统证明了视觉驱动指导的可行性,但它们对仪器化环境和专用硬件的依赖限制了其在真实世界非结构化设置中的适用性。深度学习的出现为过程任务的视觉识别带来了显著进展。基于卷积神经网络的方法实现了从原始视频中进行动作识别和步骤检测,而无需环境仪器,像IKEA Assembly Dataset (Ben-Shabat et al., 2021) 和 Assembly101 (Sener et al., 2022) 这样的数据集提供了用于评估组装特定识别的大规模基准。通过 EPIC-Kitchens (Damen et al., 2018) 和 WEAR (Bock et al., 2024) 等数据集探索的自我中心视频理解进一步证明了第一人称视觉视角能够捕捉过程任务表现核心的细粒度手-物交互。  

这些进展确立了视觉识别模型能够可靠地识别用户在做什么,但不能说出他们接下来应该做什么,也不能说出如何与他们沟通。最近的系统开始通过将视觉识别与自然语言生成配对来弥合感知与指导之间的鸿沟。基于AR的助手如 HoloAssist (Wang et al., 2023) 将自我中心视频理解与步骤级指令交付相结合,而基于大型视觉语言模型(如 InstructBLIP (Dai et al., 2023) 和 LLaVA (Liu et al., 2023))的系统则展示了回答关于过程场景的开放式视觉查询的令人印象深刻的能力。在手术和医学领域,基于视觉的指导系统已经证明实时视觉反馈能够有意义地减少过程错误 (Gao et al., 2021; Kletz et al., 2019)。  

尽管有这些进展,文献中仍存在一个持续的局限性:视觉识别和语言生成被视为松散耦合的模块,而非统一、状态感知系统的组件。视觉模块观察,语言模块响应,但两者都没有维护对用户在任务中的位置、哪些已经验证、或哪些约束规定了接下来合法发生什么的持久理解。  

### 2.2. 过程任务中的错误检测与恢复系统  

在过程任务中检测和从错误中恢复一直是机器人、人机交互和智能辅导系统中的长期挑战。早期方法依赖基于规则的监视器,将传感器读数或符号状态表示与预定义的正确序列进行比较,当观察到的行为偏离预期计划时标记偏差 (Hegemann et al., 2022)。虽然在高度受控的环境中有效,但这些系统

相似文章

预见与学习:在主动式智能体中释放空闲时间计算能力

Hugging Face Daily Papers

ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。

AgentOS

Product Hunt

AgentOS 提供了一个统一控制层,用于管理 AI 代理、任务和工作空间。

Agent Context

Product Hunt

Agent Context 是一款开发者工具,可让用户将参考项目附加到 AI 编程助手。