Chain-of-Procedure: 面向程序问答的分层视觉语言推理
摘要
本文提出了ProcedureVQA,一个面向视觉程序问答的基准测试,以及Chain-of-Procedure(CoP),一种分层推理框架,通过视觉线索检索相关指令,并借助语义分解细化步骤,相较于基线方法实现了最高13%的性能提升。
arXiv:2605.14928v1 公告类型:新
摘要:近期,视觉语言模型(VLM)在标准图像文本任务上取得了显著成果,但其在视觉程序问答(VP-QA)方面的潜力尚未被充分探索。VP-QA带来了独特的挑战,用户通过上传复杂程序中间状态的图像来查询下一步操作。为了系统评估VLM在此实际任务上的表现,我们提出了ProcedureVQA,这是一个专为视觉程序推理设计的新型多模态基准测试。通过全面分析,我们发现了当前VLM的两个关键局限:在给定视觉状态的情况下对结构化程序的跨模态检索不足,以及图像序列粒度与文本步骤分解之间的错位。为解决这些问题,我们提出了Chain-of-Procedure(CoP),一种分层推理框架,首先利用视觉线索检索相关指令,然后通过语义分解进行步骤细化,最后生成下一步操作。在六个VLM上的实验证明了CoP的有效性,相较于标准基线实现了最高13%的绝对性能提升。
查看缓存全文
缓存时间: 2026/05/15 06:24
# Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
Source: https://arxiv.org/html/2605.14928
Guanhua Chen1,Yutong Yao11footnotemark:1,Shenghe Sun1,Ci\-Jun Gao3,Shudong Liu1, Lidia S\. Chao1,Feng Wan2,3,Derek F\. Wong1 1NLP2CT Lab, Department of Computer and Information Science, University of Macau 2Department of Electrical and Computer Engineering, University of Macau 3Centre for Cognitive and Brain Sciences, University of Macau \{nlp2ct\.guanhua, nlp2ct\.yutong, nlp2ct\.shenghe, cijun\.gao, nlp2ct\.shudong\}@gmail\.com \{derekfw, lidiasc, fwan\}@um\.edu\.mo ###### 摘要 Recent advances in vision\-language models \(VLMs\) have achieved impressive results on standard image\-text tasks, yet their potential for visual procedure question answering \(VP\-QA\) remains largely unexplored\. VP\-QA presents unique challenges where users query next\-step actions by uploading images for intermediate states of complex procedures\. To systematically evaluate VLMs on this practical task, we propose ProcedureVQA, a novel multimodal benchmark specifically designed for visual procedural reasoning\. Through comprehensive analysis, we identify two critical limitations in current VLMs: inadequate cross\-modal retrieval of structured procedures given visual states, and misalignment between image sequence granularity and textual step decomposition\. To address these issues, we present Chain\-of\-Procedure \(CoP\), a hierarchical reasoning framework that first retrieves relevant instructions using visual cues, then performs step refinement through semantic decomposition, and finally generates the next step\. Experiments across six VLMs demonstrate CoP’s effectiveness, achieving up to 13% absolute improvement over standard baselines\. Chain\-of\-Procedure: 层次化视觉语言推理用于程序性问答 Guanhua Chen1††thanks:同等贡献,Yutong Yao11footnotemark:1,Shenghe Sun1,Ci\-Jun Gao3,Shudong Liu1,Lidia S\. Chao1,Feng Wan2,3,Derek F\. Wong1††thanks:通讯作者。1澳门大学计算机与信息科学系 NLP2CT 实验室 2澳门大学电气与计算机工程系 3澳门大学认知与脑科学中心 \{nlp2ct\.guanhua, nlp2ct\.yutong, nlp2ct\.shenghe, cijun\.gao, nlp2ct\.shudong\}@gmail\.com \{derekfw, lidiasc, fwan\}@um\.edu\.mo
## 1 引言
近期的大型语言模型(LLMs),如 GPT-4(Hurst et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib16))和 Claude(Anthropic, 2025 (https://arxiv.org/html/2605.14928#bib.bib1)),已在多种多模态理解任务中展现出强大性能(Ma et al., 2025 (https://arxiv.org/html/2605.14928#bib.bib23)),包括视觉问答(VQA)(Qiu et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib31);Nguyen et al., 2025 (https://arxiv.org/html/2605.14928#bib.bib26))和检索增强生成(RAG)(Chen et al., 2025a (https://arxiv.org/html/2605.14928#bib.bib5);Yu et al., 2025 (https://arxiv.org/html/2605.14928#bib.bib47))。然而,它们在视觉程序性问答(VP-QA)方面的能力仍未得到充分探索,而 VP-QA 对于家具组装、设备故障排除和烹饪辅助等应用至关重要。我们正式将该任务定义为一种多模态选择问题:给定一张展示某个完整任务流程中间状态的图像,模型必须推断进度,并从一组候选步骤中识别出正确的下一步骤(流程中的主要动作)。如图 1 (https://arxiv.org/html/2605.14928#S1.F1) 所示,当用户上传一张部分拆解的散热器盖图像时,系统必须将该视觉状态与流程中的具体步骤对齐,以预测紧接着的下一个动作。该任务需要细粒度的视觉-文本对齐和层次化推理,其独特挑战超越了常规的图像-文本任务。
参考图注
图 1:下一步预测任务的示例。
尽管当前的视觉语言模型(VLMs)专注于静态视觉问答(Bazi et al., 2023 (https://arxiv.org/html/2605.14928#bib.bib3);Guo et al., 2023 (https://arxiv.org/html/2605.14928#bib.bib13))和文本引导的图像推理(Kelly et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib18);Zhou et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib51)),程序性理解需要视觉查询与结构化规划之间的动态对齐。现有基准要么聚焦于单图像识别(Yang et al., 2021 (https://arxiv.org/html/2605.14928#bib.bib44)),要么依赖预对齐的程序性数据(Lin et al., 2020 (https://arxiv.org/html/2605.14928#bib.bib20)),忽略了将演化中的视觉状态与层次化流程对接这一核心挑战。与文本引导的文档推理不同(Yang et al., 2018 (https://arxiv.org/html/2605.14928#bib.bib45)),VLM 将视觉状态与离散文本指令对齐要困难得多,尤其是在视觉证据的粒度与文本不完全匹配时。为填补这些空白,我们构建了 ProcedureVQA,这是一个用于视觉程序步骤理解的新型基准。我们重建了 Chen et al. (2024 (https://arxiv.org/html/2605.14928#bib.bib7)) 提出的一个已发布数据集,将其转化为覆盖五个常见程序性领域(家庭维修、烹饪、设备设置、手工艺和医疗保健)的多模态基准。我们在六种最先进的 VLM 上评估了端到端的下一步预测,发现准确率欠佳(25.1%-62.5%)。通过错误分析,我们识别出一个关键的“粒度不匹配”问题:高层指令通常包含多个隐式的原子动作,使得当前模型难以直接进行视觉对齐。因此,我们提出了 Chain-of-Procedure(CoP),这是一个旨在弥合这一差距的层次化推理框架。与先前将流程视为扁平文本的检索增强方法不同(Panda et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib29)),CoP 分三个阶段运作,将术语与视觉证据对齐。首先,它利用 VLM 粗略筛选相关候选流程。其次,它将粗粒度流程动态分解为细粒度的子步骤,以匹配视觉状态的粒度。最后,它预测当前的子步骤动作并推断出精确的下一步。通过解耦流程检索、步骤分解和视觉-文本对齐,CoP 显著增强了 VLM 的程序性推理能力。我们在 ProcedureVQA 基准上对六种 VLM 评估了 CoP,实验结果表明,与基线相比,CoP 在 BertScore 上提升了 1.7%-17.9%,在 LLM-Score 上提升了 2.2%-13%,改进了下一步预测的性能。
## 2 相关工作
### 2.1 程序性推理与规划
程序性推理涉及理解目标导向的序列、跟踪进度以及预测未来动作。早期的基于文本的基准如 PIQA(Bisk et al., 2020 (https://arxiv.org/html/2605.14928#bib.bib4))专注于物理常识推理,而 ProPara(Dalvi et al., 2018 (https://arxiv.org/html/2605.14928#bib.bib9))和 OpenPI(Tandon et al., 2020 (https://arxiv.org/html/2605.14928#bib.bib36))则引入了程序性文本中的实体状态跟踪。该领域通过大规模教学视频数据集(如 COIN(Tang et al., 2019 (https://arxiv.org/html/2605.14928#bib.bib37))、HowTo100M(Miech et al., 2019 (https://arxiv.org/html/2605.14928#bib.bib24))和 Ego4D(Grauman et al., 2022 (https://arxiv.org/html/2605.14928#bib.bib12)))得到扩展,使得弱监督程序学习(Zhukov et al., 2019 (https://arxiv.org/html/2605.14928#bib.bib52))等任务成为可能。RecipeQA(Yagcioglu et al., 2018 (https://arxiv.org/html/2605.14928#bib.bib43))进一步探讨了烹饪程序的多模态理解。近期的工作已转向多模态程序性规划:Lu et al. (2024 (https://arxiv.org/html/2605.14928#bib.bib22)) 利用双文本-图像提示生成连贯计划,而 Glória-Silva et al. (2024 (https://arxiv.org/html/2605.14928#bib.bib11)) 则将教学计划锚定在视觉环境中。然而,这些方法主要依赖连续视频时间线索、顺序文本或成对的图像-文本上下文。相比之下,ProcedureVQA 关注基于快照的程序性推理,要求模型从单一的静态中间视觉状态推断隐含进度并预测下一步动作。
### 2.2 程序任务的多模态学习
将 VLM 应用于特定程序领域(尤其是烹饪和维护)已引起广泛关注。Kafle and Kanan (2017 (https://arxiv.org/html/2605.14928#bib.bib17)) 和 Yagcioglu et al. (2018 (https://arxiv.org/html/2605.14928#bib.bib43)) 通过 RecipeQA 等数据集奠定了基础。更近期的努力开发了针对这些任务的专门模型。CookingQA(Khilji et al., 2021 (https://arxiv.org/html/2605.14928#bib.bib19))处理基于食材的问答,而 FoodLMM(Yin et al., 2023 (https://arxiv.org/html/2605.14928#bib.bib46))和 LLaVA-Chef(Mohbat and Zaki, 2024 (https://arxiv.org/html/2605.14928#bib.bib25))利用大型多模态模型生成全面的食谱和烹饪程序。此外,基于检索的方法已被探索用于增强食谱理解(Song et al., 2023 (https://arxiv.org/html/2605.14928#bib.bib35))。尽管取得了这些进展,一个关键局限依然存在:视觉状态与文本程序之间的粒度不匹配。虽然通用 VLM(Liu et al., 2023 (https://arxiv.org/html/2605.14928#bib.bib21);Zhao et al., 2024 (https://arxiv.org/html/2605.14928#bib.bib49))显示出潜力,但它们在复杂程序所需的结构化检索方面仍存在困难。与以往专注于端到端生成或简单对齐的工作不同,我们的 CoP 框架通过语义步骤分解明确解决了粒度不匹配问题,从而实现了更准确的下一步预测。
## 3 ProcedureVQA
我们提出了一个新的基准,该基准基于 Chen et al. (2024 (https://arxiv.org/html/2605.14928#bib.bib7)) 发布的 CoMM 数据集的 WikiHow 部分重建而成。我们的框架针对现实世界中广泛的程序性任务,从技术性的车辆维护到日常的生活技能。
### 3.1 问题形式化
为严格定义任务并标准化术语,我们如下形式化 VP-QA。一个程序 \( \mathcal{P} = \{S_1, S_2, \dots, S_L\} \) 是由 \( L \) 个顺序步骤(主要动作)组成的完整任务工作流。给定一个视觉查询 \( v_t \),它显示了完成步骤 \( S_t \) 后的中间状态,模型必须:(1) 从候选集 \( \mathcal{C}_p = \{\mathcal{P}_1, \dots, \mathcal{P}_N\} \)(包含一个正确程序和 \( N-1 \) 个错误程序)中检索出正确的程序 \( \mathcal{P}^* \);(2) 将 \( v_t \) 定位到 \( \mathcal{P}^* \) 中的当前步骤 \( S_t \);(3) 预测下一步骤 \( S_{t+1} \) 的内容。该形式化测试了跨程序检索、视觉状态定位以及在粗粒度步骤与细粒度视觉证据之间的粒度不匹配下的下一步推理能力。
| 度量 | 训练 | 测试 | 总计 |
|------|------|------|------|
| 总样本数 | 1,939 | 2,844 | 4,783 |
| 平均长度(词元) | 5.9 | 5.7 | 5.8 |
| 步骤长度标准差 | 7.1 | 4.8 | 5.9 |
| 最短样本 | 3 | 3 | 3 |
| 最长样本 | 45 | 22 | 33 |
| **领域分布** | | | |
| 汽车及其他车辆 | 476 | 509 | 985 |
| 计算机与电子产品 | 696 | 631 | 1,327 |
| 爱好与手工艺 | 551 | 533 | 1,084 |
| 运动与健身 | 216 | 500 | 716 |
| 工作世界 | 0 | 671 | 671 |
表 1:ProcedureVQA 数据集统计,包含基准集和训练集。
### 3.2 数据构建
我们的重建框架通过领域特定的处理,将原始程序性数据转化为多模态推理基准。
#### 数据领域。
我们策略性地选择了五个领域,以确保任务多样性并保持领域一致性:(1) **汽车与其他车辆**:涵盖诸如检查机油等维护任务;(2) **计算机与电子产品**:包括硬件和软件教程;(3) **爱好与手工艺**:提供艺术方面的视觉指南;(4) **运动与健身**:提供锻炼指南;(5) **工作世界**:涵盖专业技能。这一选择平衡了日常领域与技术复杂领域。每个领域的示例见附录 A.1 (https://arxiv.org/html/2605.14928#A1.SS1)。
#### 通过步骤融合模拟粒度。
程序性 VQA 的一个关键挑战是视觉与文本粒度之间的不一致。为模拟这种真实世界的变化,我们对原始文本指令应用可控的步骤融合。以 50% 的概率,将两个连续的原子步骤合并为一个粗粒度的指令。这种方法受 Gao et al. (2022 (https://arxiv.org/html/2605.14928#bib.bib10)) 和 Dalvi et al. (2018 (https://arxiv.org/html/2605.14928#bib.bib9)) 的启发,创建了一个现实的不匹配场景,其中单个步骤可能对应多个视觉状态。此设计对于测试模型对不一致步骤分辨率的鲁棒性至关重要,并推动了步骤分解的需求。我们在附录 A.2 (https://arxiv.org/html/2605.14928#A1.SS2) 中对该概率进行了敏感性分析。
#### 负采样与数据结构。
为创建具有挑战性的干扰项,我们通过 ResNet50(He et al., 2016 (https://arxiv.org/html/2605.14928#bib.bib14))将所有图像编码为 512 维向量。对于每个输入图像 \( v_t \),我们通过域内余弦相似度搜索来策划硬负候选。我们选择视觉上接近但程序上无关的指令作为干扰项,以防止模型依赖简单的视觉捷径。最终每个数据实例构建为元组:
\[ \mathcal{D} = (v_t, \mathcal{C}, y) \] (1)
其中 \( v_t \) 是输入图像,\( \mathcal{C} = \{c_{pos}, c_{neg}^{(1)}, c_{neg}^{(2)}\} \) 是三个候选指令(一个正例、两个硬负例)的集合,\( y \) 是真实标签的索引。这种结构确保基准严格评估 VLM 在程序性语境中执行精确图像-文本对齐的能力。
参考图注
图 2:训练数据以及域内(ID)和域外(ODD)测试数据的 t-SNE 可视化。
### 3.3 数据统计
我们的数据集包含 4,783 个样本。为评估 VLM 的微调效果,我们将数据分为训练集和基准集:所有“工作世界”的 671 个样本保留作为域外(OOD)测试,而其他领域则使用按步骤长度分层拆分,以平衡复杂性。如表 1 (https://arxiv.org/html/2605.14928#S3.T1) 所示,训练集和域内(ID)基准集具有相似的词汇复杂性,但训练集表现出更高的步骤方差,保留了长尾序列。我们使用 all-roberta-large-v1 (Reimers and Gurevych, 2019 (https://arxiv.org/html/2605.14928#bib.bib34)) 度量语义重叠。基准-训练对的余弦相似度中位数为 0.64,平衡了迁移潜力与抗记忆能力。图 2 (https://arxiv.org/html/2605.14928#S3.F2) 中的 t-SNE 可视化确认了结构对齐:训练数据(绿色)和 ID 测试数据(蓝色)显著重叠,而 OOD 样本(红色)形成独立簇。此设计严格测试了 VLM 在 VP-QA 任务上的学习与泛化能力。
## 4 基准测试与分析
本节使用 ProcedureVQA 基准评估强大 VLM 在 VP-QA 任务上的能力。我们首先介绍实验设置。相似文章
DocTrace:通过分层证据图推理实现可追踪的长文档VQA
本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。
DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准
介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。
VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件
VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。
伪代码引导的结构化推理:实现视觉语言模型中可靠推理的自动化
提出了伪代码引导的结构化推理框架(PStar),该框架自适应地选择结构化伪代码推理路径以减少视觉语言模型中的幻觉,在POPE和MMStar基准测试上取得了最先进的分数。
通过闭环验证推理解锁复杂视觉生成
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。