ReGraph:从食物图像学习生成食谱图
摘要
介绍了ReGraph,一个具有显式过程结构和食谱推理思维链(RR-CoT)轨迹的大规模食谱图数据集,以及一个两阶段的食谱图学习(RGL)框架,使LMMs能够从食物图像生成细粒度的烹饪工作流。
arXiv:2608.06917v1 公告类型:新
摘要:近期的大型多模态模型(LMMs)在从食物图像生成食谱方面取得了令人印象深刻的性能。然而,烹饪是一个结构化的转换过程,其中食材通过有序的动作经历状态变化,而自由形式的食谱语言使得相应的实体、中间状态和依赖关系在很大程度上隐式且纠缠不清。图表示使得这种过程性知识显式且组合化,为评估模型输出是否编码了过程级知识而不仅仅是呈现看似合理的文本描述提供了结构化基础。为了解决这一局限性,我们提出了ReGraph,一个大规模食谱图数据集,将食材、烹饪动作和工具表示为实体,使用实体属性描述食材状态变化,并采用类型化关系来编码操作目标、目的地和过程顺序。ReGraph进一步整合了显式的食谱推理思维链(RR-CoT)轨迹,为过程分解和结构化图生成提供辅助监督。基于ReGraph,我们提出了食谱图学习(RGL),一个两阶段框架,使LMMs能够从食物图像以结构化食谱图的形式生成合理的细粒度烹饪工作流。在确定性、模式感知的匹配协议下,我们的实验揭示了文本生成质量与可恢复的过程结构之间的显著差距:现有方法生成的食谱取得了有竞争力的文本生成分数,但在ReGraph模式下产生的与参考对齐的实体和关系结构有限。相比之下,在两个代表性LMM骨干网络上,RGL持续改进了烹饪实体和过程关系的生成,而我们的分析进一步表明,细粒度的食材状态捕获仍然是最具挑战性的维度。
查看缓存全文
缓存时间: 2026/08/10 07:59
# ReGraph: 学习从食物图像生成食谱图 来源:https://arxiv.org/html/2608.06917 \\UseRawInputEncoding Guoshan Liu可信具身智能研究院,复旦大学中国上海上海市多模态具身智能重点实验室中国上海gsliu24@m\.fudan\.edu\.cn (https://arxiv.org/html/2608.06917v1/mailto:[email protected])Bin Zhu新加坡管理大学新加坡新加坡binzhu@smu\.edu\.sg (https://arxiv.org/html/2608.06917v1/mailto:[email protected]),Pengkun Jiao可信具身智能研究院,复旦大学中国上海上海市多模态具身智能重点实验室中国上海pkjiao23@m\.fudan\.edu\.cn (https://arxiv.org/html/2608.06917v1/mailto:[email protected]),Jingjing Chen可信具身智能研究院,复旦大学中国上海上海市多模态具身智能重点实验室中国上海chenjingjing@fudan\.edu\.cn (https://arxiv.org/html/2608.06917v1/mailto:[email protected]),Chong\-Wah Ngo新加坡管理大学新加坡新加坡cwngo@smu\.edu\.sg (https://arxiv.org/html/2608.06917v1/mailto:[email protected])以及Yu\-Gang Jiang可信具身智能研究院,复旦大学中国上海上海市多模态具身智能重点实验室中国上海ygj@fudan\.edu\.cn (https://arxiv.org/html/2608.06917v1/mailto:[email protected]) ###### 摘要\. 近年来,大型多模态模型(LMMs)在从食物图像生成食谱方面取得了令人瞩目的性能。然而,烹饪是一个结构化的转换过程,其中食材通过有序的动作发生状态变化,而自由形式的食谱语言使相应的实体、中间状态和依赖关系在很大程度上隐含且纠缠不清。图表示使这种程序性知识变得显式和可组合,为评估模型输出是否编码了过程级知识(而不仅仅是呈现看似合理的文本描述)提供了结构化基础。为了解决这一局限,我们提出了ReGraph,一个大规模食谱图数据集,将食材、烹饪动作和工具表示为实体,使用实体属性描述食材状态变化,并采用类型化关系来编码操作目标、目的地和程序顺序。ReGraph进一步纳入了显式的食谱推理思维链(RR\-CoT)轨迹,为程序分解和结构化图生成提供辅助监督。基于ReGraph,我们提出了食谱图学习(RGL),一个两阶段框架,使LMMs能够以结构化食谱图的形式从食物图像生成合理的细粒度烹饪工作流。在确定性的、模式感知的匹配协议下,我们的实验揭示了文本生成质量与可恢复的程序结构之间存在显著差距:现有方法生成的食谱在文本生成得分上具有竞争力,但在ReGraph模式下的参考对齐实体和关系结构却有限。相比之下,在两种具有代表性的LMM骨干网络上,RGL持续改善了烹饪实体和程序关系的生成,而我们的分析进一步表明,细粒度的食材状态捕获仍然是最具挑战性的维度。ReGraph和RGL共同为显式食谱过程建模和结构化程序理解提供了新的数据集、基准和学习框架。††ccs:计算方法学 知识表示与推理††ccs:计算方法学 计算机视觉††ccs:计算方法学 活动识别与理解††ccs:计算方法学 场景理解 ## 1\.引言 参见说明Figure 1\.一个示例可视化,展示了原始食谱说明以及ReGraph中相应的部分条目。节点表示食材(蓝色)、动作(黄色)和工具(绿色)。关系定义了程序交互:targ将食材或其他被直接操作的实体链接到对其执行的动作,dest将动作链接到其目的地或输出实体(例如,煎锅等工具或新形成的食材实体,如黄油\-糖混合物),而followed by捕获动作之间的时间和程序顺序。食材状态转换通过实体属性表示,而图共同捕获了从食谱说明中推导出的食材演变和步骤级程序结构。 健康生活日益增长的兴趣促进了食品计算领域的重大进展\(Minet al\.,2019 (https://arxiv.org/html/2608.06917#bib.bib105); Chenet al\.,2020 (https://arxiv.org/html/2608.06917#bib.bib106); Songet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib109); Guiet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib107); Wuet al\.,2026 (https://arxiv.org/html/2608.06917#bib.bib108); Zhanget al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib110); Qiet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib111)\),尤其是在食材解析\(Guiet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib112); Liuet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib113)\)、跨模态食谱检索\(Chen and Ngo,2016 (https://arxiv.org/html/2608.06917#bib.bib148); Wahedet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib149)\)和食谱生成\(H\. Leeet al\.,2020 (https://arxiv.org/html/2608.06917#bib.bib118); Liuet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib119),2026 (https://arxiv.org/html/2608.06917#bib.bib117)\)方面。近期向大型多模态模型(LMMs)的范式转变进一步加速了这一进展。通过将广泛的烹饪知识锚定在视觉语义中,LMMs现在可以从单张食物图像生成详细且合理的食谱。代表性示例包括FoodLMM\(Yinet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib114)\),专注于细粒度食物识别和理解,以及RecipeRAG\(Yanget al\.,2025c (https://arxiv.org/html/2608.06917#bib.bib116)\),采用检索增强生成来提高生成食谱的一致性。现有方法已在传统食谱生成基准上取得了有竞争力的性能,这些基准通常使用基于文本的指标(如SacreBLEU\(Post,2018 (https://arxiv.org/html/2608.06917#bib.bib153)\)和ROUGE\-L\(Lin,2004 (https://arxiv.org/html/2608.06917#bib.bib154)\))来评估生成质量。然而,流畅且词汇相似的食谱文本并不一定提供细粒度烹饪程序的显式表示。诸如食材在单个动作后状态如何演变、每个动作操作了哪些食材或中间产物、以及哪些动作必须先于其他动作等细粒度信息,通常隐含在自由形式的说明中。因此,生成的食谱可能可读且在语义上合理,但在过程层面却难以分析、比较或推理。结构化图为烹饪程序提供了一种自然的知识表示。食谱描述了由烹饪动作引起的食材状态转换序列,但自由形式的说明将这些知识分散在叙述性表达中,使参与的实体、中间状态和程序依赖关系保持隐含。通过将这些元素编码为节点、属性和类型化关系,食谱图使转换过程变得显式和可组合。因此,它支持直接的过程级分析,并提供了一个结构化代理,用于评估生成输出是否编码了超越文本合理性的程序性知识\(Zhuet al\.,2021 (https://arxiv.org/html/2608.06917#bib.bib103); Khoshraftar and An,2024 (https://arxiv.org/html/2608.06917#bib.bib104)\)。然而,如表1 (https://arxiv.org/html/2608.06917#S1.T1)所总结的,现有的食品领域图资源\(Haussmannet al\.,2019 (https://arxiv.org/html/2608.06917#bib.bib121); Moriet al\.,2014 (https://arxiv.org/html/2608.06917#bib.bib127); Nishimuraet al\.,2020 (https://arxiv.org/html/2608.06917#bib.bib126); Shiraiet al\.,2022 (https://arxiv.org/html/2608.06917#bib.bib128)\)在规模、程序完整性或显式程序推理监督方面仍然有限。有些主要编码静态的食材、营养或跨食谱关联,而另一些仅包含部分烹饪流程或隐式表示中间状态。这些局限使它们不适合用于从视觉输入生成细粒度结构化烹饪工作流的LMMs的大规模训练和评估。 表 1\.ReGraph与现有食品图数据集的比较。我们强调了ReGraph在建模细粒度程序依赖关系和显式食材状态转换方面的优势。 为了解决这些局限,我们引入了ReGraph,一个大规模食谱图数据集,包含从Recipe1M\(Salvadoret al\.,2017 (https://arxiv.org/html/2608.06917#bib.bib129)\)中采样的10,000个食谱,具有318,773个实体和391,051个关系。每个样本包含两个互补部分:(1)一个食谱推理思维链(RR\-CoT)轨迹,将食谱说明分解为程序步骤并识别它们的顺序关系,以及(2)一个结构化食谱图,由食材、动作和工具实体通过类型化关系targ、dest和followed by连接而成。食材状态变化和中间产物通过新实例化的实体及其属性显式表示。RR\-CoT在监督微调期间作为辅助程序分解监督,而食谱图则作为规范知识表示以及主要预测和评估目标。图1 (https://arxiv.org/html/2608.06917#S1.F1)展示了ReGraph中的一个代表性部分示例。通过使细粒度程序信息显式化,ReGraph解决了自由形式食谱文本在表示层面的局限性。然而,从食物图像生成此类结构化信息仍然具有挑战性,因为食材转换、动作–食材交互、中间产物和程序顺序无法仅从视觉外观直接观察到。基于ReGraph,我们提出了食谱图学习(RGL),一个用于从食物图像生成结构化烹饪工作流的两阶段框架。在第一阶段,RGL\-SFT联合监督RR\-CoT轨迹及其对应食谱图的生成,鼓励模型在生成结构化实体和关系之前组织所推断的烹饪程序。在第二阶段,RGL\-RFT应用组相对策略优化(GRPO)\(Shaoet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib144)\)进一步改善图级生成质量。具体而言,所提出的相对改进奖励(RIR)促进相对于监督基线的实体和关系预测改进,而轻量级格式奖励鼓励可解析且符合模式的输出。为了衡量该任务的进展,我们采用一种确定性的、模式感知的规范匹配协议,将生成的图与参考标注进行比较,而不依赖基于模型的判断作为主要指标。通过这种两阶段设计,RGL在两种具有代表性的LMM骨干网络(Qwen3\-VL\-8B\(Yanget al\.,2025a (https://arxiv.org/html/2608.06917#bib.bib137)\)和InternVL3\-8B\(Zhuet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib147)\))上持续改善了细粒度食谱图生成。我们的贡献可总结如下: - •我们引入了ReGraph,一个大规模食谱图数据集,显式表示烹饪实体、食材状态演变、中间产物和程序顺序,并提供RR\-CoT轨迹用于辅助推理监督。 - •我们提出了食谱图学习(RGL),一个两阶段框架,通过监督和基于图的强化微调,使LMMs能够直接从食物图像生成细粒度结构化烹饪工作流。 - •我们建立了一个从食物图像生成食谱图的系统基准,并揭示了传统文本生成质量与可从生成食谱中系统提取和评估的显式程序结构数量之间存在显著差距。在两种具有代表性的LMM骨干网络上,RGL持续改善了图级实体和关系生成。 ## 2\.相关工作 ### 2\.1\.基于大型多模态模型的食谱生成 大型多模态模型(LMMs)的最新进展通过利用更强的视觉理解和语言生成能力,显著改善了从食物图像生成食谱的效果。FoodLMM\(Yinet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib114)\)通过多模态指令调优增强了细粒度食物识别和食谱理解。RoDE\(Jiaoet al\.,2026 (https://arxiv.org/html/2608.06917#bib.bib155)\)通过统一食品基准和混合专家架构进一步改善了食品领域的多模态学习,支持包括食谱生成在内的多项食品理解任务。SDRA\(Liuet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib119)\)引入语义检索,为生成提供更相关的外部食谱知识。在基于检索的食谱建模基础上,RecipeRAG\(Yanget al\.,2025c (https://arxiv.org/html/2608.06917#bib.bib116)\)进一步提高了跨模态食谱检索的准确性,并采用两阶段训练策略,将监督微调与基于GRPO的强化优化\(Shaoet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib144)\)相结合,以改善传统食谱生成性能。最近,SGRG\(Liuet al\.,2026 (https://arxiv.org/html/2608.06917#bib.bib117)\)认为传统的文本生成指标不足以评估食谱生成质量,并引入语义级评估指标以更好地评估生成的食谱。尽管如此,现有方法仍主要针对文本质量和语义一致性进行优化。它们的自由形式输出并未显式暴露细粒度程序信息,例如动作–食材交互、工具使用、食材状态演变、中间产物以及烹饪动作之间的顺序约束,从而限制了直接的过程级分析和评估。 ### 2\.2\.基于大型多模态模型的结构化生成 近期的大型多模态模型(LMMs)\(Yanget al\.,2025a (https://arxiv.org/html/2608.06917#bib.bib137); Zhuet al\.,2025 (https://arxiv.org/html/2608.06917#bib.bib147); OpenAI,2025 (https://arxiv.org/html/2608.06917#bib.bib141)\)展示了从视觉输入生成超出自由形式自然语言的结构化输出的卓越能力。Pix2Seq\(Chen and others,2022 (https://arxiv.org/html/2608.06917#bib.bib131)\)将结构化视觉任务重新表述为统一语言建模框架下的自回归序列生成。最近,Image2Struct\(Robertset al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib130)\)系统地基准测试了视觉\-语言模型直接从图像恢复结构化源表示(即图像到结构生成)的能力。基于LMM的方法进一步将结构化生成扩展到机器可读输出,如可执行程序和符号表示\(Yanget al\.,2025b (https://arxiv.org/html/2608.06917#bib.bib133); Liet al\.,2024 (https://arxiv.org/html/2608.06917#bib.bib134)\)。与开放式文本生成相比,结构化输出生成需要同时
相似文章
GraphReAct:面向多步图推理的推理与行动
本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。
图原生强化学习通过概念重组实现可追溯的科学假设生成
本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。
GraphARC:基于图结构的抽象推理综合基准
GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。
超越奖励工程:长上下文强化学习的数据配方
本文表明,通过精心设计的长上下文强化学习数据配方,结合基于结果的最小GRPO,能够显著提升多个模型和基准测试的推理能力,并迁移到GAIA和BrowseComp等智能体任务。
GraMRAG: 利用图记忆与强化学习协调多智能体多步推理
GraMRAG是一个新的多智能体RAG框架,它使用图记忆和强化学习来提升复杂多模态任务中的推理深度和记忆结构,实现了最先进的性能。