SCOPE:面向复杂图像生成的结构化分解与条件技能编排

Hugging Face Daily Papers 论文

摘要

SCOPE 是一个基于规范引导的文生图框架,通过追踪语义承诺以更好地满足复杂的视觉意图。该框架引入了 Gen-Arena 基准测试,并在复杂的生成任务中展现了强大的性能。

尽管文生图模型在视觉保真度方面取得了显著进展,但由于许多需求必须在接地(grounding)、生成和验证过程中进行追踪,忠实地实现复杂的视觉意图仍然具有挑战性。我们将这些需求称为“语义承诺”,并将其生命周期中的不连续性正式定义为“概念断层”(Conceptual Rift),即承诺可能在局部得到解决或检查,但在整个生成生命周期中无法保持为相同的操作单元而被识别。为此,我们提出了 SCOPE,这是一个基于规范引导的技能编排框架,它在不断演进的结构化规范中维持语义承诺,并针对未解决或被违反的承诺有条件地调用检索、推理和修复技能。为了评估承诺级别的意图实现情况,我们引入了 Gen-Arena,这是一个带有实体级和约束级规范的人工标注基准测试,同时提出了“实体门控意图通过率”(Entity-Gated Intent Pass Rate, EGIP),这是一种严格的实体优先通过标准。SCOPE 在 Gen-Arena 上大幅优于所有评估的基线模型,达到了 0.60 的 EGIP,并在 WISE-V(0.907)和 MindBench(0.61)上取得了强劲的成绩,证明了持久性承诺追踪在复杂图像生成中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:19

论文页面 - SCOPE:面向复杂图像生成的结构化分解与条件技能编排

来源:https://huggingface.co/papers/2605.08043 作者:

摘要

SCOPE 是一种规范引导的框架,通过在文本到图像的生成过程中保持语义承诺,来提升复杂视觉意图的满足度。

尽管文本到图像模型在视觉保真度方面取得了显著进展,但忠实地实现复杂视觉意图仍然具有挑战性,因为需要在定位、生成和验证的各个环节跟踪许多要求。我们将这些要求称为语义承诺(semantic commitments)(https://huggingface.co/papers?q=semantic%20commitments),并将其生命周期的不连续性形式化为概念鸿沟(Conceptual Rift)(https://huggingface.co/papers?q=Conceptual%20Rift),即承诺可能在局部得到解决或检查,但在整个生成生命周期中无法始终被识别为相同的操作单元。为了解决这一问题,我们提出了 SCOPE,这是一种规范引导的技能编排(specification-guided skill orchestration)(https://huggingface.co/papers?q=specification-guided%20skill%20orchestration)框架,它在不断演进的结构化规范中维护语义承诺(semantic commitments)(https://huggingface.co/papers?q=semantic%20commitments),并围绕未解决或被违反的承诺条件性地调用检索、推理和修复技能(repair skills)(https://huggingface.co/papers?q=repair%20skills)。为了评估承诺级别的意图实现情况,我们引入了 Gen-Arena(https://huggingface.co/papers?q=Gen-Arena),这是一个带有实体和约束级别规范的人工标注基准,以及实体门控意图通过率(Entity-Gated Intent Pass Rate)(EGIP)(https://huggingface.co/papers?q=Entity-Gated%20Intent%20Pass%20Rate),一种严格的以实体为先的通过标准。SCOPE 在 Gen-Arena(https://huggingface.co/papers?q=Gen-Arena)上大幅优于所有评估的基线模型,EGIP 达到 0.60,并且在 WISE-V(https://huggingface.co/papers?q=WISE-V)(0.907)和 MindBench(https://huggingface.co/papers?q=MindBench)(0.61)上也取得了强劲的结果,证明了持久承诺跟踪在复杂图像生成中的有效性。

查看 arXiv 页面(https://arxiv.org/abs/2605.08043)查看 PDF(https://arxiv.org/pdf/2605.08043)项目页面(https://nopnor.github.io/SCOPE/)GitHub3(https://github.com/nopnor/SCOPE)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2605.08043)

在你的代理中获取这篇论文:

hf papers read 2605\.08043

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面进行链接。

相似文章

SCOPE:针对FPS世界模型在可玩环境中模拟跨游戏操作

Hugging Face Daily Papers

SCOPE提出了一种方法,通过在视频扩散模型的Transformer块中引入条件模块,将作用域内效果与作用域外视觉效果分离,无需分割标签,实现FPS游戏中的精确动作响应,并推出了CrossFPS,这是一个多游戏数据集,支持零样本跨游戏迁移。

Semantic Browsing: 图像生成中的可控多样性

Hugging Face Daily Papers

Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。