SCOPE:面向复杂图像生成的结构化分解与条件技能编排
摘要
SCOPE 是一个基于规范引导的文生图框架,通过追踪语义承诺以更好地满足复杂的视觉意图。该框架引入了 Gen-Arena 基准测试,并在复杂的生成任务中展现了强大的性能。
查看缓存全文
缓存时间: 2026/05/11 07:19
论文页面 - SCOPE:面向复杂图像生成的结构化分解与条件技能编排
来源:https://huggingface.co/papers/2605.08043 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SCOPE 是一种规范引导的框架,通过在文本到图像的生成过程中保持语义承诺,来提升复杂视觉意图的满足度。
尽管文本到图像模型在视觉保真度方面取得了显著进展,但忠实地实现复杂视觉意图仍然具有挑战性,因为需要在定位、生成和验证的各个环节跟踪许多要求。我们将这些要求称为语义承诺(semantic commitments)(https://huggingface.co/papers?q=semantic%20commitments),并将其生命周期的不连续性形式化为概念鸿沟(Conceptual Rift)(https://huggingface.co/papers?q=Conceptual%20Rift),即承诺可能在局部得到解决或检查,但在整个生成生命周期中无法始终被识别为相同的操作单元。为了解决这一问题,我们提出了 SCOPE,这是一种规范引导的技能编排(specification-guided skill orchestration)(https://huggingface.co/papers?q=specification-guided%20skill%20orchestration)框架,它在不断演进的结构化规范中维护语义承诺(semantic commitments)(https://huggingface.co/papers?q=semantic%20commitments),并围绕未解决或被违反的承诺条件性地调用检索、推理和修复技能(repair skills)(https://huggingface.co/papers?q=repair%20skills)。为了评估承诺级别的意图实现情况,我们引入了 Gen-Arena(https://huggingface.co/papers?q=Gen-Arena),这是一个带有实体和约束级别规范的人工标注基准,以及实体门控意图通过率(Entity-Gated Intent Pass Rate)(EGIP)(https://huggingface.co/papers?q=Entity-Gated%20Intent%20Pass%20Rate),一种严格的以实体为先的通过标准。SCOPE 在 Gen-Arena(https://huggingface.co/papers?q=Gen-Arena)上大幅优于所有评估的基线模型,EGIP 达到 0.60,并且在 WISE-V(https://huggingface.co/papers?q=WISE-V)(0.907)和 MindBench(https://huggingface.co/papers?q=MindBench)(0.61)上也取得了强劲的结果,证明了持久承诺跟踪在复杂图像生成中的有效性。
查看 arXiv 页面(https://arxiv.org/abs/2605.08043)查看 PDF(https://arxiv.org/pdf/2605.08043)项目页面(https://nopnor.github.io/SCOPE/)GitHub3(https://github.com/nopnor/SCOPE)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2605.08043)
在你的代理中获取这篇论文:
hf papers read 2605\.08043
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.08043 以从此页面进行链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面进行链接。
相似文章
SCOPE:通过共同进化策略进行开放式任务的自我对弈
SCOPE是一个用于开放式任务的自我对弈框架,它共同进化挑战者(Challenger)和求解器(Solver)策略,在没有外部监督的情况下,在基准测试上取得了高达+10.4分的提升。
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
GenEvolve:通过工具编排的视觉经验蒸馏实现自我进化的图像生成代理
GenEvolve是一个自我进化的图像生成框架,它利用工具编排的轨迹和视觉经验蒸馏来迭代提升生成能力,取得了最先进的性能。
SCOPE:针对FPS世界模型在可玩环境中模拟跨游戏操作
SCOPE提出了一种方法,通过在视频扩散模型的Transformer块中引入条件模块,将作用域内效果与作用域外视觉效果分离,无需分割标签,实现FPS游戏中的精确动作响应,并推出了CrossFPS,这是一个多游戏数据集,支持零样本跨游戏迁移。
Semantic Browsing: 图像生成中的可控多样性
Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。