一次重写解决所有问题?面向文本到图像提示优化的类型感知修复分配
摘要
本文介绍了类型感知修复分配(TARA),这是一个无需训练的框架,将文本到图像提示优化分解为原子修复分配,其中每个失败的命题被路由到类型条件的修复操作符。实验表明,TARA在DSG和TIFA基准测试上跨四个生成器取得了最佳语义准确性,在保持图像质量的同时优于VisualPrompter。
查看缓存全文
缓存时间: 2026/07/22 08:22
# 一次重写解决所有问题?面向文本到图像提示词优化的类型感知修复分配
来源:https://arxiv.org/html/2607.18724
Haoyue Liu¹, Xiaoyu Ma¹, Ye Chen², Shuguang Cui¹·³, Xiaoying Tang¹·³·† ¹香港中文大学(深圳)理工学院,深圳 518172,中国 ²西安交通大学-米兰理工大学联合学院,西安 710049,中国 ³深圳市未来智能网络研究院(FNii-Shenzhen)
###### 摘要
文本到图像(T2I)生成器常常不能忠实地遵循用户提示,产生错误计数、属性交换、关系模糊以及文字不可读等问题。提示词优化通过重写用户提示来修复此类失败,无需重新训练生成器,并已取得有希望的结果。然而,现有的优化器将异质性的失败吸收到一个统一的提示扩展中,尽管每种失败需要不同的修复语言。我们将语义提示词优化形式化为**原子修复分配**:每个失败的命题被路由到一个类型条件修复操作符,然后将产生的局部约束编译到一个可执行的提示中。我们在免训练的类型感知修复分配(TARA)框架中实例化了这一形式化方法,该框架分离了诊断、分配、编译和语义修复门——一个对恰好的一个指定修复进行接受或回滚的控制器,以防止语义回退。在跨四个冻结生成器的DSG和TIFA基准测试上的大量实验表明,TARA在所有八个基准-生成器单元中取得了最佳语义准确率,在DSG/TIFA上相比VisualPrompter提高了+5.6/+2.6个点,同时保持了图像质量,并在我们匹配的本地设置中运行最快(每个提示16.0秒 vs. 20.0秒)。
²²脚注:通讯作者。
## 1 引言
文本到图像(T2I)生成已成为将语言转化为图像的默认方式(Ho等人,2020(https://arxiv.org/html/2607.18724#bib.bib17);Rombach等人,2022(https://arxiv.org/html/2607.18724#bib.bib31);Black Forest Labs,2024(https://arxiv.org/html/2607.18724#bib.bib1);Chen等人,2025(https://arxiv.org/html/2607.18724#bib.bib4)),但使图像真正满足其提示仍然脆弱:现代生成器经常遗漏一个请求的对象,计数错误,交换属性,混淆关系,或渲染无人可读的文字。因此,提示词优化作为一种实用的补救措施出现,无需重新训练生成器。关键词驱动的重写器,如Promptist(Hao等人,2023(https://arxiv.org/html/2607.18724#bib.bib12))、BeautifulPrompt(Cao等人,2023(https://arxiv.org/html/2607.18724#bib.bib3))、NeuroPrompts(Rosenman等人,2024(https://arxiv.org/html/2607.18724#bib.bib32))和TIPO(Yeh等人,2024(https://arxiv.org/html/2607.18724#bib.bib42))增加了视觉吸引力,而最近的视觉反馈方法,如VisualPrompter(Wu等人,2026(https://arxiv.org/html/2607.18724#bib.bib39))将提示分解为原子命题并使用VLM检测缺失概念,直接针对语义忠实度。
尽管有这些进展,现有优化器有一个不可避免的缺点:**无论何种失败,提示都通过一个单一的统一扩展来修复**。缺少对象、错误计数、破坏的关系和不可读的文字由相同的丰富规则处理,因此修复很少匹配失败;例如,VisualPrompter使用原子反馈来决定*什么*缺失,但在决定*如何*重写时仍然应用大致类型无关的策略。如图1(https://arxiv.org/html/2607.18724#S1.F1)所示,对于一个同时要求计数、属性、布局和可读标志的提示,这种扩展会留下几个错误未解决。值得注意的是,**不同的失败需要不同的修复语言**:缺失的对象必须被突出显示,错误计数需要明确的基数和分离,空间关系需要明确的布局,渲染的文字需要确切的字符串和清晰的字体。在我们的形式化中,统一扩展是一种退化的分配策略,所有失败类型共享一个类型不变的操作符。TARA不是仅用原子类别来描述什么失败了,而是将它们操作化为路由变量,决定每个失败的命题如何被修复。
为了解决上述问题,我们重新思考视觉反馈应如何驱动提示重写,并解决以下核心问题:
*原子视觉反馈是否可以不仅仅用于触发重写,而是将异质性失败路由到专门的修复,并在单次重生成预算下将它们编译成一个可靠的提示?*
因此,我们将语义提示词优化形式化为**原子修复分配**,并用**类型感知修复分配**(TARA)方法实例化它。TARA遵循四个明确的阶段:**诊断**哪些原子命题失败;**分配**每个失败到一个类型条件修复操作符;**编译**将产生的局部约束通过一个纯文本的投资组合与融合步骤编译成一个简洁的可执行提示;以及**采用**仅当语义修复门认为它是可靠替换时才采用单一的修复图像。这一设计分离了现有提示优化器混淆或未加控制的决策:出了什么问题、每个失败应如何修复、异质性的局部修复应如何共存于一个提示中、以及结果是否应替换原始输出。修复预算是一次额外的图像生成,与先前的视觉反馈优化器匹配;TARA不需要特定任务的训练标签、生成器微调或白盒访问,可以在多样化的冻结T2I生成器上即插即用。我们将本文的贡献总结如下:
- 我们将视觉反馈提示词优化形式化为**原子修复分配**。TARA不是仅用原子反馈来触发一个全局扩展,而是将每个失败的命题视为干预单元,并分配给它一个类型条件的局部修复;统一扩展是单操作符的特例。
- 我们通过TARA实例化了这一形式化,TARA是一个免训练框架,在单次重生成预算下将异质性局部修复编译成一个可执行提示,并使用语义修复门防止指定修复引入回退。
- 在DSG和TIFA上,跨四个生成器和三个随机种子,TARA在所有八个基准-生成器单元中领先。其增益在语义类型和独立评估器上一致,而受控消融在匹配的图像预算下隔离了显式类型化扩展分支、修复编译、恢复和采用。
参见图注:图1:类型无关扩展(VisualPrompter,左)与原子修复分配(TARA,右)。一个统一的扩展留下几个细粒度失败未解决,而TARA在相同的单次重生成预算内将每个失败路由到一个类型条件修复。
## 2 TARA
上述讨论激发了提示词优化的四阶段视角:*诊断*失败的原子需求,*分配*一个类型条件操作符给每个失败,*编译*将分配的局部修复编译成一个全局一致的提示,以及*采用*修复后的输出仅当它是可靠的替换。以下小节在没有训练或额外修复图像候选的情况下实例化这四个决策。
### 2.1 概述与问题设置
我们将提示词优化视为单次视觉反馈。设 \(G\) 为一个冻结的文本到图像生成器,\(p\) 为用户提示。遵循DSG(Cho等人,2024(https://arxiv.org/html/2607.18724#bib.bib6)),\(p\) 被分解为原子语义命题 \(Q(p)=\{q_1,\dots,q_n\}\),每个携带一个自然语言验证问题和一个语义类别。一个冻结的VLM判断器 \(V\) 在图像 \(x\) 上回答每个问题,我们定义语义分数
\[
s(x) = \frac{1}{n}\,\bigl\|\{\,i:V(x,q_i)=\textsc{correct}\,\}\bigr\|,
\tag{1}
\]
使用相同的DSG评估器和判断器为每种方法计算,因此所有方法在相同协议下评分。
TARA首先渲染 \(x_0=G(p)\) 并获得诊断 \(d_0\)。设
\[
\begin{aligned}
F_0(x_0,p) &=\{ (q_i,t_i): q_i \text{ is diagnosed as failed on }x_0\}, \\
F &= F_0 \cup \mathcal{R}(d_0), \\
r_i &= \mathcal{A}(q_i,t_i), \\
\hat{p} &= \mathcal{C}\!\left(p,\{r_i\}_{(q_i,t_i)\in F}\right),
\end{aligned}
\tag{2}
\]
其中 \(t_i\) 是诊断的错误类型,\(\mathcal{R}(d_0)\) 恢复修剪后的关系/动作约束用于修复。分配器 \(\mathcal{A}\) 将每个目标映射到一个局部修复约束 \(r_i\),编译器 \(\mathcal{C}\) 通过一个提示实现所有分配的修复。在TARA中,修复操作符是一个固定的局部语言转换规则,而不是一个学习的路由器。统一扩展是类型不变的特例:
\[
\mathcal{A}_{\mathrm{uni}}(q,t) = R_{\mathrm{uni}}(q) \quad \text{for every type } t,
\tag{3}
\]
因此产生的约束可能依赖于失败的命题 \(q\),但修复策略不随其类型 \(t\) 变化。
操作上,TARA (i) 诊断 \(x_0\) 中失败的命题;(ii) 将每个失败分配到一个类型条件修复操作符;(iii) 将产生的局部约束编译成一个优化提示 \(\hat{p}\);(iv) 渲染单一修复图像 \(\hat{x}=G(\hat{p})\),仅当它提高分数时才被采用,否则被丢弃而使用 \(x_0\)。因此TARA最多使用两次图像生成,一次诊断和一次修复,而所有诊断、候选构建、选择和融合都在文本或VLM侧。图2(https://arxiv.org/html/2607.18724#S2.F2)总结了两个阶段(初始诊断,然后类型感知修复与最终门),附录中的算法1(https://arxiv.org/html/2607.18724#alg1)给出了完整过程。
参见图注:图2:TARA概述。它诊断失败的原子命题,分配类型条件修复,将它们编译成一个提示,并仅当语义分数提高时才采用单一修复图像。免训练,最多两次图像生成内。
### 2.2 类型化视觉诊断
遵循DSG(Cho等人,2024(https://arxiv.org/html/2607.18724#bib.bib6)),每个提示被分解为原子命题,VLM判断器将每个命题分配为三种状态之一(*正确*、*缺失*当未生成、或*错误*当生成但不正确),以及一个语义类别(实体、属性、关系、动作、计数、文字、风格或全局)。DSG依赖图修剪无效的下游问题:如果一个实体缺失,关于其属性或关系的问题不计为独立失败。遵循DSG评估协议,一个被修剪的命题在等式(1)的分子中计为零,但保留在分母中,因此TARA和所有基线在相同指标下比较,而不是更宽松的指标。
TARA通过固定的类别到类型表将每个失败的命题映射到一个可修复的错误类型:实体→缺失对象,计数→错误计数,属性→错误属性,关系→错误关系,动作→错误动作,文字→缺失或不可读文字,风格→风格不匹配,全局→全局不匹配。通过这个在所有基准和生成器上共享的固定映射,TARA将诊断出的失败组织成八个可修复的类型,这些类型作为可操作的路由变量。类型决定了修复语言:计数的显式基数和分离,关系的明确空间锚点,动作的可见姿势和接触,文字的精确引号字符串和清晰字体,以及缺失对象的突出前景接地,同时保持已正确的内容不变。这些类型化失败实例化了等式(2)中的基础集合 \(F_0\)。
一个失败的实体修剪其依赖的关系,这可能会使优化器陷入反复添加缺失对象而从不重新描述布局的陷阱。因此TARA*还*将修剪后的关系/动作命题(如果它们本身是错误或缺失的)添加到 \(F\) 中,这样一次重写就可以重新描述缺失对象及其空间关系。这种恢复仅影响修复目标,不影响等式(1)的可比较分数。
### 2.3 类型化修复编译与输出采用
一旦每个失败的命题被分配了一个修复操作符,TARA必须将异质性的局部约束编译成一个全局一致的提示。直接提交到一个重写偏差是脆弱的:保守的编辑可能对缺失概念描述不足,而激进的编辑可能注入无关细节。因此TARA通过一个小的投资组合 \(C\) 实现类型化修复编译,其中包含多个纯文本重写草稿,每个编码了不同的编译偏差:
1. **统一扩展**:一个类型无关的重写,丰富 \(p\) 以使所有失败方面同时被描绘,不包含类型信息——反映了先前优化器的统一扩展偏差,并作为方法内的类型控制。像每个候选一样,它是从恢复的目标 \(F\) 构建的非最终草稿,稍后传递到融合。
2. **类型化扩展**:相同的扩展,但每个失败方面都注释了其错误类型和一个类型特定的修复短语(单词和数字计数、空间锚点、引号清晰文字、动作的姿势和接触)。
3. **最小附加**:几乎逐字保留 \(p\),仅附加修复失败所需的最短具体子句,适用于强生成器,因为完整重写往往偏离原始意图。
当初始图像已经接近正确(\(s(x_0) \ge \tau\),其中 \(\tau = 0.72\)),TARA还额外接受一个**重新播种**候选,保留 \(p\) 不变,允许单次修复生成步骤使用新的随机种子而不是重写的提示——避免对接近正确图像的有害编辑。我们使用 \(\tau=0.72\) 作为接近正确的截止值(大致“大多数命题已经通过”);阈值扫描(附录C.2(https://arxiv.org/html/2607.18724#A3.SS2))显示 \([0.60, 0.84]\) 中的所有值在可比较的图像预算下都给出较大增益,我们保持这个单一的全局 \(\tau\) 固定,而不是按生成器或基准进行调整。因为每个候选是纯文本的,投资组合不增加图像生成。投资组合不是图像级别的候选集:没有草稿被渲染或作为图像评分。相反,它提供了分配的局部修复的互补文本实现,以便它们可以在单次重生成预算下编译成一个提示。
TARA然后通过一个纯文本LLM步骤将投资组合融合成一个优化提示 \(\hat{p}\),其指令强制执行四个原则:保留所有已有的正确语义,修复每个失败的命题,避免无关对象和通用美学填充,并保持简洁。作为实现替代,我们相似文章
TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
TAPR is a lightweight model trained with reinforcement learning to rewrite user prompts into task-optimized prompts, improving downstream LLM performance on benchmarks like Natural Questions and GSM8K.
对比反思用于迭代提示优化
提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。
提示优化为何有效,为何有时无效:基于因果启发的编辑级分析
本文对自动化提示优化进行了基于因果启发的分析,涵盖多种框架、大语言模型和任务,识别出特定编辑类型(如复杂度增加型、元指令型)根据任务特征具有系统的负面或正面效应,从而解释了泛化失败的原因。
PrompTessor
PrompTessor 是一个AI提示词生成器、优化器和库,帮助用户编写有效的提示词。
TIPSv2:以更强的块-文本对齐推进视觉-语言预训练
# 论文页面 - TIPSv2:以更强的块-文本对齐推进视觉-语言预训练 来源:[https://huggingface.co/papers/2604.12012](https://huggingface.co/papers/2604.12012) 发布时间:4 月 13 日 · 提交者 [https://huggingface.co/bingyic](https://huggingface.co/bingyic) [](https://huggingface.co/bingyic) [bingyi](https://huggingface.co/bingyic) 于 4 月 20 日 作者:,,,,,,,,,,,,,,,,,## 摘要