DataEvolver: 文本丰富图像生成的自进化多智能体数据构建

Hugging Face Daily Papers 论文

摘要

DataEvolver是一个自进化多智能体框架,利用被拒绝样本的反馈迭代提升文本丰富图像生成的数据质量,在使用PixArt-alpha的TextScenesHQ上实现85.3%的OCR-F1提升,在LongTextBench上实现35.3%的提升。

文本丰富图像生成是图像生成中最具挑战性的场景之一,因为模型必须同时生成视觉逼真的图像和清晰可读、语义对齐且布局一致的文本。现有的数据管线通常遵循静态的爬取-过滤-冻结范式:收集候选样本,进行一次过滤,然后冻结接受的样本用于训练。然而,被拒绝的样本通常被丢弃,尽管它们往往包含有用的失败信号,如OCR错误和语义不匹配。结果,后续的构建轮次可能重复相同的失败模式。为解决这些局限,我们提出DataEvolver,一个用于文本丰富图像数据构建的自进化多智能体框架。DataEvolver将数据构建视为反馈驱动的构建策略进化:检索器收集候选样本,验证器分配质量分数和拒绝原因,评论器将轮次级反馈总结为语义反馈,生成器通过定向合成补充覆盖不足的区域。更新后的反馈记忆再指导下一轮构建。在文本丰富图像生成基准上的实验表明,在匹配的数据预算下,DataEvolver比固定数据集基线产生更有用的训练数据。在PixArt-alpha的0.75M规模上,DataEvolver在TextScenesHQ上将OCR-F1相比最强基线提升85.3%,在LongTextBench上提升35.3%。这些改进在两个评估基准上一致,并且也迁移到Show-o2,表明DataEvolver的优势不依赖于单一的下游生成器。这些结果说明,被拒绝的样本可以为改进文本丰富图像数据构建提供可操作的反馈。
查看原文
查看缓存全文

缓存时间: 2026/07/01 11:42

论文页面 - DataEvolver:面向文本丰富图像生成的自进化多智能体数据构建

来源:https://huggingface.co/papers/2606.31537

摘要

DataEvolver 是一个自进化的多智能体框架,通过利用被拒绝样本的反馈来迭代提升数据质量,从而改进文本丰富图像生成。

文本丰富图像生成(https://huggingface.co/papers?q=Text-rich%20image%20generation)是图像生成中最具挑战性的场景之一,因为模型必须同时生成视觉上真实的图像,并呈现清晰可读、语义对齐且布局一致的文本。现有的数据流水线通常遵循静态的“爬取-过滤-冻结”范式:它们收集候选样本,进行一次过滤,然后将接受的数据冻结用于训练。然而,被拒绝的样本通常被丢弃,尽管它们往往包含有用的失败信号,例如OCR错误和语义不匹配。结果,后续的构建轮次可能重复相同的失败模式。为了解决这些局限性,我们提出了 DataEvolver,一个用于文本丰富图像数据构建(https://huggingface.co/papers?q=data%20construction)的自进化多智能体框架(https://huggingface.co/papers?q=multi-agent%20framework)。DataEvolver 将数据构建(https://huggingface.co/papers?q=data%20construction)视为由反馈驱动的构建策略进化。一个检索器收集候选样本,一个验证器分配质量分数和拒绝原因,一个评论家将轮次级别的反馈总结为语义反馈(https://huggingface.co/papers?q=semantic%20feedback),一个生成器通过目标合成来填补覆盖不足的区域。更新后的反馈记忆随后引导下一轮构建。在文本丰富图像生成(https://huggingface.co/papers?q=text-rich%20image%20generation)基准上的实验表明,在匹配的数据预算(https://huggingface.co/papers?q=data%20budget)下,DataEvolver 产生的训练数据比固定数据集基线更有用。在 PixArt-alpha 上以 0.75M 规模,DataEvolver 在 TextScenesHQ 上将 OCR-F1(https://huggingface.co/papers?q=OCR-F1)提升了 85.3%,在 LongTextBench 上提升了 35.3%,均优于最强基线。在两个评估基准上提升一致,并且也迁移到了 Show-o2,这表明 DataEvolver 的优势不依赖于特定的下游生成器(https://huggingface.co/papers?q=downstream%20generator)。这些结果表明,被拒绝的样本可以为改进文本丰富图像数据构建(https://huggingface.co/papers?q=data%20construction)提供可操作的反馈。

查看 arXiv 页面(https://arxiv.org/abs/2606.31537)查看 PDF(https://arxiv.org/pdf/2606.31537)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.31537)

在您的智能体中获取此论文:

hf papers read 2606.31537

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

请将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中以在此页面链接它。

相似文章

EvoMap/evolver

GitHub Trending (daily)

Evolver 是一个由 GEP 驱动的 AI 代理自演化引擎,可自动化提示词优化并创建可审计、可复用的演化资产。该项目正从完全开源过渡到源代码可用,同时保持与现有 MIT 和 GPL-3.0 版本的向后兼容性。

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。

DALL·E: 根据文本创建图像

OpenAI Blog

OpenAI 推出 DALL·E,一个具有 120 亿参数的 Transformer 模型,它将文本和图像视为单一令牌流来根据文本描述生成图像。该模型展示了多种功能,包括创建拟人化物体、组合不同的概念、呈现文本和执行图像修复任务。