DataEvolver: 文本丰富图像生成的自进化多智能体数据构建
摘要
DataEvolver是一个自进化多智能体框架,利用被拒绝样本的反馈迭代提升文本丰富图像生成的数据质量,在使用PixArt-alpha的TextScenesHQ上实现85.3%的OCR-F1提升,在LongTextBench上实现35.3%的提升。
查看缓存全文
缓存时间: 2026/07/01 11:42
论文页面 - DataEvolver:面向文本丰富图像生成的自进化多智能体数据构建
来源:https://huggingface.co/papers/2606.31537
摘要
DataEvolver 是一个自进化的多智能体框架,通过利用被拒绝样本的反馈来迭代提升数据质量,从而改进文本丰富图像生成。
文本丰富图像生成(https://huggingface.co/papers?q=Text-rich%20image%20generation)是图像生成中最具挑战性的场景之一,因为模型必须同时生成视觉上真实的图像,并呈现清晰可读、语义对齐且布局一致的文本。现有的数据流水线通常遵循静态的“爬取-过滤-冻结”范式:它们收集候选样本,进行一次过滤,然后将接受的数据冻结用于训练。然而,被拒绝的样本通常被丢弃,尽管它们往往包含有用的失败信号,例如OCR错误和语义不匹配。结果,后续的构建轮次可能重复相同的失败模式。为了解决这些局限性,我们提出了 DataEvolver,一个用于文本丰富图像数据构建(https://huggingface.co/papers?q=data%20construction)的自进化多智能体框架(https://huggingface.co/papers?q=multi-agent%20framework)。DataEvolver 将数据构建(https://huggingface.co/papers?q=data%20construction)视为由反馈驱动的构建策略进化。一个检索器收集候选样本,一个验证器分配质量分数和拒绝原因,一个评论家将轮次级别的反馈总结为语义反馈(https://huggingface.co/papers?q=semantic%20feedback),一个生成器通过目标合成来填补覆盖不足的区域。更新后的反馈记忆随后引导下一轮构建。在文本丰富图像生成(https://huggingface.co/papers?q=text-rich%20image%20generation)基准上的实验表明,在匹配的数据预算(https://huggingface.co/papers?q=data%20budget)下,DataEvolver 产生的训练数据比固定数据集基线更有用。在 PixArt-alpha 上以 0.75M 规模,DataEvolver 在 TextScenesHQ 上将 OCR-F1(https://huggingface.co/papers?q=OCR-F1)提升了 85.3%,在 LongTextBench 上提升了 35.3%,均优于最强基线。在两个评估基准上提升一致,并且也迁移到了 Show-o2,这表明 DataEvolver 的优势不依赖于特定的下游生成器(https://huggingface.co/papers?q=downstream%20generator)。这些结果表明,被拒绝的样本可以为改进文本丰富图像数据构建(https://huggingface.co/papers?q=data%20construction)提供可操作的反馈。
查看 arXiv 页面(https://arxiv.org/abs/2606.31537)查看 PDF(https://arxiv.org/pdf/2606.31537)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.31537)
在您的智能体中获取此论文:
hf papers read 2606.31537
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.31537 以在此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
请将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中以在此页面链接它。
相似文章
GenEvolve:通过工具编排的视觉经验蒸馏实现自我进化的图像生成代理
GenEvolve是一个自我进化的图像生成框架,它利用工具编排的轨迹和视觉经验蒸馏来迭代提升生成能力,取得了最先进的性能。
EvoMap/evolver
Evolver 是一个由 GEP 驱动的 AI 代理自演化引擎,可自动化提示词优化并创建可审计、可复用的演化资产。该项目正从完全开源过渡到源代码可用,同时保持与现有 MIT 和 GPL-3.0 版本的向后兼容性。
EvoDS:具备技能学习与上下文管理的自演化自主数据科学智能体
EvoDS 是一款自演化自主数据科学智能体,通过强化学习驱动的技能获取与自适应上下文压缩进行改进,在基准测试上超越开源智能体 28.9%。
CoEvolve:通过智能体-数据互进化训练LLM智能体
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。
DALL·E: 根据文本创建图像
OpenAI 推出 DALL·E,一个具有 120 亿参数的 Transformer 模型,它将文本和图像视为单一令牌流来根据文本描述生成图像。该模型展示了多种功能,包括创建拟人化物体、组合不同的概念、呈现文本和执行图像修复任务。