超越可教知识的搜索:发展智能体视觉生成中的知识边界

Hugging Face Daily Papers 论文

摘要

本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。

视觉生成器擅长渲染,但会自信地编造它们不知道的内容。用户请求是无边界的、不断演化的且深度长尾的:新角色、流行实体、训练数据截止日期后的事件等等。这种世界知识瓶颈是结构性的:生成器在固定语料库上训练,但视觉世界是开放式的。我们构建了SearchGen-20K和SearchGen-Bench,包含20,839条提示,覆盖12个失败类别和22个领域,并配以预执行的多模态SearchGen-Corpus-1M语料库,以支持离线、可重复的研究。在SearchGen-Bench上,前沿开放生成器的得分仅为21到28分(满分100分),比现有基准下降了40分,而现有基准无法察觉这一下降。自然的补救方法是使用搜索工具,实现智能体视觉生成。然而,我们发现简单的搜索会失效:它不加区分地检索,将噪声注入到生成器已能处理的提示中。我们将根本原因归结为生成器特定的、不断演化的知识边界:即生成器通过训练可以内化的知识与必须保留在外部上下文中的知识之间的分界线。虽然这个边界很难提前指定,但我们证明它可以通过先教后搜索的协同训练框架发现。即使是这种协同训练方法的最小版本也能产生单调改进,为视觉生成中的递归自我改进奠定基础,从而满足基于世界知识的请求。我们发布了完整的数据集、协同训练语料库和搜索语料库,作为工具增强的、基于世界知识的视觉生成的可重放框架。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:22

论文页面 - 搜索超越可教范围:演化智能体视觉生成中的知识边界

来源:https://huggingface.co/papers/2607.05382 作者:

摘要

视觉生成器擅长渲染,但会自信地捏造它们不知道的内容。用户请求是无界的、不断演化的,且深度长尾:新角色、流行实体、截止日期后的事件等。这个世界知识瓶颈是结构性的:生成器在固定语料库上训练,但视觉世界是开放式的。我们构建了SearchGen-20K和SearchGen-Bench,包含20,839个提示,涵盖十二个失败类别和二十二个领域,并配有一个预先执行的多模态SearchGen-Corpus-1M,以支持离线、可重复的研究。在SearchGen-Bench上,前沿开放生成器仅得21到28分(满分100),这是现有基准无法发现的40分下降。自然的补救措施是使用搜索工具,实现智能体视觉生成。然而,我们发现简单的搜索会失败:它不加区分地检索,向生成器已经能处理的提示中注入噪声。我们将根本原因追溯到生成器特定的、不断演化的知识边界:生成器通过训练内化的内容与必须保留在外部上下文中的内容之间的分界线。尽管这条边界难以事先指定,但我们表明它可以通过“教然后搜索”的协同训练框架发现。即使是最小版本的这种协同训练方法也能产生单调改进,为视觉生成中的递归自我改进奠定基础,以满足基于世界知识的请求。我们发布完整的数据集、协同训练语料库和搜索语料库,作为工具增强的、基于世界知识的视觉生成的可重放工具。

查看arXiv页面 (https://arxiv.org/abs/2607.05382)查看PDF (https://arxiv.org/pdf/2607.05382)项目页面 (https://haozheh3.github.io/SearchGen/)GitHub6 (https://github.com/HaozheH3/SearchGen)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05382)

在你的智能体中获取此论文:

hf papers read 2607\.05382

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有关联此论文的模型

在模型README.md中引用arxiv.org/abs/2607.05382以从此页面关联。

引用此论文的数据集3

JasperHaozhe/SearchGen-20K 查看器•3天前更新 • 20.2k • 50 • 1 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-20K)

JasperHaozhe/SearchGen-Corpus-1M 查看器•3天前更新 • 1.74M • 32 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Corpus-1M)

JasperHaozhe/SearchGen-Bench 查看器•3天前更新 • 751 • 25 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Bench)

引用此论文的Space0

没有关联此论文的Space

在Space README.md中引用arxiv.org/abs/2607.05382以从此页面关联。

包含此论文的收藏1

论文页面 (https://huggingface.co/papers?q=Search+Beyond+What+Can+Be+Taught%3A+Evolving+the+Knowledge+Boundary+in+Agentic+Visual+Generation)

相似文章

自我演进的视觉提问器

Hugging Face Daily Papers

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

EvoBrowseComp:面向演进知识的搜索代理基准测试

arXiv cs.CL

本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。

利用知识图谱路径作为自进化搜索代理的中间监督

arXiv cs.AI

本文介绍了一种利用知识图谱路径作为中间监督来提升自进化搜索代理性能的方法。该方法通过将问题构建建立在关系上下文之上,并引入航点覆盖奖励(Waypoint Coverage Reward)以实现分级部分奖励,从而解决了搜索自博弈(Search Self-Play)中的瓶颈问题。