超越可教知识的搜索:发展智能体视觉生成中的知识边界
摘要
本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。
查看缓存全文
缓存时间: 2026/07/15 16:22
论文页面 - 搜索超越可教范围:演化智能体视觉生成中的知识边界
来源:https://huggingface.co/papers/2607.05382 作者:
,
,
,
,
,
,
,
,
,
摘要
视觉生成器擅长渲染,但会自信地捏造它们不知道的内容。用户请求是无界的、不断演化的,且深度长尾:新角色、流行实体、截止日期后的事件等。这个世界知识瓶颈是结构性的:生成器在固定语料库上训练,但视觉世界是开放式的。我们构建了SearchGen-20K和SearchGen-Bench,包含20,839个提示,涵盖十二个失败类别和二十二个领域,并配有一个预先执行的多模态SearchGen-Corpus-1M,以支持离线、可重复的研究。在SearchGen-Bench上,前沿开放生成器仅得21到28分(满分100),这是现有基准无法发现的40分下降。自然的补救措施是使用搜索工具,实现智能体视觉生成。然而,我们发现简单的搜索会失败:它不加区分地检索,向生成器已经能处理的提示中注入噪声。我们将根本原因追溯到生成器特定的、不断演化的知识边界:生成器通过训练内化的内容与必须保留在外部上下文中的内容之间的分界线。尽管这条边界难以事先指定,但我们表明它可以通过“教然后搜索”的协同训练框架发现。即使是最小版本的这种协同训练方法也能产生单调改进,为视觉生成中的递归自我改进奠定基础,以满足基于世界知识的请求。我们发布完整的数据集、协同训练语料库和搜索语料库,作为工具增强的、基于世界知识的视觉生成的可重放工具。
查看arXiv页面 (https://arxiv.org/abs/2607.05382)查看PDF (https://arxiv.org/pdf/2607.05382)项目页面 (https://haozheh3.github.io/SearchGen/)GitHub6 (https://github.com/HaozheH3/SearchGen)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05382)
在你的智能体中获取此论文:
hf papers read 2607\.05382
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有关联此论文的模型
在模型README.md中引用arxiv.org/abs/2607.05382以从此页面关联。
引用此论文的数据集3
JasperHaozhe/SearchGen-20K 查看器•3天前更新 • 20.2k • 50 • 1 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-20K)
JasperHaozhe/SearchGen-Corpus-1M 查看器•3天前更新 • 1.74M • 32 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Corpus-1M)
JasperHaozhe/SearchGen-Bench 查看器•3天前更新 • 751 • 25 (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Bench)
引用此论文的Space0
没有关联此论文的Space
在Space README.md中引用arxiv.org/abs/2607.05382以从此页面关联。
包含此论文的收藏1
论文页面 (https://huggingface.co/papers?q=Search+Beyond+What+Can+Be+Taught%3A+Evolving+the+Knowledge+Boundary+in+Agentic+Visual+Generation)
相似文章
自我演进的视觉提问器
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
GenEvolve:通过工具编排的视觉经验蒸馏实现自我进化的图像生成代理
GenEvolve是一个自我进化的图像生成框架,它利用工具编排的轨迹和视觉经验蒸馏来迭代提升生成能力,取得了最先进的性能。
EvoBrowseComp:面向演进知识的搜索代理基准测试
本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。
利用知识图谱路径作为自进化搜索代理的中间监督
本文介绍了一种利用知识图谱路径作为中间监督来提升自进化搜索代理性能的方法。该方法通过将问题构建建立在关系上下文之上,并引入航点覆盖奖励(Waypoint Coverage Reward)以实现分级部分奖励,从而解决了搜索自博弈(Search Self-Play)中的瓶颈问题。