编织视觉叙事:超越原子级视觉匹配的智能体图像包组合

Hugging Face Daily Papers 论文

摘要

本文介绍了图像包组合(IBC),将图像检索从原子级匹配转向连贯图像包的动态组合,以解决传统方法的局限性。它提出了基准数据集 IBCBench 和智能体框架 BundleWeaver,该框架利用大型语言模型(LLMs)和视觉语言模型(VLMs)进行关系组合。

图像检索传统上被表述为一个点对点匹配问题,其中每个候选图像都被单独评分。然而,这种原子级范式未能捕捉个人照片集中人类搜索意图的复杂性,用户通常寻求由结构关系绑定的紧凑视觉故事,而非孤立的快照。为解决此局限性,我们引入了**图像包组合(IBC)**,这是一种新颖的范式,将目标从对单个图像进行排名转向从大量非结构化照片库中动态组合连贯的图像包。由于目标包未预先定义,IBC 提出了严重的组合爆炸挑战,并要求对不可分解的联合相关性进行建模。为建立此范式,我们构建了**IBCBench**,首个包含109,467张图像和667个验证查询的IBC基准数据集,通过半自动化验证流程构建。此外,我们提出了**BundleWeaver**,一个智能体框架,将IBC重新表述为查询条件下的增量超边发现。通过使用大型语言模型(LLM)自适应搜索缺失的关系角色,并利用视觉语言模型(VLM)进行整个包的验证,BundleWeaver 有效导航了组合空间。大量实验表明,虽然最先进的嵌入模型和静态分解-重排范式存在关系盲点,但 BundleWeaver 实现了显著的性能提升,突显了从原子级评分转向动态关系组合的必要性。我们的数据集和代码已可用。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:47

论文页面 - 编织视觉叙事:超越原子视觉匹配的智能图像捆绑合成

来源:https://huggingface.co/papers/2608.28695 作者:

,

,

,

,

,

,

,

,

,

,

摘要

图像捆绑合成将检索重构为关系连贯图像组的动态组装过程,并提供了基准测试和智能框架来解决组合联合相关性问题。

图像检索传统上被建模为逐点匹配问题,即每个候选图像被孤立地评分。然而,这种原子范式未能捕捉个人照片库中人类搜索意图的复杂性——用户通常寻求由结构关系联结的紧凑视觉故事,而非孤立的快照。为解决这一局限,我们引入了图像捆绑合成 (https://huggingface.co/papers?q=Image%20Bundle%20Composition) (IBC) 这一新范式,将目标从排序单个图像转变为从海量无结构照片池中动态组装连贯的图像捆绑。由于目标捆绑并非预先定义,IBC 呈现出严重的组合爆炸挑战,并要求建模不可分解的联合相关性。为确立此范式,我们构建了 IBCBench (https://huggingface.co/papers?q=IBCBench),这是首个包含 109,467 张图像和 667 个经验证查询的 IBC 基准数据集,通过半自动化验证流水线构建。此外,我们提出了 BundleWeaver (https://huggingface.co/papers?q=BundleWeaver),一个将 IBC 重构为查询条件的增量超边发现 (https://huggingface.co/papers?q=hyperedge%20discovery) 的智能框架。通过采用大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Model) 自适应搜索缺失的关系角色,并利用视觉-语言模型 (https://huggingface.co/papers?q=Vision-Language%20Model) 进行整体捆绑验证,BundleWeaver (https://huggingface.co/papers?q=BundleWeaver) 有效地导航了组合空间。大量实验表明,尽管最先进的嵌入模型和静态分解-重排范式受困于关系盲区,BundleWeaver (https://huggingface.co/papers?q=BundleWeaver) 实现了显著的性能提升,凸显了从原子评分转向动态关系合成 (https://huggingface.co/papers?q=relational%20composition) 的必要性。我们的数据集和代码已发布。

查看 arXiv 页面 (https://arxiv.org/abs/2608.28695)查看 PDF (https://arxiv.org/pdf/2608.28695)GitHub2 (https://github.com/LaVieEnRose365/Image-Bundle-Composition)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.28695)

通过您的智能体获取此论文:

hf papers read 2608\.28695

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.28695 以从此页面链接。

引用此论文的数据集1

CyberDancer/IBCBench 查看器• 更新于约 6 小时前 • 667 • 51 (https://huggingface.co/datasets/CyberDancer/IBCBench)

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.28695 以从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

对应用地球观测中组合图像检索的基准测试

Hugging Face Daily Papers

本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。

Qwen-Image-Agent:弥合真实图像生成中的上下文差距

Hugging Face Daily Papers

Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。