编织视觉叙事:超越原子级视觉匹配的智能体图像包组合
摘要
本文介绍了图像包组合(IBC),将图像检索从原子级匹配转向连贯图像包的动态组合,以解决传统方法的局限性。它提出了基准数据集 IBCBench 和智能体框架 BundleWeaver,该框架利用大型语言模型(LLMs)和视觉语言模型(VLMs)进行关系组合。
查看缓存全文
缓存时间: 2026/09/01 11:47
论文页面 - 编织视觉叙事:超越原子视觉匹配的智能图像捆绑合成
来源:https://huggingface.co/papers/2608.28695 作者:
,
,
,
,
,
,
,
,
,
,
摘要
图像捆绑合成将检索重构为关系连贯图像组的动态组装过程,并提供了基准测试和智能框架来解决组合联合相关性问题。
图像检索传统上被建模为逐点匹配问题,即每个候选图像被孤立地评分。然而,这种原子范式未能捕捉个人照片库中人类搜索意图的复杂性——用户通常寻求由结构关系联结的紧凑视觉故事,而非孤立的快照。为解决这一局限,我们引入了图像捆绑合成 (https://huggingface.co/papers?q=Image%20Bundle%20Composition) (IBC) 这一新范式,将目标从排序单个图像转变为从海量无结构照片池中动态组装连贯的图像捆绑。由于目标捆绑并非预先定义,IBC 呈现出严重的组合爆炸挑战,并要求建模不可分解的联合相关性。为确立此范式,我们构建了 IBCBench (https://huggingface.co/papers?q=IBCBench),这是首个包含 109,467 张图像和 667 个经验证查询的 IBC 基准数据集,通过半自动化验证流水线构建。此外,我们提出了 BundleWeaver (https://huggingface.co/papers?q=BundleWeaver),一个将 IBC 重构为查询条件的增量超边发现 (https://huggingface.co/papers?q=hyperedge%20discovery) 的智能框架。通过采用大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Model) 自适应搜索缺失的关系角色,并利用视觉-语言模型 (https://huggingface.co/papers?q=Vision-Language%20Model) 进行整体捆绑验证,BundleWeaver (https://huggingface.co/papers?q=BundleWeaver) 有效地导航了组合空间。大量实验表明,尽管最先进的嵌入模型和静态分解-重排范式受困于关系盲区,BundleWeaver (https://huggingface.co/papers?q=BundleWeaver) 实现了显著的性能提升,凸显了从原子评分转向动态关系合成 (https://huggingface.co/papers?q=relational%20composition) 的必要性。我们的数据集和代码已发布。
查看 arXiv 页面 (https://arxiv.org/abs/2608.28695)查看 PDF (https://arxiv.org/pdf/2608.28695)GitHub2 (https://github.com/LaVieEnRose365/Image-Bundle-Composition)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.28695)
通过您的智能体获取此论文:
hf papers read 2608\.28695
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.28695 以从此页面链接。
引用此论文的数据集1
CyberDancer/IBCBench 查看器• 更新于约 6 小时前 • 667 • 51 (https://huggingface.co/datasets/CyberDancer/IBCBench)
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.28695 以从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
对应用地球观测中组合图像检索的基准测试
本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。
InterLV-Search:交织多模态智能体搜索基准测试
InterLV-Search 是本文提出的一项新基准,旨在评估交织的语言-视觉智能体搜索能力,凸显了当前系统在视觉证据搜集和多模态融合方面的局限性。
Qwen-Image-Agent:弥合真实图像生成中的上下文差距
Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
镜头思考:基于智能推理的一致性多镜头视频编辑
本文介绍了一种结合LLMs和VLMs的智能框架,用于跨多个镜头的一致性多指令视频编辑,并提出了MMLVE任务和基准来评估性能。