@perdactor: 1/ 介绍 Argus-Retriever:首个采用延迟交互的视觉文档检索器,其文档表示会根据查询自适应调整……
摘要
Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。
查看缓存全文
缓存时间: 2026/06/08 07:18
1/👁️ 认识 Argus-Retriever:首个采用后交互机制的视觉文档检索器,其文档表示会根据查询动态调整:D(q)。
- 在 ViDoRe V1+V2 上达到 86.0 NDCG@5(当前最优开源模型)
- 📦 使用 1024 维头部,索引体积缩小 4.5 倍
Sumit (@_reachsumit): Argus-Retriever:基于视觉大语言模型的后交互检索,结合区域感知查询条件混合专家模型,用于视觉文档检索。
提出了一种查询条件化的后交互视觉文档检索器。
📝 https://t.co/oB5oa4bgKc 👨🏽💻
1/ 认识 Argus-Retriever:首个采用后交互机制的视觉文档检索器,其文档表示会根据查询动态调整:D(q)。
- 在 ViDoRe V1+V2 上达到 86.0 NDCG@5(当前最优开源模型)
- 📦 使用 1024 维头部,索引体积缩小 4.5 倍
2/ 核心思路:在文档编码器中引入区域感知的混合专家模型。 路由器会读取每个区域的内容、其二维坐标,以及池化后的查询上下文 z_q,然后混合 4 个专家网络(另加 1 个共享专家)。 此时,页面会根据不同查询进行差异化编码 → 得到 D(q)。仍使用 MaxSim 相似度计算。
相似文章
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation
DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.
VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
@Julian_a42f9a:后期交互检索模型的表示已超越检索本身,可直接用于RAG
新论文表明,后期交互检索模型的表示可替代原始文档文本,在RAG任务中拓展其应用边界。
@vicky_grok:https://x.com/vicky_grok/status/2092448354815099378
本文深入探讨了检索增强生成(RAG)和向量搜索,基于10万份文档的基准测试,展示了精确搜索与IVF索引在速度和召回率之间的权衡。
@mixedbreadai: https://x.com/mixedbreadai/status/2071678747439505816
Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。