@perdactor: 1/ 介绍 Argus-Retriever:首个采用延迟交互的视觉文档检索器,其文档表示会根据查询自适应调整……

X AI KOLs Following 模型

摘要

Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。

1/👁️ 认识 Argus-Retriever:首个延迟交互视觉文档检索器,其文档表示会根据查询自适应调整:D(q)。 - 在 ViDoRe V1+V2 上获得 86.0 NDCG@5(SOTA 开源模型) - 📦 1024 维头部,索引缩小 4.5 倍
查看原文
查看缓存全文

缓存时间: 2026/06/08 07:18

1/👁️ 认识 Argus-Retriever:首个采用后交互机制的视觉文档检索器,其文档表示会根据查询动态调整:D(q)。

  • 在 ViDoRe V1+V2 上达到 86.0 NDCG@5(当前最优开源模型)
  • 📦 使用 1024 维头部,索引体积缩小 4.5 倍

Sumit (@_reachsumit): Argus-Retriever:基于视觉大语言模型的后交互检索,结合区域感知查询条件混合专家模型,用于视觉文档检索。

提出了一种查询条件化的后交互视觉文档检索器。

📝 https://t.co/oB5oa4bgKc 👨🏽💻

1/ 认识 Argus-Retriever:首个采用后交互机制的视觉文档检索器,其文档表示会根据查询动态调整:D(q)。

  • 在 ViDoRe V1+V2 上达到 86.0 NDCG@5(当前最优开源模型)
  • 📦 使用 1024 维头部,索引体积缩小 4.5 倍

2/ 核心思路:在文档编码器中引入区域感知的混合专家模型。 路由器会读取每个区域的内容、其二维坐标,以及池化后的查询上下文 z_q,然后混合 4 个专家网络(另加 1 个共享专家)。 此时,页面会根据不同查询进行差异化编码 → 得到 D(q)。仍使用 MaxSim 相似度计算。

相似文章

@mixedbreadai: https://x.com/mixedbreadai/status/2071678747439505816

X AI KOLs Following

Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。