标签
ColNanoVDR 引入了首个用于多向量视觉文档检索的无文档查询蒸馏框架,利用最优传输对齐学生与教师的查询嵌入,实现更快的编码同时保持高性能。
介绍了生成式后期交互嵌入(GLIE),用于压缩视觉文档检索向量,通过按需重新生成完整嵌入来提高存储约束下的准确性。
EVIE-Preview-4.5B 是一款来自Tencent的最先进的多语言视觉文档检索模型,采用ColBERT风格的晚期交互,在ViDoRe基准测试中表现领先,使用128维的token嵌入。
ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。
DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.
Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。
本文提供了使用 Sentence Transformers 库训练和微调多模态 Embedding 与 Reranker 模型的技术指南,展示了在基于 Qwen3-VL 的视觉文档检索任务上的性能提升。