标签
本文针对稠密检索引入偏差-方差理论,比较共享和双投影,并提出CARS方法,基于训练数据的方向信号估计选择最优几何。
本文提出了一种任务适应性检索方法,用于将自由形式的位置短语映射到人员搜索中的地理实体,采用提示不对称双编码器,提高了相关性,尤其是在非规范查询中,这在生产和基准评估中得到了证实。
本文介绍了一个开放基准测试和一个专门的双编码器模型,用于1C:Enterprise生态系统中的自然语言代码检索,解决了俄语代码搜索领域特定资源的缺乏问题。
本文评估了RAG系统在孟加拉语农业咨询中的检索质量,发现性能因查询类型和语言条件而异,并引入了一个基准数据集,以强调在低资源环境中进行分层评估的必要性。
提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。
UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。
本文介绍了完全开放的DenseOn和LateOn检索模型,这些模型在精心整理的英语数据上训练,并通过translate-train扩展到多语言设置,在其参数规模下实现了最先进的BEIR结果。
一项对检索增强生成范式的受控扩展研究发现,BM25词汇检索在大规模下优于智能体检索和图检索,而智能体搜索仅在小型语料库上领先。
本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。
SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。
本文系统研究了百万token规模下的上下文检索,介绍了BlockSearch——一个0.6B参数的语言模型检索器,并分析了注意力稀释现象。该模型在MS MARCO和NQ等基准测试上达到或超越了密集检索的性能,并在需要不同相似性概念的任务上显著优于密集检索,突显了上下文检索的潜力,同时强调了在极端上下文增长下注意力控制的重要性。
DREAM通过利用自回归语言模型的注意力来监督查询-文档相似度,从而训练密集检索嵌入,无需标注数据。在不同模型规模下,它在BEIR和RTEB基准测试上始终优于基线。
本文识别出长文档稠密检索中的文档侧早期压缩这一失败模式,并引入证据稀释指数(EDI)来衡量该问题。作者提出DICE,一种无需训练的方法,将文档分割成块,独立编码,然后聚合为单一向量,显著改进了长文档的检索效果。
MCompassRAG 通过用主题元数据丰富文本块表示,并利用 LLM 教师蒸馏来增强检索增强生成,在信息效率上平均提升 8.24%,同时延迟比强基线低 5 倍以上。
ECI_sem是一种无需训练的方法,通过使用冻结的嵌入对密集检索中的难负样本源进行排序,在MS MARCO和BEIR基准上取得了强性能。
拥有1.4亿参数的LateOn模型取得了强劲结果,社区对多向量模型的进展感到兴奋,包括新的CPU索引和多语言支持。
该论文提出 Latent Terms 方法,使用稀疏自编码器从冻结的密集检索器中提取BM25就绪的稀疏特征,无需检索特定训练即可实现有竞争力的性能。
CoHyDE提出了一种LLM改写器与稠密编码器的迭代协同训练过程,以提升从大型API目录中的工具检索性能。通过使用InfoNCE和DPO联合训练两个组件,它在模糊查询上显著优于单一组件基线。
Xetrieval 是一个机械性框架,通过用推理信息增强句子嵌入并将其分解为可解释的稀疏特征来解释稠密检索,从而在不进行昂贵自回归生成的情况下提供检索决策的特征级解释。
本文对 Google Embeddings 2 与五个开源模型在多语言稠密检索和 RAG 系统中进行了基准测试,发现 GE2 在准确性上表现最佳但速度较慢,而 mE5-L 作为低延迟的竞争性替代方案。