dense-retrieval

标签

Cards List
#dense-retrieval

稠密检索何时需要非对称几何?共享与双投影的偏差-方差理论

Hugging Face Daily Papers ↗ · 4天前 缓存

本文针对稠密检索引入偏差-方差理论,比较共享和双投影,并提出CARS方法,基于训练数据的方向信号估计选择最优几何。

0 人收藏 0 人点赞
#dense-retrieval

从位置短语到地理实体:人员搜索中的任务适应性检索

arXiv cs.AI ↗ · 2026-09-01 缓存

本文提出了一种任务适应性检索方法,用于将自由形式的位置短语映射到人员搜索中的地理实体,采用提示不对称双编码器,提高了相关性,尤其是在非规范查询中,这在生产和基准评估中得到了证实。

0 人收藏 0 人点赞
#dense-retrieval

1C:Enterprise 的自然语言代码检索:一个开放基准测试与高效双编码器

arXiv cs.CL ↗ · 2026-08-21 缓存

本文介绍了一个开放基准测试和一个专门的双编码器模型,用于1C:Enterprise生态系统中的自然语言代码检索,解决了俄语代码搜索领域特定资源的缺乏问题。

0 人收藏 0 人点赞
#dense-retrieval

检索失败在哪里?评估农业咨询中的RAG架构

arXiv cs.CL ↗ · 2026-08-18 缓存

本文评估了RAG系统在孟加拉语农业咨询中的检索质量,发现性能因查询类型和语言条件而异,并引入了一个基准数据集,以强调在低资源环境中进行分层评估的必要性。

0 人收藏 0 人点赞
#dense-retrieval

密集检索的检索锚定潜在推理

arXiv cs.AI ↗ · 2026-08-17 缓存

提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。

0 人收藏 0 人点赞
#dense-retrieval

UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。

0 人收藏 0 人点赞
#dense-retrieval

DenseOn与LateOn:面向多语言、长上下文和代码搜索的完全开放密集与延迟交互模型

arXiv cs.CL ↗ · 2026-07-30 缓存

本文介绍了完全开放的DenseOn和LateOn检索模型,这些模型在精心整理的英语数据上训练,并通过translate-train扩展到多语言设置,在其参数规模下实现了最先进的BEIR结果。

0 人收藏 0 人点赞
#dense-retrieval

BM25在大规模下胜出:检索增强生成范式的规模扩展研究

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

一项对检索增强生成范式的受控扩展研究发现,BM25词汇检索在大规模下优于智能体检索和图检索,而智能体搜索仅在小型语料库上领先。

0 人收藏 0 人点赞
#dense-retrieval

UZH Shared Task 2026中的LLM-INSTRUCT:用于段落级论点挖掘的约束感知检索与选择性辩论

arXiv cs.CL ↗ · 2026-07-24 缓存

本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。

0 人收藏 0 人点赞
#dense-retrieval

SkillSight: 透过共享描述实现准确技能检索

arXiv cs.AI ↗ · 2026-07-22 缓存

SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。

0 人收藏 0 人点赞
#dense-retrieval

语言模型真的能进行上下文检索吗?在百万token规模的文档中挣扎

arXiv cs.CL ↗ · 2026-07-03 缓存

本文系统研究了百万token规模下的上下文检索,介绍了BlockSearch——一个0.6B参数的语言模型检索器,并分析了注意力稀释现象。该模型在MS MARCO和NQ等基准测试上达到或超越了密集检索的性能,并在需要不同相似性概念的任务上显著优于密集检索,突显了上下文检索的潜力,同时强调了在极端上下文增长下注意力控制的重要性。

0 人收藏 0 人点赞
#dense-retrieval

DREAM:通过自回归建模实现密集检索嵌入

Hugging Face Daily Papers ↗ · 2026-06-23 缓存

DREAM通过利用自回归语言模型的注意力来监督查询-文档相似度,从而训练密集检索嵌入,无需标注数据。在不同模型规模下,它在BEIR和RTEB基准测试上始终优于基线。

0 人收藏 0 人点赞
#dense-retrieval

迷失于单一向量:通过分块证据聚合改进长文档检索

arXiv cs.CL ↗ · 2026-06-18 缓存

本文识别出长文档稠密检索中的文档侧早期压缩这一失败模式,并引入证据稀释指数(EDI)来衡量该问题。作者提出DICE,一种无需训练的方法,将文档分割成块,独立编码,然后聚合为单一向量,显著改进了长文档的检索效果。

0 人收藏 0 人点赞
#dense-retrieval

MCompassRAG:主题元数据作为段落级检索的语义指南针

arXiv cs.CL ↗ · 2026-06-18 缓存

MCompassRAG 通过用主题元数据丰富文本块表示,并利用 LLM 教师蒸馏来增强检索增强生成,在信息效率上平均提升 8.24%,同时延迟比强基线低 5 倍以上。

0 人收藏 0 人点赞
#dense-retrieval

ECI_{sem}: 语义残差有效对比信息用于评估难负样本

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

ECI_sem是一种无需训练的方法,通过使用冻结的嵌入对密集检索中的难负样本源进行排序,在MS MARCO和BEIR基准上取得了强性能。

0 人收藏 0 人点赞
#dense-retrieval

@raphaelsrty: 我们的LateOn模型以1.4亿参数取得了强劲结果。与LateOn无关,我对正…

X AI KOLs Following ↗ · 2026-05-30 缓存

拥有1.4亿参数的LateOn模型取得了强劲结果,社区对多向量模型的进展感到兴奋,包括新的CPU索引和多语言支持。

0 人收藏 0 人点赞
#dense-retrieval

@_reachsumit: Latent Terms: 密集检索器包含可轻松提取的BM25就绪齐普夫词汇表 @bclavie 等人提取中…

X AI KOLs Following ↗ · 2026-05-29 缓存

该论文提出 Latent Terms 方法,使用稀疏自编码器从冻结的密集检索器中提取BM25就绪的稀疏特征,无需检索特定训练即可实现有竞争力的性能。

0 人收藏 0 人点赞
#dense-retrieval

CoHyDE:面向工具检索的LLM改写器与稠密编码器迭代协同训练

arXiv cs.AI ↗ · 2026-05-29 缓存

CoHyDE提出了一种LLM改写器与稠密编码器的迭代协同训练过程,以提升从大型API目录中的工具检索性能。通过使用InfoNCE和DPO联合训练两个组件,它在模糊查询上显著优于单一组件基线。

0 人收藏 0 人点赞
#dense-retrieval

Xetrieval: 稠密检索的机械性解释

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

Xetrieval 是一个机械性框架,通过用推理信息增强句子嵌入并将其分解为可解释的稀疏特征来解释稠密检索,从而在不进行昂贵自回归生成的情况下提供检索决策的特征级解释。

0 人收藏 0 人点赞
#dense-retrieval

对 Google Embeddings 2 与开源模型在多语言稠密检索和 RAG 系统中的基准测试

arXiv cs.CL ↗ · 2026-05-25 缓存

本文对 Google Embeddings 2 与五个开源模型在多语言稠密检索和 RAG 系统中进行了基准测试,发现 GE2 在准确性上表现最佳但速度较慢,而 mE5-L 作为低延迟的竞争性替代方案。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈