稠密检索何时需要非对称几何?共享与双投影的偏差-方差理论

Hugging Face Daily Papers 论文

摘要

本文针对稠密检索引入偏差-方差理论,比较共享和双投影,并提出CARS方法,基于训练数据的方向信号估计选择最优几何。

稠密检索驱动检索增强生成、语义搜索和问答,但在选择共享与双查询-文档投影时,理论基础仍不明确。我们引入了针对低秩双线性评分的偏差-方差理论。共享投影诱导正半定算子,而双投影实现任意低秩算子。我们推导出它们精确的近似差距,并证明了一个局部高斯边界:当平方方向信号超过其额外自由度的估计成本时,双投影的风险更低。这一边界促成了交叉拟合非对称风险选择器(CARS),它从训练对中估计可复现的方向信号;其高斯对应物允许精确的选择功效和遗憾公式。在理论的指导下,我们在多个数据集和嵌入模型上运行检索实验。当查询旋转从0度增加到90度时,平均双投影减共享投影的NDCG@10优势增加一倍以上。在秩-样本大小网格中,当n=32时,共享投影在16个单元中赢了13个,而当n=1024和n=2048时,双投影赢了所有32个单元。与这一转变一致,随着训练数据增长,所有168个可比算子风险曲线都向双投影移动。与两个固定几何基线相比,CARS将留出遗憾减少了49-96%,并达到了90.1%的平均几何选择准确率。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:20

论文页面 - 稀疏检索何时需要非对称投影?基于偏差-方差理论的共享与双投影分析

来源:https://huggingface.co/papers/2609.32488

摘要

稀疏检索是检索增强生成、语义搜索和问答系统的核心技术,但目前在选择共享投影与双投影策略时,理论依据仍不明确。本文提出了一种针对低秩双线性评分的偏差-方差理论框架:共享投影对应正半定算子结构,而双投影可实现任意低秩算子。我们推导出两者的精确近似间隙,并证明存在局部高斯边界——当信号方向平方分量超过其额外自由度的估计代价时,双投影风险更低。基于该理论,我们设计了交叉拟合非对称风险选择器(CARS),能够从训练样本对中估计可复现的方向信号;其高斯近似版本具有精确的选择功效与遗憾公式。理论指导下的跨数据集和嵌入模型检索实验表明:当查询旋转角度从0度增至90度时,双投影相对共享投影的NDCG@10平均优势提升超过一倍;在秩-样本规模矩阵中,n=32时共享投影在16个单元格中胜出13次,而n=1024和2048时双投影在全部32个单元格中均占优;与此趋势一致,随着训练数据增长,所有168条可比算子的风险曲线均向双投影方向迁移。与两种固定几何基线相比,CARS将留外遗憾降低49-96%,并达到90.1%的平均几何选择准确率。

查看arXiv页面 (https://arxiv.org/abs/2609.32488) 查看PDF (https://arxiv.org/pdf/2609.32488) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.32488)

通过智能助手获取本文: hf papers read 2609.32488 尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用 arxiv.org/abs/2609.32488 以从此页面建立链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2609.32488 以从此页面建立链接。

引用本文的交互空间0

无交互空间链接本文

在交互空间README.md中引用 arxiv.org/abs/2609.32488 以从此页面建立链接。

包含本文的收藏集0

无收藏集包含本文

将本文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面建立链接。

相似文章

语言模型语义空间中的关系几何

arXiv cs.CL

本文探讨了语义关系如何编码在语言模型语义空间的几何结构中,发现非对称关系占据不同区域,且对于因果模型,词汇信息更为重要,而对于掩码和扩散模型,上下文信息更为重要。

损失不足:对比表示学习中的采样条件与归纳偏置

arXiv cs.LG

本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。

RADAR:表征间的相对角度散度

arXiv cs.LG

RADAR是一种基于几何的度量,通过分析表征的逐层角度与距离变化,并利用域内与跨域轨迹分布之间的KL散度,来估计基础模型中的跨领域可迁移性。