使用合成查询探测比较嵌入模型 [R]

Reddit r/MachineLearning 论文

摘要

作者提出了合成查询探测(Synthetic Query Probing),这是一种简单而有效的方法,通过比较不同嵌入模型之间的相似度匹配分数,而非原始嵌入空间,来比较不同的嵌入模型。论文展示了如Ada和Titan等模型之间的非线性关系,为更换嵌入模型和设定检索阈值提供了实用指导。

假设你想更换你的嵌入模型,例如从 ADA 换成 Titan。这些嵌入模型具有可比性吗?相似度分数范围之间如何比较?在进行检索时,最小匹配阈值应该设置在哪里?或者从研究的角度来看,我们如何更好地关联并从根本上理解这些嵌入空间?这正是我们旨在通过合成查询探测(Synthetic Query Probing)解决的问题,这是一个听起来花哨的名字,本质上(而且有意地)是一种非常简单的方法:根据定义,嵌入空间不能直接比较,因此改为比较相似度空间,即比较多个嵌入模型上内容对(例如合成问题与文本块)的相似度匹配分数。例如,不同维度的 Titan 模型的相似度分数是相关的,而 Titan 与 Ada 分数之间的关系是非线性的,且范围不同,见图。https://preview.redd.it/eauhd4hdyiih1.png?width=4767&format=png&auto=webp&s=e424c836c48962928d9505cf747e7cd9fb0b719f 参见 https://arxiv.org/pdf/2608.05857, Marcin Rozmus and Peter van der Putten. Similarity Spaces across Embedding Models with Synthetic Query Probing. Discovery Science 2026, October 5-9, 2026, Mainz, Germany
查看原文

相似文章

Mapping Similarity Spaces across Embedding Models with Synthetic Query Probing

arXiv cs.CL

Introduces Synthetic Query Probing (SQP), a reference-free method for learning mappings between similarity score distributions across embedding models, enabling threshold portability in RAG systems. Experiments show systematic score distortions and isotonic regression as the best calibration approach.

如何分析探针的相对“强度”?[R]

Reddit r/MachineLearning

作者询问如何分析神经网络中探针的相对“强度”,讨论了词汇量有限和模型容量等挑战,并以Google Gemini为例说明了失败情况。

基于生成代理的最佳臂识别

arXiv cs.LG

本文研究了固定置信度下的最佳臂识别问题,其中昂贵的奖励观测与来自生成模型的廉价但相关的代理分数配对。提出了PROBE算法,该算法使用控制变量调整和残差方差的上界证书,以实现接近神谕的样本复杂度。