标签
REPAIR是一种自演化的数据增强框架,用于科学稠密检索器,通过事实验证迭代改进解决长尾混淆,在材料科学和生物医学基准测试中展示了显著的性能提升。
本文提出了一种三阶段训练流程,用于开发紧凑型稠密检索器,包括针对波兰语的PolDense和针对欧洲语言的EuroDense,它们在参数显著减少的情况下,与更大模型相比仍能实现强劲性能。
研究人员使用经过重构训练的稀疏自编码器,从冻结的密集检索器中提取出可索引且适用于BM25的稀疏特征。
本文研究了密集检索器中位置偏差的来源是架构还是训练数据,发现训练数据分布强烈影响偏差,而均衡训练可将敏感性降低高达87%,同时保持检索性能。