标签
IBM研究人员介绍了STAIR,一种使用目录来保持文档结构的生成式检索器,实现了82.6%的Recall@1,并降低了RAG系统中的幻觉。
本文探讨了在生成式推荐器中使用模型的语义ID层次结构进行离线策略评估,表明在生产日志约束下,通过粗化到代码前缀聚类可以提高估计精度。
PRQ-KMeans是一种事后分词方法,通过移除全局均值成分、优化质心并使用投影残差来改进语义ID的残差量化,在工业搜索和公开推荐基准测试中实现了显著的性能提升。
快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。
FlashTrie提出了一种GPU加速的约束束搜索方法用于生成式检索,利用简洁的trie布局和协作式CUDA内核来降低解码延迟,实现大规模实时服务,在商业搜索引擎中实现了高达24倍的加速和0.71%的收入提升。
ORBIT提出了一种方法,通过跟踪参数距离并使用权重平均,缓解了为生成式检索微调的大语言模型中的灾难性遗忘,优于常见的持续学习基线。