标签
Tevatron-Elastic 为训练弹性检索器和重排序器提供了统一抽象,使单个检查点能够在深度、token 和宽度轴上支持多种模型规模。它统一概括了 Matryoshka 嵌入和提前退出等先前方法,并引入了用于联合 token 压缩训练的 Matryoshka LTC。
SPIEval是一个人工构建的基准测试,用于评估大语言模型作为移动助手在分散个人信息任务上的表现,涵盖10个应用中的250个任务。结果显示,即使是最佳模型GPT-5.5(xhigh),准确率也仅为57.3%,大多数失败源于信息定位不准确和验证不足。
本文介绍了因子化假设搜索(Factorized Hypothesis Search, FHS),一种在输入提供间接上下文证据(如表格单元格或临床笔记)时从大型分类法中检索概念的方法。FHS 在金融分类法标注和 CodiEsp 临床编码任务上取得了优异结果,在 Recall@1、MRR 和准确率方面均优于非 oracle 基线方法。
本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。
介绍LegalPincite,一个基于欧盟法院(CJEU)判决构建的大规模法律信息检索数据集,包含掩码查询、完整语料库和段落级引文标注,以支持多层级检索评估。
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
GuidedRAG is a research paper proposing a novel RAG extension that adds a semantics-based selection stage before retrieval, improving retrieval relevance and reducing overhead across diverse RAG variants.
本文通过控制变量,对词汇型、密集向量型、图基型和智能体型RAG范式在从1,000到512,000篇文档的语料规模范围内进行了规模化比较研究。研究发现BM25在准确性与成本之间取得了最佳平衡,而图基型RAG面临高昂的构建成本,限制了其扩展性。
本文研究了检索增强生成系统中文本块(句子、段落、章节)大小对生成质量、检索精度和计算效率的影响,实验采用了相同的教科书,按不同粒度进行分割。
本文系统性地研究了生成式推荐中的语义ID(SID),发现SID虽然保留了物品的粗粒度组织,但丢失了编码器中的细粒度局部结构。作者提出物品支持解码(ISD),一种轻量级的推理时方法,在无需额外参数或重新训练的情况下,将NDCG@10提升高达31.2%。
AWS强调,58%的员工每天花2小时搜索信息,并推荐Amazon Quick作为找回浪费时间的解决方案。
本文提出对HyperGraphRAG的改进,通过使用自一致性提示来提升事实提取效果,并利用个性化PageRank算法增强分块检索。
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。
AutoIndex是一个框架,学习可执行的表示程序,在索引前转换文档,相比静态BM25基线,平均提升Recall@100达8.4%,nDCG@10达8.3%。
本文量化并扩展了晚期交互检索模型的理论容量,证明MaxSim可以复制非负向量之间的内积,并提出适用于任意实值向量的Signed MaxSim,揭示了内积模型与晚期交互模型之间的表示差距。
推荐安装的 podwise-cli 是一款 CLI 工具,可将任意播客内容转化为结构化摘要、关键洞见和思维导图,方便 AI 代理和工作流使用。
本文提出了Libra,一个自我演进的框架,通过在代码仓库中引入可变目录(层次化的Markdown文件,作为可导航索引)来提升LLM智能体的代码定位能力,实现了对数级别的改进以及在不同模型和问题集上的零样本迁移。
本文指出词汇差距是导致ModernBERT等先进编码器在学习型稀疏检索中表现不佳的根本原因,并提出词汇迁移(VT)这一模型无关框架,将编码器迁移至稀疏友好的词汇表,在BEIR基准测试上取得最优结果。
本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。
本文介绍了PaperPilot,一个多轮文献搜索智能体,它构建可执行的有向无环图(DAG)搜索操作,并通过用户反馈优化工作流,在检索指标上相比基线模型取得了显著提升。