标签
提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。
本文对17种深度学习模型在大规模代码到代码检索的第一阶段召回中进行了基准测试,评估了它们在多种编程语言和数据集上的精确度、效率和可扩展性。文中介绍了基于LLM的代码标准化和查询重写方案,这些方案提高了性能较低模型的精确度。
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
本文深入介绍了EverOS的Knowledge Wiki和Reflection两个记忆模块的设计理念,前者通过三层结构和确定性分类管理外部参考资料,后者通过离线反思整合对话经验,强调记忆的治理、可追溯性和渐进式披露。
本文介绍了DR-DCI,一种由检索器引导的框架,通过动态扩展本地工作区来扩展直接语料库交互,从而在大型语料库的智能搜索中提高了准确性和效率。
本文首次系统分析了大型语言模型如何通过强化学习学习适应不同检索器的查询制定策略,揭示了不同的最优查询风格,并引入了一种基于分支的展开技术以提高多检索步训练稳定性。
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
LEDGER是一个新的基准测试,用于评估大语言模型在企业年报上的长上下文能力,提供了4,999份数字化报告,包含31个财务关键绩效指标,以及涵盖检索和提取的三项评估任务。
TACHIOM,一个具有词元感知聚类和分层索引的多向量检索系统,已集成到 PyLate 生态系统中。与现有最先进系统相比,它在保持相当效果的同时,实现了高达 247 倍的聚类加速和 9.8 倍的检索加速。
本文识别了RAG系统在扩展到大规模异构文档集合时出现的“向量搜索稀释”现象,并提出MASDR-RAG,一种利用组织元数据进行领域限定的检索方法,显著提升了检索准确率。
介绍了Infini Memory,一种用于LLM智能体的可维护基于文本的持久化记忆架构。它使用主题结构化文档和迭代检索来改进长期记忆使用,在MemoryAgentBench上达到了64.7%的得分。
本文提出了一种注意力扩展机制,通过使用上下文外信息增强PLM token表示,提升长文档的关键词提取性能,在不需全文档注意力或昂贵LLM推理的情况下,持续优于最先进模型。
REAL是一种用于LLMs长期记忆管理的推理增强图框架,它利用时间与置信度感知的有向属性图,采用非破坏性时间更新和混合波束搜索检索,平均性能提升22.72%。
Didact 是一个面向国防的跨域能力发现系统,它将国防报告和政策文件与来自研究出版物的知识图谱相结合,使用复合 RAG 流水线进行自然语言对话,并通过交互式证据轨道(Evidence Rail)实现来源可视化。
本文提出了一种无需训练、仅使用CPU的检索方法,该方法将BM25词汇分数与后期交互密集分数相融合,用于会话记忆检索,在六个编码器上相比仅使用后期交互,在LoCoMo Hit@1上提升了高达+17.2个点。该研究提供了关于池化操作符、重排序器效果和基准鲁棒性的受控消融实验,将这种提升视为密集信号与词汇信号之间的分工。
QO-Bench 是一个针对类型化事件元组上查询算子问答的诊断性基准测试,涵盖 22,984 篇新闻文章和 614 个企业事件,涉及 18 种查询模板。该基准对 RAG、ReAct RAG、GraphRAG 以及抽取转 SQL 系统进行评估,发现算子执行——而非仅仅是检索——才是核心瓶颈,单纯使用更强的模型并不能解决这一问题。
本文提出了细粒度片段检索(FFR)这一新任务,旨在长对话中定位语义连贯的多模态片段(文本与图像)。作者提出了基于生成的检索模型 F2RVLM(通过强化学习训练)和两阶段检索系统 FFRS,并构建了新的评测数据集 MLDR。
OBLIQ-Bench 引入了一套包含五项倾斜搜索任务的套件,揭示了检索与验证之间的差距:推理型大语言模型在文档被呈现出来后能轻松识别相关文档,但即便是最先进的检索器也无法将其呈现出来,凸显了现代检索系统中被忽视的瓶颈。
引入了一个新的基准测试 OBLIQ-Bench,用于测试检索模型和长上下文大语言模型在更难的搜索查询上的表现,超越了那些已经饱和且过时的基准测试。
研究人员使用经过重构训练的稀疏自编码器,从冻结的密集检索器中提取出可索引且适用于BM25的稀疏特征。