标签
UniMem提出了一种自路由框架,结合了情景记忆与参数记忆用于LLM智能体,在无任务标签的边界无关任务流中实现自适应记忆管理。
ARC通过将仅追加存储与有界引用视图分离,提高了长上下文AI智能体的检索效率和准确率,实现了近乎完美的召回率,同时降低了延迟和带宽消耗。
本文研究了上下文注入微调是否能提升小型语言模型在孟加拉国法律问答中利用检索到法律的能力。使用0.8B、2B和4B规模的Qwen3.5模型,发现微调在较小规模上有帮助,但在4B规模上无显著增益,并减少了语言漂移。
本文提出了一种用于桥梁诊断代理的损伤原因编码器,通过从手册中提取知识三元组并结合QLoRA进行检索增强微调,在降低内存占用的同时实现了高准确率。
一位开发者分享了如何通过检索纪律将智能体锚定到知识库(而非使用更好的模型)来解决自动幻灯片生成中的幻觉问题。该方法将检索与写作分离,并在渲染前强制执行来源检查。
本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。
介绍了无知识语言模型(KLLMs),该模型在实体匿名的语料库上进行预训练,以抑制参数化回忆并增强基于证据的推理,在上下文问答、事实验证和幻觉检测基准上取得了显著改进。
本文提出了 ReDiTT,一种面向异步时间序列预测的检索增强条件扩散Transformer。该模型检索结构相似的潜在序列作为参考条件,以改进长时域预测和样本多样性,在七个真实数据集上取得了最先进的性能。
介绍PARA-PV,一种面向光伏功率预测的物理感知检索增强框架,利用冻结的Chronos时间序列基础模型和分布偏移校正来提高准确性,并处理峰值、斜坡和低功率条件。
Co-LMLM 引入了用于有限记忆语言模型的连续向量查询,能够从知识库中灵活检索,而不局限于关系型查询。该方法在多个规模上相较于以往的 LMLM 和普通 LLM 实现了更低的困惑度和更高的事实精确度。
介绍InfluMatch,一个使用小型开源权重模型的三级级联系统,用于泰语营销中的前沿级KOL搜索,以极低的前沿服务成本实现了94.1%的P@5。
ContextSniper是一个令牌高效的代码记忆层,用于使用LLM代理进行仓库级程序修复。它在SWE-bench Lite上将令牌使用量降低高达51.5%,成本降低高达36.4%,同时保持相似的解决率。
本文提出了一种基于检索的小型语言模型框架,将形式概念分析用作本体构建的符号验证循环,并在罕见共济失调场景中展示了其有效性。
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。
本文介绍了HistoriQA-ThirdRepublic,一个基于法兰西第三共和国历史文献的法语多跳问答数据集,旨在评估检索增强和大型语言模型系统在历史研究场景中的表现。
本文提出一种五臂消融方法论,用于诊断检索预热能量基推理(RW-EBR)中哪个组件驱动性能提升,应用于图可达性和数独等结构推理任务。该方法分离了类先验偏差、随机预热启动和图对齐值重用三种效应的影响。
This paper from SJTU and Tsinghua systematically evaluates 12 agent memory systems from a data management perspective, decomposing memory into four modules and providing guidelines on when to use RAG, vector databases, or knowledge graphs for long-term agent memory.
本文介绍了一种使用冻结基础模型的可穿戴压力检测检索增强个性化方法,无需标记用户数据即可实现接近监督微调的性能。
本文介绍了RASC+,一种用于临床值集编制的检索约束型大语言模型裁决方法,其通过基于Qwen3的检索和盲目裁决,提升了候选集召回率和选择精度,显著优于RASC基线中的直接生成方法。
ScaffoldAgent 提出了一个基于效用引导的动态大纲优化框架,用于开放式深度研究。通过扩展、收缩和修订操作,该框架改进了长文报告生成和事实依据的准确性。