标签
一篇计算机科学论文将基于文件系统的记忆形式化为自主AI代理的长期存储,表明将记忆组织为层级Markdown文件相比向量存储可将检索成本大约减半。
This paper introduces Task-Conditional Flow Matching (TCFM), a framework for adapting multilingual text embedding models that selectively uses flow matching for translation tasks and other objectives for retrieval/classification. It achieves state-of-the-art results on the Indic Massive Text Embedding Benchmark.
This paper introduces ScrubJay-MEM, an LLM agent memory system inspired by scrub jay episodic memory, which uses type-conditioned temporal decay to manage memory perishability. It also proposes the Temporal Generalization Test (TGT) benchmark and shows improved performance over existing memory systems on temporal reasoning tasks.
EdgeLM是一篇研究论文,提出了一种检索框架,选择边缘演示——即决策边界附近的相关示例——以提高LLM在表格理解与数据整理任务上的表现。
Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。
作者认为,Agent记忆层应跳过基于LLM的提取来决定记住什么,转而使用简单的存储、嵌入和检索,其开源工具memU即是例证。
提出了一种基于证据的多模态流水线,从讲座视频中构建富含溯源信息的知识图谱,结合ASR、OCR和视觉-语言模型,在神经网络讲座上实现了高检索准确率。
一位从业者分享了为技术现场服务构建生产级AI语音机器人/聊天机器人的13条来之不易的经验,涵盖文档ETL、成本降低和智能体编排。
本文解释了如何将 MCP(模型上下文协议)集成到 Agentic RAG 系统中,让每个数据域可以管理自己的 MCP 服务器,从而实现标准化的数据访问、安全性以及检索系统的解耦演进。
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
这篇推文讨论了基于文件系统构建 LLM Agent 记忆的难点,引用了相关论文并介绍 TiDB Filesystem 的设计理念。
RAG-Anything 是一个基于 LightRAG 构建的多模态文档处理 RAG 系统,它解析文档、构建多模态知识图谱,并使用混合向量-图检索来回答问题。
Dylan Castillo 比较了 Matryoshka 表示学习(MRL)与主成分分析(PCA)在降低嵌入维度方面的效果,并在八个 BEIR 数据集上进行了实验,以评估检索质量与向量大小缩减之间的权衡。
作者使用本地技术栈(Ollama、ChromaDB)对经典向量 RAG、谷歌新推出的开放知识格式(OKF)以及混合方法进行了基准测试,发现混合检索答对的问题更多,但 token 成本更高,同时指出了具体的失败模式。
Zero-Mem为LLM智能体引入了一种零Token记忆操作系统,通过保留原始交互轨迹并使用确定性实体-上下文和时间结构,在记忆检索过程中消除了LLM调用和Token消耗。它在长记忆和长上下文问答基准上取得了具有竞争力的性能,同时将记忆操作时间成本降低了57.6%。
本文介绍了AdaMM,一个通过分析记忆补充基于检索的多模态记忆的框架,能够对累积的观测进行过滤、聚合、排序和时间比较。在MemEye和MemGallery基准上的实验显示,性能分别提升了高达11.3%和7.3%。
谷歌和Anthropic都将检索视为由智能体调用的独立服务,摆脱了天真的单次RAG流水线。这篇文章解释了持续摄取层和结构化检索单元如何修复过时的嵌入和耦合的基础设施,据说可将语料库规模减少40倍,并将向量相关性提升2.3倍。
作者分享了构建客户支持多智能体系统的经验,认为检索和落地失败(而非提示词或模型)是智能体产生幻觉的主要原因。作者列出了五项落地检查,并指出禁止无依据回答使升级率降低了40%。
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。