标签
本文比较了三种常见的智能体记忆系统形态——基于文件的、结构化存储和基于经验的,并通过一个使用常见智能体循环和开源模型的基准测试评估了它们的有效性。
Memvid 是一个将 AI 记忆系统压缩进单个文件的工具,支持向量搜索和全文检索,以 Rust 编写,具有高性能和便携性。
本文讨论了ACORN算法如何解决过滤向量搜索的挑战,并与Qdrant的可过滤HNSW方法进行比较,包括在百万点数据集上的性能基准测试。
作者使用本地技术栈(Ollama、ChromaDB)对经典向量 RAG、谷歌新推出的开放知识格式(OKF)以及混合方法进行了基准测试,发现混合检索答对的问题更多,但 token 成本更高,同时指出了具体的失败模式。
Turbopuffer 宣布对晚期交互(late interaction)的 beta 支持,使 ColBERT 等模型能够将文本表示为 token 级向量,将快速的单向量 ANN 初步搜索与精确的晚期交互重排序相结合,以提高召回率。
阿里云的OBI工具无需修改代码,通过在内核层捕获完整的AI执行路径,可在60秒内对错误的AI答案进行根因分析。
作者描述了构建企业知识图谱智能RAG系统的历程,结合了语义检索、BM25词汇搜索和知识图谱遍历,强调生产级AI需要多种检索策略。
本文讨论了RAG系统的五种分块策略,强调了检索精度与推理上下文之间的权衡,并指出适当的分块对于有效检索至关重要。
本指南介绍了HyDE(假设文档嵌入)技术,该技术通过在搜索知识库之前生成并嵌入一个假设答案来改进RAG检索,并提供了带有生产环境防护措施的Python实现。
Notion分享了其向量搜索基础设施在过去两年中实现规模扩大10倍、成本降低90%的经验,详细介绍了从上线到处理数百万工作区的架构演变。
Slater 是一款低内存图数据库,专为读密集型工作负载设计。它使用固定的缓存预算从磁盘提供大型图服务,仅需几百 MB 的 RAM 即可查询数亿节点和数十亿边,同时兼容标准 Bolt 协议并支持实时写入。
Gergely Orosz的一条推文指出,turbopuffer的创始人Simon Eskildsen在2010到2014年间维护了一个博客,并分享了一份关于turbopuffer和向量搜索的最新演讲和播客的详尽列表。
Google 开源了一个向量索引,将 31GB 的 AI 内存压缩到 4GB,可容纳 1000 万文档,搜索速度比 FAISS 更快,且无需训练或 GPU。
关于Cognee、Graphiti和Neo4j的智能体记忆解决方案的研究总结,这些方案都使用知识图谱和向量搜索,并基于LLM进行数据提取。
Wire是一个面向AI代理上下文容器的平台,因结构限制——向量索引分离、计算与数据共置、部署灵活性及缺乏自托管支持——正从Cloudflare Durable Objects迁移至Fly Machines上的自定义运行时。新架构降低了延迟并实现了专用容量。
Firn 是一个开源的多租户向量与全文搜索引擎,基于 AWS S3 等对象存储,提供分层存储架构,配备 RAM 和 NVMe 缓存以提升性能。通过 IVF_PQ 索引实现亚秒级冷查询,并通过结果缓存实现微秒级热命中。
BaryGraph 提出了一种新颖的知识图谱,其中每个关系都是一等嵌入文档(BaryEdge),而不是节点之间的边,从而能够实现递归抽象三元组,揭示相距遥远概念之间的结构桥梁。预印本中包含了基准测试,显示结构度量比单独使用余弦相似度更能与人类相似性判断相关联。
Manticore Search 27.1.5 引入了一个新的 ONNX Runtime 后端用于嵌入,其性能比之前的 SentenceTransformers/Candle 路径提升约14倍,吞吐量从每秒5-11个文档提高到每秒70-230个文档,并且无需更改API。
Manticore的KNN搜索通过两遍HNSW、批量距离计算、编译时距离特化和AVX-512支持,速度提升高达29%。