标签
来自MachineLearningMastery的一篇教育性文章,涵盖了RAG流水线的七种分块策略,从固定大小令牌分块到高级语义和层次化方法,并提供了每种策略的适用场景指导。
Pathway 团队开源的 llm-app 是一个用于构建企业级 RAG 系统的框架,支持实时数据同步、内置向量检索,并配有现成的云模板,GitHub 上已获 5.9 万+ Star。
本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。
HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。
一条推文讨论了AI代理随时间变慢的原因,因为其向量数据库针对静态数据优化,但实际代理不断添加新数据,导致性能下降。
一条推文警告说,仅根据速度基准测试选择向量数据库可能会对AI智能体造成陷阱,因为AI智能体具有持续的写入负载,这与RAG以读取为主的模式不同。它根据用例推荐了特定的数据库,例如用于智能体记忆的Qdrant,以及用于PostgreSQL上低于1000万向量的pgvector。
此工具在本地对PDF和Markdown文件进行索引,用于语义搜索和AI增强,使用Ollama进行嵌入和LLM处理,并提供CLI和MCP服务器以便与AI助手集成。
Memvid是一个开源工具,将智能体记忆打包到mp4文件中,相比传统的RAG管道和向量数据库,性能显著提升。
阿里开源了向量数据库 zvec,支持通过 pip 直接安装,轻量易用。
阿里巴巴发布了Zvec,一个完全开源的向量数据库(Apache 2.0),可通过pip安装,支持针对RAG应用的稠密、稀疏和混合搜索,能在毫秒内处理数十亿向量。
作者批评RAG和向量数据库的方法,提出正确的做法包括用好memory、分块和索引、摘要、为agent提供搜索工具,以及使用SRAM-only推理服务如Groq和Cerebras。
清晰解释标准RAG、Graph RAG和Agentic RAG,涵盖它们的区别、用例以及如何处理单跳与多跳查询。
Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。
一种模块化、高性能的 GraphRAG(基于图的检索增强生成)Rust 实现,支持 WebGPU 加速,并提供三种部署架构:仅服务器、仅 WASM(客户端)以及混合模式。
作者构建了一个完全离线的AI代理,使用本地嵌入模型、通过Ollama的Llama模型以及VectorAI数据库,旨在解决依赖云端的AI所带来的风险。该代理运行在一台8GB内存的MacBook上,能够处理敏感文档,并在多个会话之间保持记忆。
一个关于构建本地文档RAG系统的详细技术咨询,涵盖存储、摄取、查询和高亮,寻求关于向量数据库、GraphRAG可行性以及文档高亮实现的建议。
阿里开源了内部使用多年的向量数据库Zvec,支持十亿向量毫秒级检索,无需单独服务即可嵌入应用进程,完全免费,替代Pinecone等付费服务。
一个开源项目将6000万个文本块从201GB压缩至6GB,同时保持检索质量,实现97%的存储缩减,且无需GPU即可在普通笔记本上运行。
作者讨论了AI搜索中关键词搜索与向量搜索的优缺点,认为应将多种搜索策略结合注册给Agent,并引用了一个观点称免费的传统工具可能摧毁整个向量数据库行业。
一条Twitter帖子指出,人工智能行业在RAG的向量检索系统上投入巨资可能并无必要,因为52年前的终端命令'grep'在AI代理上下文中进行精确匹配时表现优于现代语义搜索。