为什么向量RAG在大规模AI编程代理中失败(以及我如何使用Neo4j图来解决它)
摘要
一款名为Writ的新开源工具采用混合检索流程,结合BM25、本地ONNX向量和Neo4j图遍历,为AI编程代理提供上下文规则,将令牌膨胀减少726倍,并通过bash钩子强制计划审批。
每个人都把AI编码记忆当作“第一周”问题,只需将[`CLAUDE.md`](http://CLAUDE.md)文件转储到上下文中。一旦遇到数千条冲突的企业规则,这种方法就会崩溃。渐进式披露仍然会消耗数千个令牌。我想将匹配决策完全移出代理。我强迫一个LLM帮助我构建一个名为Writ的工具。它位于Claude Code之上,使用5阶段混合检索流程(BM25 + 本地ONNX向量 + Neo4j图遍历),在0.55毫秒内返回上下文规则,同时将令牌膨胀减少726倍。最棒的部分?它使用实际的本地bash终端钩子,在有效的计划和测试骨架获得批准之前,剥夺AI的写入权限。不再有AI代理撒谎或幻觉依赖。它完全开源且本地优先。查看架构,并告诉我图遍历逻辑是否有意义:[https://github.com/infinri/Writ](https://github.com/infinri/Writ)
相似文章
我如何在向量存储之上构建图数据库,以支持1000个代理运行2个月,因为仅凭向量搜索在用户偏好随时间变化时会失效。
一份详细的架构指南,介绍如何构建长期运行的AI代理,通过结合向量存储、图数据库和时间边缘(temporal edges)来处理随时间变化的用户偏好,而不是覆盖数据。
@PrajwalTomar_: 你的向量数据库正在悄无声息地拖垮你的AI智能体,而你完全不知道。陷阱就在这里。每个人都选了那个……
一条推文警告说,仅根据速度基准测试选择向量数据库可能会对AI智能体造成陷阱,因为AI智能体具有持续的写入负载,这与RAG以读取为主的模式不同。它根据用例推荐了特定的数据库,例如用于智能体记忆的Qdrant,以及用于PostgreSQL上低于1000万向量的pgvector。
@thesupermanmx: Google DeepMind 认为 RAG 已经失效。他们发表了一篇论文,证明向量数据库是死胡同。对于过去…
Google DeepMind 的一篇论文认为,RAG 系统中的单向量嵌入存在严格的数学极限,证明向量数据库无法完全捕捉复杂的文档关系。他们引入了 LIMIT 压力测试数据集,以展示最先进的模型在结构化查询上也会失败。
GraphRAG 在 AI 代理中何时真正值得使用?
一位开发者反思了何时 GraphRAG 比标准 RAG 更适合 AI 代理,指出它在多跳推理和关系理解方面很有价值,但增加了显著的复杂性。
@N01ennn: 微软将其图系统与向量RAG在8k、120k和完整百万token上下文窗口上对比,百万……
微软研究院的LazyGraphRAG在8k、120k和百万token上下文的数据本地问题上超越了向量RAG,以十分之一的成本赢下92/90/91%的胜率,现已在GitHub上开源。