@PrajwalTomar_: 你的向量数据库不是记忆,它是坟墓。伦敦存储、取消忽略、健身房仍、伦敦嵌入有效、数据库有效……
摘要
这篇文章认为,向量数据库单独作为数据坟墓,缺乏真正的记忆功能,并描述了在Actian VectorAI DB之上构建具有矛盾检测和遗忘周期的本地AI记忆层。
查看缓存全文
缓存时间: 2026/08/19 18:53
你的向量数据库不是记忆,是坟墓。伦敦存储已取消被忽略,健身房仍然是伦敦。嵌入有效,数据库有效,代理已崩溃。无写入策略,无矛盾,无遗忘。归档增长,确定性消亡。这就是边缘
我赋予了AI真正的记忆,效果有点疯狂。
人人都在说AI代理现在有记忆了。其实并没有。
它们实际拥有的只是搜索功能。你的代理存储你告诉它的一切,然后在之后获取最接近的匹配结果。它从不注意你何时自相矛盾,也从不忘记哪些信息已经改变。因此它会慢慢堆积过时的事实,并把它们当作仍然正确的内容反馈回来。
本周有人在X上说得恰如其分:你的向量数据库不是记忆,是坟墓。@rimtoln说得对。一个光线充足的坟墓。
cryptopsihoz@rimtoln·8月10日你的向量数据库不是记忆,是坟墓。
伦敦存储已取消被忽略,健身房仍然是伦敦。嵌入有效,数据库有效,代理已崩溃。无写入策略,无矛盾,无遗忘。归档增长,确定性消亡。这就是边缘显示更多引用Gyomei@Gyome1_·8月9日文章你的AI代理没有记忆工程就是脑死亡大多数AI代理仍然把记忆当作对话记录。它们保存对话,进行嵌入,检索几个相似片段,然后期望模型找到正确事实。代理记得说过什么……313913.6K
记忆不是存储,而是一个循环:写入、验证、整合、检索、遗忘。因此我在Actian VectorAI数据库之上构建了这个层,完全本地运行,在我自己的笔记本电脑上。
我告诉它我是素食者。后来我说我现在吃鸡肉了。它没有同时保留两个事实导致混淆,而是发现了矛盾,更新了事实,并丢弃了旧信息。
以下是完整解析。
为什么仅有向量数据库是坟墓
向量数据库做好一件事,并且做得很好。它将文本存储为向量,并根据语义返回最接近的匹配。这是检索功能,确实非常有用。
但检索不是记忆。
以下是向量数据库永远不会自动完成的事情:它从不注意新事实是否与旧事实矛盾,因此会同时保留两者;它从不决定哪个事实现在是正确的;它从不遗忘,因此几周前更正的事实仍然存在,并且像什么都没变一样重新出现。
真正的记忆需要做的远不止存储。它必须决定保留什么、更新什么和丢弃什么。这种逻辑不在数据库内部,你必须构建在它之上。
没有循环的向量数据库:每个事实都被倾倒进来,没有任何分类,没有任何项目退役。
没有循环的向量数据库:每个事实都被倾倒进来,没有任何分类,没有任何项目退役。
我构建了什么
一个具有真正记忆层的本地个人助理代理,完全在本机运行。无云端,无API密钥。
每次它学习新信息时,都会运行完整的循环,而不仅仅是存储:
- 写入新事实
- 根据已知信息验证它
- 整合任何矛盾,只保留当前真相
- 仅检索任务实际需要的内容
- 遗忘过时的重复项
这个用例是每个人都会遇到的:用户的事实会随时间变化。饮食、偏好、计划、被纠正的细节。VectorAI数据库是底层的持久化和检索层,而循环逻辑位于其上。
整个记忆循环是一个小函数:写入、验证、整合、遗忘。
整个记忆循环是一个小函数:写入、验证、整合、遗忘。
Actian VectorAI数据库实际上是什么(以及不是什么)
快速、诚实的版本,因为这很重要。
向量数据库将文本存储为向量,即捕获含义的数字列表,并允许你按语义而不是精确词语进行搜索。VectorAI数据库在Docker中本地运行,仪表盘在你的浏览器中。你可以获取免费的社区版并在几分钟内启动运行。
以下是我想要明确的部分:VectorAI数据库不会为你“记忆“,它不会推理,也不会减少幻觉。这些是不同的问题。它所做的是提供可靠的持久化和检索层:它可靠地保存事实,在重启后仍然存在,并快速返回它们。
这正是你在记忆循环底层想要的东西。你构建写入、验证、整合、检索、遗忘的逻辑。VectorAI数据库是该逻辑运行的存储层。无论是在笔记本电脑上还是在生产环境中运行,它都是同一个引擎,这一点稍后很重要。
VectorAI数据库在Docker中本地运行,agent_memory集合在仪表盘中实时显示。
VectorAI数据库在Docker中本地运行,agent_memory集合在仪表盘中实时显示。
构建过程,分阶段进行
这就是搜索框变成记忆的地方。
写入。一个新事实进入(“我是素食者”)。它被嵌入并存储,带有时间戳,因此代理不仅知道你说了什么,还知道何时说的。
验证和整合。一个新事实到来(“我现在吃鸡肉”)。在存储之前,代理会检查它已知的信息,发现它与素食事实矛盾,并取代旧事实而不是同时保留两者。
检索。当你提问时,检索范围限定在任务所需的内容,因此代理获取的是当前事实,而不是埋藏在旁边的过时事实。
遗忘。被取代的事实和过时的重复项会被修剪,因此记忆保持整洁,而不是重新变成坟墓。
代理发现了“我现在吃鸡肉“与旧素食事实的矛盾,并取代了它。
代理发现了“我现在吃鸡肉“与旧素食事实的矛盾,并取代了它。
证据
这是关键时刻。
我告诉它我是素食者。后来我告诉它我现在吃鸡肉了。它标记了矛盾,更新为新事实,并丢弃了旧事实,而不是同时保留两者。
然后我问它我吃什么。它仅回答当前事实。没有困惑,没有过时事实重现。
然后是真正的测试。我关闭所有东西并重启。记忆仍然存在,因为它存储在VectorAI数据库中的磁盘上,代理恢复后状态正确。全部离线完成。
完整运行:它发现了矛盾,然后在数据库完全重启后仍然正确回答问题。
完整运行:它发现了矛盾,然后在数据库完全重启后仍然正确回答问题。
这如何扩展到生产环境
显而易见的问题是:这在笔记本电脑上很酷,在真实规模下如何保持?
架构不变。相同的写入、验证、整合、检索、遗忘循环和相同的代码在生产环境中运行。这就是这种方式的意义所在。
VectorAI数据库是从笔记本电脑到生产环境的同一个引擎。相同的Docker镜像在服务器、本地部署或集群上运行。改变的是部署,而不是应用逻辑。你从免费的社区版向量限制升级到生产版以获得更大的内存,并依靠数据库处理扩展工作、连接池、索引和量化,这样随着记忆增长,检索速度仍然很快。
诚实地说范围:这是持久化和检索层的扩展。我不是在做性能或推理声明。你在此之上构建的记忆循环保持完全相同,这就是为什么它值得构建一次。
相同的VectorAI数据库引擎从笔记本电脑运行到服务器再到集群。只有部署方式改变。
相同的VectorAI数据库引擎从笔记本电脑运行到服务器再到集群。只有部署方式改变。
何时有意义(何时没有)
我不会告诉你每个代理都需要这个。以下是诚实的判断。
在以下情况下使用真正的记忆循环:
- 你的代理随时间积累事实,并且这些事实会发生变化
- 矛盾和过时数据是真正的风险,而不仅仅是边缘情况
- 工作需要在本地、本地部署或受监管环境中运行
在以下情况下跳过它:
- 这是一次性任务,没有值得保留的状态
- 你存储的内容永远不会改变,因此普通检索就足够了
一些需要注意的诚实事项:
- 矛盾检测的好坏取决于你如何定义“冲突“。保持规则清晰。
- 本地模型更小。非常适合这类检查,但不适合深度开放式推理。
- 尽早确定保留规则,否则记忆会慢慢膨胀回坟墓。
这实际上意味着什么
@rimtoln大声说出了真相。单独的向量数据库就是坟墓。将所有内容倾倒进去并获取最接近的匹配不是记忆。
记忆是你在其之上构建的循环:写入、验证、整合、检索、遗忘。添加这个,代理就不再自相矛盾,不再复活过时事实。它真正跟上了你的步伐。
而且由于整个系统本地运行,你完全拥有记忆层。
2026年对那些停止将存储视为记忆的开发者来说将非常不公平。
摘要
- 仅有向量数据库是坟墓:它存储和检索,但从不更新或遗忘
- 真正的记忆是一个循环:写入、验证、整合、检索、遗忘
- 我将其构建为本地个人助理,完全离线,VectorAI数据库作为持久化层
- 它发现了矛盾(素食者,然后吃鸡肉),取代了旧事实并修剪了它
- 重启所有内容后记忆持久存在,状态正确,仍然离线
- 相同的VectorAI数据库引擎从笔记本电脑扩展到生产环境,循环代码不变
- VectorAI数据库是存储层,不是记忆层。你在此之上构建记忆
你可以在几分钟内使用免费的社区版在本地启动VectorAI数据库。
你的向量数据库是坟墓。循环才是大脑。
开始行动。
相似文章
@PrajwalTomar_: 你的向量数据库正在悄无声息地拖垮你的AI智能体,而你完全不知道。陷阱就在这里。每个人都选了那个……
一条推文警告说,仅根据速度基准测试选择向量数据库可能会对AI智能体造成陷阱,因为AI智能体具有持续的写入负载,这与RAG以读取为主的模式不同。它根据用例推荐了特定的数据库,例如用于智能体记忆的Qdrant,以及用于PostgreSQL上低于1000万向量的pgvector。
不受欢迎的观点:AI 代理并不总是需要向量数据库来存储项目记忆
文章认为,对于中小型编码项目,使用向量数据库作为 AI 代理的记忆可能没有必要,并提议使用 Markdown 和 Git 作为更简单、可审计的替代方案来管理项目上下文。
@alex_prompter: 真正可行的AI代理记忆系统就是四个markdown文件,零数据库。你不需要向量…
文章描述了一个简单的AI代理记忆系统,使用四个markdown文件、一个索引和带新鲜度跟踪的缓存,从而避免使用向量数据库和检索管道。
您的业务代理的记忆不应是向量数据库
认为向量数据库不适合存储业务记录(如订单、余额等),因为语义相似性并不能保证事实的正确性;建议对结构化数据使用 SQL,而向量数据库仅用于非结构化信息。
为什么你的AI智能体的“记忆”是一场潜在的数据泄露。
文章警告,在多租户AI智能体中使用仅具有逻辑隔离(元数据过滤器)的共享向量数据库可能会在无声无息中引发数据泄露,并提倡为每个用户提供物理隔离以确保零数据泄漏。