@0xCodio: 首尔的一个人删除了其AI记忆文件的68%,回答变得更好了。他没有猜测要删除哪些行。他…

X AI KOLs Timeline 新闻

摘要

首尔的一项实验表明,删除AI记忆文件的68%,特别是形容词,提高了响应质量,使用OpenAI对Claude的记忆进行系统评估。

首尔的一个人删除了其AI记忆文件的68%,回答变得更好了。 他没有猜测要删除哪些行。他让OpenAI逐行评估Claude的记忆。他公布了这个测试工具。 四十个来自他自身历史的真实提示。每个运行两次——一次使用完整文件,一次删除单行。共104行,4,160次两两比较,评判费用1.40美元。 另一个实验是人们通常忽略的部分。让一个模型为自己记忆评分时,它会为自己辩护。它是这些行的作者,而不是审计者。 结果:104行中有71行从未改变过任何一个答案。在整个四十个提示中,一次都没有。它们在他那个月的每次调用中都随之出现。 一开始就无效的:"喜欢简洁的回答。" "对AI和系统感兴趣。" "喜欢干净、可读的代码。" 存活下来的:"在周四发布到生产环境。" "三月份拒绝了基于队列的版本,不要重新提议。" 存活下来的每一行都是一个事实。消亡的每一行都是一个形容词。 形容词感觉像记忆,但缩小了范围却毫无用处。一个记忆行只有通过删除模型原本会给出的答案,才能证明其价值。 别让它在你的书签里腐烂。 下面这篇文章是整个测试工具——提示选择、评判指令、差异格式,让无效行一目了然。运行一次,你今晚就能删除大部分文件。
查看原文
查看缓存全文

缓存时间: 2026/08/23 03:31

首尔一位用户删除了AI记忆文件68%的内容,结果回答质量反而提升了。

他没有盲目猜测删除哪些行,而是让OpenAI对Claude的记忆库逐行评分。这套评估工具现已公开。

测试材料选自他40条真实历史提问,每次运行两组对照——一组使用完整记忆文件,一组每次移除单行记忆。104行记忆条目共产生4160次对比测试,评估成本仅1.40美元。

关键在于评估模型的设计:让AI评价自身记忆时,它会不自觉地维护自己写下的内容——此时它既是创作者又是审计官,存在固有偏见。

研究结果:104行中有71行从未改变过任何回答。在40次测试中始终如一地附着在每次查询结果中。

无效记忆包括:“偏好简洁回答”“对AI与系统感兴趣”“喜欢整洁可读的代码”。

有效记忆包括:“产品于周四上线”“三月否决过基于队列的方案,勿再提交”。

所有保留的记忆条目都是客观事实,所有被删除的都是主观形容词。

形容词式的记忆看似充实却无实际作用。一条记忆只有当删除它会导致模型给出不同答案时,才真正具有存在价值。

请立即行动,别让本文只存在于收藏夹。

以下全文即完整评估工具——包含提示词选择、裁判指令规范,以及能直观识别无效记忆行的差异格式。运行一次,你今晚就能精简大部分记忆文件。

相似文章