我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents 论文

摘要

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

我构建了一个智能体运行时,其中一个决定记忆内容的部分是事实提取器:输入一条笔记,输出主题-关系-客体三元组,写入存储。我使用生产环境提示词和1,001条笔记,耗费数周计算时间,对32个本地模型分支进行了基准测试。其中322条笔记不包含持久事实,因此正确输出是空列表。另外132条是撤回(retraction),正确做法是将原始事实标记为否定,而非保持沉默。这两类情况正是智能体记忆真正出问题的地方,而它们在F1分数中都不可见。gemma-4-31B得分为0.6872,gemma-4-12B得分为0.6854。配对自助法无法区分二者。在无事实笔记上,31B在46%的情况下正确保持沉默,但编造了180个三元组;12B在70%的情况下保持沉默,编造了97个。分数相同,但写入记忆的错误事实几乎多了一倍。对智能体而言,这种不对称性比看上去更严重。对话中的错误事实会被反驳;记忆库中的错误事实则会在之后被某个无从得知其来源的组件当作真相读回。没有任何东西会重新审核它。因此,真正重要的指标是在应保持沉默的输入上的编造率,而按此排序,结果发生逆转:granite-4.1-3b在F1上排名第20,却只编造了24个三元组,少于排在它之前的全部19个模型。如果你正在构建智能体记忆:你的语料库需要包含“正确答案是什么都没有”的输入,以及撤回先前事实的输入。没有这些,你的测试框架将无法发现这两类失败。
查看原文

相似文章

32个本地模型正面交锋

Reddit r/LocalLLaMA

一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。