我测试了32个模型的提取能力,结果令人惊讶
摘要
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
我构建了一个智能体运行时,其中一个决定记忆内容的部分是事实提取器:输入一条笔记,输出主题-关系-客体三元组,写入存储。我使用生产环境提示词和1,001条笔记,耗费数周计算时间,对32个本地模型分支进行了基准测试。其中322条笔记不包含持久事实,因此正确输出是空列表。另外132条是撤回(retraction),正确做法是将原始事实标记为否定,而非保持沉默。这两类情况正是智能体记忆真正出问题的地方,而它们在F1分数中都不可见。gemma-4-31B得分为0.6872,gemma-4-12B得分为0.6854。配对自助法无法区分二者。在无事实笔记上,31B在46%的情况下正确保持沉默,但编造了180个三元组;12B在70%的情况下保持沉默,编造了97个。分数相同,但写入记忆的错误事实几乎多了一倍。对智能体而言,这种不对称性比看上去更严重。对话中的错误事实会被反驳;记忆库中的错误事实则会在之后被某个无从得知其来源的组件当作真相读回。没有任何东西会重新审核它。因此,真正重要的指标是在应保持沉默的输入上的编造率,而按此排序,结果发生逆转:granite-4.1-3b在F1上排名第20,却只编造了24个三元组,少于排在它之前的全部19个模型。如果你正在构建智能体记忆:你的语料库需要包含“正确答案是什么都没有”的输入,以及撤回先前事实的输入。没有这些,你的测试框架将无法发现这两类失败。
相似文章
32个本地模型正面交锋
一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。
测试了小模型在对话中能记住一个事实多长时间。记忆失败模式对智能体来说是一个真正的问题,而且这并非我所预料的。
一位开发者测试了小型边缘模型(LFM2.5、Gemma 变体)在多个对话轮次中保持一个事实的能力,发现模型常常自信地否认知道仍在上下文中的信息,这给智能体架构带来了信任问题,并暗示了记忆与格式规范之间的权衡。
我测试了9个开放模型在代理搜索中识别虚假来源的能力(DeepSeek V4、Qwen 3.8、Nemotron 3 Ultra)
EchoNet 基准测试了开放权重 AI 模型在代理搜索中处理虚假来源的能力,表明模型在面对虚假多数时最为吃力,并揭示了成本与性能的差异。
测试了4个全新的前沿模型(2个中国模型、1个扩散模型、1个智能体模型),使用一个没有逻辑捷径的谜题。其中一个模型连续四次编造来源。
一项对四个全新前沿AI模型(MiMo-V2.5-Pro、MiniMax M3、Mercury 2、LongCat-2.0)的测试,采用需要真正推理而非模式匹配的谜题,结果显示大多数模型表现尚可,但LongCat-2.0反复生成虚假信息并表现出虚假的自信。
我们重新规范地运行了基准测试。15个模型、3,595条回复,以及我们上次的两个结果未能经受住验证
本文详细描述了对15个模型进行的AI基准测试重新运行,纠正了先前的错误,并分析了多语言定价任务中的准确性、成本和写作质量等因素。