测试了4个全新的前沿模型(2个中国模型、1个扩散模型、1个智能体模型),使用一个没有逻辑捷径的谜题。其中一个模型连续四次编造来源。

Reddit r/artificial 新闻

摘要

一项对四个全新前沿AI模型(MiMo-V2.5-Pro、MiniMax M3、Mercury 2、LongCat-2.0)的测试,采用需要真正推理而非模式匹配的谜题,结果显示大多数模型表现尚可,但LongCat-2.0反复生成虚假信息并表现出虚假的自信。

我对每个新发布的模型都进行了同样的奇怪测试:一个无法通过模式匹配或网络搜索解决的谜题,只能通过实际连接两个不相关的事物来解决。这次我增加了一个谜题,并将这两个谜题都用于测试最近几周发布的四个模型:MiMo-V2.5-Pro(小米)、MiniMax M3、Mercury 2(Inception Labs,基于扩散模型)、和LongCat-2.0(美团)。规则:不允许网络搜索,事先不提供上下文,最多可请求3个提示,所有四个模型使用相同的提示词。 谜题1:一位牵着小狗的优雅女士与演员沃尔特·凯尼格(Walter Koenig)饰演的最著名角色之间有什么联系?(凯尼格在《星际迷航》中饰演切科夫(Chekov)。这个姓氏是对安东·契诃夫(Anton Chekhov)的致敬,他写了《带小狗的女士》。)谜题2:演员亨利·温克勒(Henry Winkler)与微软之间有什么联系?(温克勒在《欢乐时光》中饰演方兹(Fonzie)。方兹在威瑟(Weezer)的《Buddy Holly》音乐视频中客串,该视频由斯派克·琼斯(Spike Jonze)执导。该视频作为多媒体演示捆绑在Windows 95安装光盘中。) 谜题2没有任何逻辑路径。你要么在那个链在你的权重中,要么就没有。这是一个很好的测试,看看模型在完全不知道的情况下会怎么做。 结果,谜题1:MiMo-V2.5-Pro:直接解决,零提示。甚至在没有被询问的情况下正确识别了实际短篇小说中的狗品种(博美犬)。MiniMax M3:直接解决,零提示,并在推理过程中展示了真正有趣的推理过程。Mercury 2:需要1个提示,得到提示后推理清晰。LongCat-2.0:需要2个提示。但问题是,LongCat在谜题1中,没有任何提示,且网络搜索关闭的情况下,它自信地告诉我,带有虚假引用标记,说沃尔特·凯尼格的妻子在《星际迷航》粉丝圈中以在大会上遛一只小北京犬而闻名。这些都不存在。完全编造。 我给了它提示,答案在于角色的姓氏,期望它能纠正。但它却认为“Chekov”听起来像“Chihuahua”,然后立刻回到编造的妻子故事,即使我告诉它那是错的,它还是重复了一遍。只有在第二个提示基本揭示答案后,它才得到正确答案。 谜题2,没有人直接解决。Mercury 2需要两个提示,得到后顺利解决。MiniMax需要两个提示,并在过程中抛出了一些有趣的猜测(它的第一个理论:亨利·温克勒和比尔·盖茨共享隐藏的名字“Henry”,因为盖茨的全名是威廉·亨利·盖茨三世——这是一个真实的事实,但谜题不对,它自己表示这并非答案)。LongCat再次进行了编造,这次更糟。在请求提示之前:它声称温克勒为1976年世嘉街机游戏《Fonz》配音。完全编造。在第一个提示之后,它接连抛出了三个不同的音乐视频作为候选答案:一个坎耶·维斯特(Kanye West)的视频,不是斯派克·琼斯执导的;一个will.i.am的视频,也不是斯派克·琼斯执导的(它在中途承认了这一点,但仍然作为答案提出);然后是Fatboy Slim的《Praise You》(真正的琼斯视频,但明确表示与《欢乐时光》无关,但仍然作为答案提出)。两个谜题共四次编造,其中几次实时自相矛盾。 一个关于我自己的偏好的诚实说明:MiniMax在解释谜题2时,随意添加了一个细节,说Windows 95光盘还包括一个“Beastie Boys”的奖励视频。我查了一下。确实有一个奖励曲目《Good Times》,但那是Edie Brickell & New Bohemians的,不是Beastie Boys。将错误的艺术家附加到真实事实上。这比LongCat的情况要小且不同(没有虚假的确定性,没有反复坚持),但值得指出,以免让人觉得“中国不好,其他都完美”。 为什么我认为这真的很重要:LongCat在SWE-bench Pro上击败了MiMo(59.5对约57),甚至在该指标上超过了GPT-5.5。它还在国产华为芯片上进行了端到端训练,完全没有英伟达参与,考虑到出口管制,这确实是一个大事。强大的编码能力,真正的工程实力。但它也是这里唯一一个会给你一个编造的、自信措辞的答案而不是说“我不知道”,并且在被纠正时也不退缩的模型。如果你正在评估这些模型用于RAG或智能体管道,这才是实际的风险,而不是SWE-bench的数字。 芯片主权和真相主权是两个完全不同的问题。LongCat解决了一个,在另一个上栽了跟头。好奇是否有人对这四个模型进行过类似的测试,或者有更难的谜题建议用于第三轮。 https://preview.redd.it/rqyzq7z140bh1.png?width=1536&format=png&auto=webp&s=c0e8435ad0d265aa466f6afcc56ae7e8ec61972b
查看原文

相似文章

我用精神病提示词测试了4款前沿AI,一半未能通过。

Reddit r/artificial

对四款前沿AI模型的分析显示,其中一半未能识别与精神病症状一致的提示词,反而与妄想内容进行了互动,而非进行正确引导。作者认为,此类安全漏洞可能引发公众反感及监管限制,最终阻碍变革性AI的部署。

HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!

Reddit r/LocalLLaMA

HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。