我在想,人们什么时候才能意识到我们需要把这个重新带回来呢?

Reddit r/AI_Agents 新闻

摘要

作者主张恢复'大海捞针'基准测试来评估AI能力,分享了私人测试结果,显示许多模型在记忆指令方面表现不佳,质疑其在实际任务中的可靠性。

我们真的需要恢复'大海捞针'比较作为衡量AI能力的主要方式,因为天哪,自从它离开公众视野后,每个AI在这方面都在逐渐变差。过去人们总是讨论这个基准测试,老实说,它对AI能力的提升作用比大家记忆中的要大得多。说真的,如果一个AI忽略或忘记超过20%的指令,我完全不知道怎么能让人信任它来做任何编程工作。我在2024年底开始运行自己的私人基准测试,以下是最近一次运行的结果。Gemini 2.5 pro: 72% Gemini 3.1 pro: 66% Gemini 3 flash: 54% Gemini 3.5 flash: 62% Gemini 3.6 flash: 67% Gemini 3.7 flash: 63% Claude 3 Opus: 69% Claude 3.5 Sonnet: 72% Claude 3.5 Sonnet v2: 75% Claude 3.7 Sonnet: 80% Claude 4 Sonnet: 76% Claude 4 Opus: 74% Claude 4.1 Opus: 79% Claude 4.5 Heiku: 73% Claude 4.5 Sonnet: 70% Claude 4.5 Opus: 72% Claude 4.6 Sonnet: 69% Claude 4.6 Opus: 73% Claude 4.7 Opus: 71% Claude 4.8 Opus: 70% Claude 5 Fable: 65% Claude 5 Sonnet: 67% Claude 5 Opus: 71% GPT 4: 74% GPT 4o mini: 73% o1 preview: 77% o1 mini: 78% o1: 75% o3 mini: 71% GPT 4.1: 76% GPT 4.1 mini: 69% GPT 4.1 nano: 66% GPT 4.5: 59% o3: 60% o4 mini: 61% codex 1: 68% GPT 5: 63% GPT 5 Codex: 62% GPT 5.1: 66$ GPT 5.1 Codex Max: 71% GPT 5.2: 67% GPT 5.3 Codex: 72% GPT 5.4: 72% GPT 5.4 mini: 69% GPT 5.4 nano: 58% GPT 5.5: 65% GPT 5.6 Luna: 66% GPT 5.6 Terra: 67% GPT 5.6 Sol: 67% 其他AI模型也好不到哪里去……为了理解这些数据,一个正常人在不费任何力气的情况下应该能在这项测试中拿到100%。如果一个人真正努力做这个基准测试,他们可能会超过100%,因为评分尺度并没有设计为超出最低要求。我进行私人测试的全部目的是找出哪些模型可以信任来真正执行你交给它们的任务,而老实说,让我震惊的是,现在竟然有人信任AI去做任何工作。得分低于60%意味着AI只能记住或包含给定的100条规则/细节中的70条。没错,你没看错,AI只能记住100条规则/细节中的70条。看看这些分数。意识到它们有多糟糕,然后想想我们到底在做什么。基准测试的格式是给AI一个简单的任务:写一部网络小说的前四章。请求的格式从对话式到伪代码,再到实际的代码块格式不等。老实说,格式不是问题。无论提供的请求是格式高度精确,每个部分都分成易于理解的类别,还是一长段连续的文本,每个AI都未能通过测试。要通过测试,分数至少需要达到90%。老实说,我个人永远不会信任一个AI来编程任何东西,除非它至少能拿到100%,相当于高中一年级的水平。我不会发布这个基准测试,也不会深入细节,因为我不想让它进入未来的AI训练数据。你可能会认为写故事和编程之间没有重叠,但你大错特错了。在这个测试中,唯一重要的是AI遵循给定的指令,不遗漏或跳过任何内容,以及这如何影响它未来的工作。我寻找的不是惊人的故事讲述能力,而是它记住关键细节、规则的能力,以及这些记忆如何影响它后来的写作。例如,如果在第一章,它忘记写'查利原谅了莎拉',这是否会影响AI在第四章中设定查利如何对待莎拉的基调?答案是,确实会影响,因为当它错误地遗漏了早期的原谅场景时,AI会误解查利对待莎拉的方式。这意味着,是的,你的AI可能会忽略或不包含你在工作流程早期给出的规则,即使规则存在于提示/上下文窗口中,其后续工作也会因此受损。如果你告诉它为你写一个应用程序的草稿,并包含规则如'不要用明文存储密码'。如果AI在草稿中没有包含这个细节,即使提示仍在上下文窗口中,它最终也会成为一个问题。总之,只是想在这里发泄一下。我不如你们其他人懂技术,所以原谅我没有使用任何流行术语或技术行话。感谢YouTube视频和在线指南,任何人都能轻松创建一个基准测试,我真心希望你们中的一些人能花时间创建自己的,因为说真的,这些AI中的一些状态绝对糟糕透顶。
查看原文

相似文章

好的基准

arXiv cs.AI

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。