本周三名登山者在遵循Gemini的建议后被救下山。同一周,OpenAI推出了他们称之为AGI时代的东西。我一直把这两件事放在一起思考。
摘要
本文讨论了一起事件,其中登山者被Gemini的建议误导,将其与OpenAI的GPT-6 Astra发布进行对比,并强调了随着AI能力提升,信任校准日益增长的挑战。
登山者的故事发生在9月1日。来自Roseville的三个人使用Gemini来规划Mount Shasta的登顶计划。AI告诉他们携带远少于所需的食物和水。他们在晚上7点登顶,比建议的返回时间晚了四小时,天黑后下山,其中一人膝盖受伤,他们在峡谷中过夜,直到第二天早上护林员找到他们。Google表示他们无法复现Gemini给出的错误答案。也许提示词不够明确,也许AI过于自信,具体原因并不重要。重要的是,在错误可能带来严重后果的情境下,三个人信任了一个模型的输出作为专家建议。两天后,OpenAI推出了GPT-6 Astra。在ARC-AGI-3上达到99.9%,在FrontierMath Tier 4上达到97.6%,在ExploitBench上达到100%。OpenAI称这是AGI时代的开始。来自Artificial Analysis的独立基准测试更为谨慎,显示Anthropic的Fable 5.1在更广泛的智能指数上仍处于领先地位。但以下是我不断思考的。登山者的故事和能力的故事并非独立的事物。每当一个模型变得更具能力,就有更多人在高风险情境中信任它。模型能力与用户对其限制理解之间的差距,并不会随着能力的提升而自动缩小。如果要说有什么变化,那就是更难管理,因为输出变得更有说服力。我与组织合作推动AI采用,我看到的最常见现象并非人们对AI过于怀疑。而是人们不知道何时该停止信任它。你的看法是什么?更多的能力是让信任校准问题变得更好还是更糟?
相似文章
Gemini 占据领先地位,投资者对代理式AI感到恐慌,全球AI峰会上的乐观情绪,本地与云端
谷歌的 Gemini 3.1 Pro 在基准测试中领先,同时在性价比上超越竞争对手;投资者对代理式AI表示恐慌;全球AI峰会上的乐观情绪;关于本地与云端AI的讨论。
Gemini与AI幻觉
讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。
Gemini正面临全面Copilot化的危险
本文讨论了Google的Gemini AI在Workspace应用中日渐增多的现象,将其与微软Copilot集成所引发的反弹相类比,并对用户因无处不在的AI功能而产生的疲劳感表达了担忧。
《Goat Simulator》与 Gemini
谷歌的SIMA 2智能体以Gemini为驱动,在3D游戏任务成功率上实现了重大飞跃(65%对31%),通过Genie 3的无限世界生成进行训练。文章提到近期部署的项目如Project Genie和Gemini Robotics 2,表明智能体AI正在持续进步。
Gemini 为何还会犯这种错误?
这篇文章质疑为什么谷歌的 Gemini AI 模型仍然会出现明显的错误,探讨了其训练或部署中可能存在的问题。