Gemini 4 基准测试成绩亮眼,但 Google 员工表示该模型在实际工作中表现不佳
摘要
Google 的 Gemini 4 基准测试成绩强劲,但内部员工反映该模型在真实世界的编码任务和实际工作中表现吃力,引发外界担忧其可能落后于 Anthropic 和 OpenAI 的下一代模型发布进度。
据直接参与该项目的人士透露,尽管 Gemini 4 在业内用于衡量模型效能的基准测试中表现出色,但当员工真正将其投入实际使用时,效果却不尽如人意。这些要求匿名讨论内部事务的人士表示,该模型在处理某些编码任务时显得力不从心。https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model 等到它向消费者推出时,Anthropic 和 OpenAI 很可能已经推出了各自的下一代模型。
相似文章
Gemini 4 Argon 基准测试
Google 的 Gemini 4 Argon 模型的基准测试结果已经曝光,显示出强劲的性能表现,表明 Google 在前沿 AI 竞争中极具竞争力。
@VraserX: 如果Gemini 4只能做到这样,那Google就完蛋了。
一条推文比较了Gemini 4和GPT-6 Astra的性能,指出GPT-6 Astra更详细,但Gemini 4也不错,并质疑Google是否重回AI游戏。
尽管谷歌拥有数据、计算能力并是AI领域的先行者,为什么Gemini模型的竞争力不足?
本文探讨了尽管谷歌拥有数据、计算和研究优势,但其Gemini模型为何未能激发开发者的热情,分析了组织结构、产品执行和数据策略等因素。
Gemini 3.5 Pro 据报遭遇延迟(2分钟阅读)
Alphabet股价下跌4%,因有报道称谷歌旗舰AI模型Gemini 3.5 Pro落后于原计划数月,编码能力未达到内部预期,而OpenAI和Meta等竞争对手则在发布有竞争力的模型。
Google 尚未发布的 Gemini 4 Argon 或已泄露——在 18 项基准测试中的 12 项超越 Fable 5.1、Opus 5.5 和 GPT-6 Astra,其中自主法律任务上以 19.6% 对 5.4% 大幅领先 GPT-6 Astra
据报道,Google 尚未发布的 Gemini 4 Argon 已遭泄露,在 18 项基准测试中的 12 项上超越 Fable 5.1、Opus 5.5 和 GPT-6 Astra,其中在自主法律任务上以 19.6% 对 5.4% 领先幅度巨大。