Gemini 4 基准测试成绩亮眼,但 Google 员工表示该模型在实际工作中表现不佳

Reddit r/singularity 新闻

摘要

Google 的 Gemini 4 基准测试成绩强劲,但内部员工反映该模型在真实世界的编码任务和实际工作中表现吃力,引发外界担忧其可能落后于 Anthropic 和 OpenAI 的下一代模型发布进度。

据直接参与该项目的人士透露,尽管 Gemini 4 在业内用于衡量模型效能的基准测试中表现出色,但当员工真正将其投入实际使用时,效果却不尽如人意。这些要求匿名讨论内部事务的人士表示,该模型在处理某些编码任务时显得力不从心。https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model 等到它向消费者推出时,Anthropic 和 OpenAI 很可能已经推出了各自的下一代模型。
查看原文

相似文章

Gemini 4 Argon 基准测试

Reddit r/singularity

Google 的 Gemini 4 Argon 模型的基准测试结果已经曝光,显示出强劲的性能表现,表明 Google 在前沿 AI 竞争中极具竞争力。

Gemini 3.5 Pro 据报遭遇延迟(2分钟阅读)

TLDR AI

Alphabet股价下跌4%,因有报道称谷歌旗舰AI模型Gemini 3.5 Pro落后于原计划数月,编码能力未达到内部预期,而OpenAI和Meta等竞争对手则在发布有竞争力的模型。