标签
Google 的 Gemini 4 基准测试成绩强劲,但内部员工反映该模型在真实世界的编码任务和实际工作中表现吃力,引发外界担忧其可能落后于 Anthropic 和 OpenAI 的下一代模型发布进度。
讨论AI工作流中干净的基准测试环境与混乱的真实世界使用之间的常见差距,导致生产环境失败,并提及评估平台如Confident AI、Braintrust和Langfuse。