谷歌更新Android Bench:新增多款LLM,但Gemini仍落后

Ars Technica 工具

摘要

谷歌更新了面向Android开发任务的LLM基准测试Android Bench,新增了Claude Fable 5、Qwen 3.7 Max等模型,但其自家的Gemini模型仍落后于竞争对手。

<p>代码生成正成为大语言模型(LLM)最热门的应用之一,但并非所有智能体都能同样出色地完成所有开发任务。谷歌今年早些时候创建了一个基准测试,用于评估LLM在Android应用开发中的表现,而<a href="https://developer.android.com/bench">Android Bench</a>今日迎来重大更新。排行榜现已加入大量新模型,谷歌还采用了更易用的新框架。开发者可自行运行测试并提交反馈,这些反馈将影响Android Bench的未来发展。</p> <p>虽然LLM是流行的编码工具,但并非所有输出都正确无误。从杂乱的输出中筛选出有用内容意味着要选择正确的工具。Android Bench旨在展示哪些AI智能体在100项Android开发任务中表现最佳。自3月推出Android Bench以来,谷歌新增了成本、效率以及开放权重模型等指标。</p> <p>为保持Android Bench的相关性,谷歌正在用八款新模型更新<a href="https://android-developers.googleblog.com/2026/07/android-bench-llm-measurement.html">测试</a>,包括所有最新重磅模型:Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus和Qwen 3.7 Max。</p><p><a href="https://arstechnica.com/google/2026/07/google-revamps-android-ai-dev-benchmark-adds-fable-5-and-other-agents/">阅读全文</a></p> <p><a href="https://arstechnica.com/google/2026/07/google-revamps-android-ai-dev-benchmark-adds-fable-5-and-other-agents/#comments">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:47

# Google 更新 Android Bench 基准测试,引入新 LLM,但 Gemini 仍落后 来源:https://arstechnica.com/google/2026/07/google-revamps-android-ai-dev-benchmark-adds-fable-5-and-other-agents/ 代码生成已成为大语言模型(LLM)最热门的应用之一,但并非所有 AI 代理在所有开发任务上都同样出色。Google 今年早些时候创建了一个基准测试,用于评估 LLM 在 Android 应用开发中的表现,而今天,Android Bench(https://developer.android.com/bench)迎来了重大更新。排行榜现已包含大量新模型,并且 Google 采用了一套更易于使用的新框架。开发者受邀自行运行测试并提交反馈,这将可能影响 Android Bench 的未来发展。 尽管 LLM 是流行的编码工具,但它们并非总是正确的。要从大量无效输出中筛选出有用结果,关键在于选择合适的工具。Android Bench 旨在展示哪些 AI 代理在一套包含 100 项 Android 开发任务中表现最佳。自 3 月份推出 Android Bench 以来,Google 新增了成本与效率等指标,并引入了开放权重模型。 为使 Android Bench 保持相关,Google 正在更新测试(https://android-developers.googleblog.com/2026/07/android-bench-llm-measurement.html),增加了八款新模型,包括所有最新的重磅产品:Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 和 Qwen 3.7 Max。 即使在最初发布的 Android Bench 中,Google 的 AI 模型也并非位居榜首——OpenAI 的最新 LLM 略微领先。如今,随着 Google 扩展阵容,Gemini 的情况更加糟糕。在新排行榜中,Gemini 3.1 Pro 排名第五,落后于 GPT 5.4、Claude Sonnet 5 和 Claude Fable 5。事实上,Fable 5 不负众望,以 84.5% 的测试准确率大幅领先。

相似文章

Gemini 2.5:我们最聪慧的模型进一步升级

Google DeepMind Blog

谷歌发布 Gemini 2.5 系列更新,包括性能改进的 2.5 Pro 和 Flash 模型,新增功能包括 Deep Think(增强型推理模式)、原生音频输出和通过 Project Mariner 实现的计算机使用能力。这些模型现已在 WebDev Arena 和 LMArena 排行榜中领先。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。

Fable 5 在 Livebench 上甚至低于 Gemini 3.1

Reddit r/singularity

讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。

Google 更新其 Gemini 应用以对抗 ChatGPT 和 Claude

TechCrunch AI

Google 在 Google I/O 上宣布对其 Gemini 应用进行重大更新,包括 Daily Brief 功能、重新设计的 Neural Expressive 界面、名为 Gemini Spark 的个人 AI 代理,以及集成新的 Gemini Omni 视频模型,以与 ChatGPT 和 Claude 竞争。