@_philschmid:Gemini 3.7 Flash 在 @ArtificialAnlys 全新的 AA-AnalystAgent 基准测试中位列第一。AA-AnalystAgent 对真实世界场景进行评估……

X AI KOLs Following 新闻

摘要

Gemini 3.7 Flash 在全新的 AA-AnalystAgent 基准测试中拔得头筹,该测试涵盖80项跨领域的定量分析任务,在准确性(60% pass^5)、速度(每任务1.32秒)和成本效率方面均表现卓越。

Gemini 3.7 Flash 刚刚在 @ArtificialAnlys 全新的 AA-AnalystAgent 基准测试中夺得第一。 AA-AnalystAgent 对14个商业与科学领域(金融、医疗、水文学、政府拨款等)的80项真实世界定量分析任务进行评估。 Agent 运行在使用 AA 开源 Stirrup 框架的隔离 Python 3.12 沙盒环境中。它们接收参考电子表格(.xlsx)和文档(.docx),以及标准数据处理库(pandas、polars、openpyxl、scipy、PyMuPDF),用于检查数据结构、编写脚本、处理边界情况并计算最终结果。 Gemini 3.7 Flash: • 准确性:位列第一,pass^5 为 60.0%(pass@1 为 70.5%,pass@5 为 77.5%) • 速度:每任务 1.32 秒(最快) • 成本:平均每任务 $0.54(居中)
查看原文
查看缓存全文

缓存时间: 2026/08/19 14:52

Gemini 3.7 Flash 在 @ArtificialAnlys 最新的 AA-AnalystAgent 评测中荣登榜首。

AA-AnalystAgent 评测基于涵盖14个商业与科学领域(金融、医疗、水文学、政府拨款)的80项真实世界定量分析任务。

该 Agent 运行在隔离的 Python 3.12 沙盒环境中,使用 AA 开源的 Stirrup 框架。它们接收参考电子表格(.xlsx)和文档(.docx),配合标准数据处理库(pandas、polars、openpyxl、scipy、PyMuPDF),以检查数据模式、编写脚本、处理边界情况并计算最终结果。

Gemini 3.7 Flash 表现如下: • 准确性:以60.0%的 pass^5 成绩位列第一(pass@1 为70.5%,pass@5 为77.5%) • 速度:每项任务平均1.32秒(最快) • 成本:每项任务平均0.54美元(居中)

相似文章

@narens:基准测试巅峰

X AI KOLs Following

在Artificial Analysis的分析师代理基准测试中,Gemini 3.7 flash超越了Fable 5、Opus 5和GPT-5.6。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。

Gemini 3 Flash: 为速度而生的前沿智能

Google DeepMind Blog

Google 发布了 Gemini 3 Flash,这是一款快速、高性价比的 AI 模型,将 Pro 级别的推理能力与 Flash 级别的速度相结合,适用于编程、复杂分析和智能体工作流等任务。