@zhuokaiz: 我们向TogetherBench添加了另一组前沿模型:GPT-6 Astra, Grok 4.6, Gemini 3.8 Flash, Claude Opus 5等…
摘要
本文宣布将GPT-6 Astra和Claude Opus 5等前沿AI模型添加到TogetherBench基准中,评估它们在pass@1、pass²和任务成本等指标上的表现,没有单一模型在所有维度上表现出色。
查看缓存全文
缓存时间: 2026/09/15 05:39
我们为TogetherBench新增了一组前沿模型:GPT-6 Astra、Grok 4.6、Gemini 3.8 Flash、Claude Opus 5及Opus 4.7。
各评估维度详解:
pass@1/pass2——柱状图完整长度表示pass@1(完全解决任务的运行比例,评判标准为≥0.85分),实色部分为pass2(两次运行均解决的任务占比),两者间的斜线阴影段代表稳定性差距,即模型时而能解决时而失败的任务。Fable 5在此项领先(70%/62%);Grok 4.6的稳定性差距最大(59%/44%)——状态好时表现尚可,但一致性最低。
Judge(评判者)——采用智能评判系统(基于Claude Opus 4.6),根据每个任务固定的加权完成目标评估代码补丁,使得不同模型的部分得分具有可比性。
Correction(修正频率)——模拟用户需要介入的次数:每任务的修正次数+0.2×提示次数。该值越低越好,反映模型对人工辅助的依赖程度,而非仅仅关注最终能否完成任务。
$/task(任务成本)——新增列,根据各厂商公开API定价及实际token使用量(未缓存输入/缓存输入/缓存写入/输出及推理消耗)计算平均任务成本。性价比最高的是Muse Spark 1.3(3.19美元),其次是Grok 4.6(3.64美元)和Gemini 3.8 Flash(4.15美元)。
不幸或庆幸的是,目前尚无模型能在所有维度全面领先,因此最合适的选择完全取决于您的具体需求。
(对话部分)
老兄你肯定是洗车店老板吧
这比喻很贴切👍
实际用起来感觉如何?用antigravity测试的吗?
我之前一直用Gemini的Ultra套餐(其实现在还在用…),主要用antigravity做非工作项目,也享受套餐的各种权益。但最近把大部分原本会用Gemini的任务转给了muse code,效果相当不错。
抱歉无意冒犯,只是那张图让我联想到洗车店(发完第一句才反应过来)
🤣
相似文章
GPT-6 Astra 在 ChessBench 上达到2,340 Elo,排名第11
ChessBench AI国际象棋排行榜已更新,包含了新模型的表现,例如 GPT-6 Astra 达到2,340 Elo并排名第11,以及Claude Fable 5.1和Gemini 3.8 Flash等其他模型。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
@cline: GPT-6 Astra 已发布,在 Terminal-Bench 上位列第一,领先 Claude Fable 5.1 1.9%,后者仅两天前推出…
GPT-6 Astra 已发布,并在 Terminal-Bench 上名列前茅,以 1.9% 的优势超越 Claude Fable 5.1。它即将向 API 推出,并将与 Cline 集成。
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。