@zhuokaiz: 我们向TogetherBench添加了另一组前沿模型:GPT-6 Astra, Grok 4.6, Gemini 3.8 Flash, Claude Opus 5等…

X AI KOLs Following 新闻

摘要

本文宣布将GPT-6 Astra和Claude Opus 5等前沿AI模型添加到TogetherBench基准中,评估它们在pass@1、pass²和任务成本等指标上的表现,没有单一模型在所有维度上表现出色。

我们向TogetherBench添加了另一组前沿模型:GPT-6 Astra, Grok 4.6, Gemini 3.8 Flash, Claude Opus 5和Opus 4.7。 在每个评估维度中: pass@1 / pass² — 条形图。完整条长是pass@1,即完全解决任务的运行比例(judge ≥ 0.85)。实心部分是pass²,即两次运行都解决的任务比例。它们之间的斜线尾巴是不稳定性,即模型只部分时间解决的任务。Fable 5领先两者(70% / 62%);Grok 4.6的尾巴最大(59% / 44%):在好日子里表现不错,但重复性最差。 Judge — 一个智能评判员(Claude Opus 4.6)根据每个任务固定的加权任务完成目标对每个补丁进行评分,因此部分分数在不同模型间具有可比性。 Correction — 模拟用户介入的频率:每任务的纠正次数 + 0.2 × 轻推次数。越低越好;它衡量模型需要多少手把手指导,而不仅仅是是否能完成。 $ / task — 新列。根据每家供应商的公共列表价格和实际令牌使用量(未缓存输入、缓存输入、缓存写入、输出 + 推理)计算的平均模型API成本。最经济的是Muse Spark 1.3($3.19),然后是Grok 4.6($3.64)和Gemini 3.8 Flash($4.15)。 幸运或不幸的是,没有单一模型在所有维度上都是赢家,因此合适的模型确实取决于你对它的期望。
查看原文
查看缓存全文

缓存时间: 2026/09/15 05:39

我们为TogetherBench新增了一组前沿模型:GPT-6 Astra、Grok 4.6、Gemini 3.8 Flash、Claude Opus 5及Opus 4.7。

各评估维度详解
pass@1/pass2——柱状图完整长度表示pass@1(完全解决任务的运行比例,评判标准为≥0.85分),实色部分为pass2(两次运行均解决的任务占比),两者间的斜线阴影段代表稳定性差距,即模型时而能解决时而失败的任务。Fable 5在此项领先(70%/62%);Grok 4.6的稳定性差距最大(59%/44%)——状态好时表现尚可,但一致性最低。

Judge(评判者)——采用智能评判系统(基于Claude Opus 4.6),根据每个任务固定的加权完成目标评估代码补丁,使得不同模型的部分得分具有可比性。

Correction(修正频率)——模拟用户需要介入的次数:每任务的修正次数+0.2×提示次数。该值越低越好,反映模型对人工辅助的依赖程度,而非仅仅关注最终能否完成任务。

$/task(任务成本)——新增列,根据各厂商公开API定价及实际token使用量(未缓存输入/缓存输入/缓存写入/输出及推理消耗)计算平均任务成本。性价比最高的是Muse Spark 1.3(3.19美元),其次是Grok 4.6(3.64美元)和Gemini 3.8 Flash(4.15美元)。

不幸或庆幸的是,目前尚无模型能在所有维度全面领先,因此最合适的选择完全取决于您的具体需求。


(对话部分)
老兄你肯定是洗车店老板吧
这比喻很贴切👍
实际用起来感觉如何?用antigravity测试的吗?
我之前一直用Gemini的Ultra套餐(其实现在还在用…),主要用antigravity做非工作项目,也享受套餐的各种权益。但最近把大部分原本会用Gemini的任务转给了muse code,效果相当不错。

抱歉无意冒犯,只是那张图让我联想到洗车店(发完第一句才反应过来)
🤣

相似文章

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。