@interjc: Gemini 3.5 Pro 快着点儿吧,我都要把你开除出御三家了
摘要
据泄露的基准测试结果,Gemini 3.5 Pro 在内部评估中性能超过 Claude Fable 5 和 GPT-5.6,零样本性能相比 3.1 Pro 有显著提升,目前处于私下验证测试阶段,即将公开推出。
Gemini 3.5 Pro 快着点儿吧,我都要把你开除出御三家了
查看缓存全文
缓存时间: 2026/07/14 18:29
Gemini 3.5 Pro 快着点儿吧,我都要把你开除出御三家了
0xMarioNawfal (@RoundtableSpace): Gemini 3.5 Pro 基准测试泄露刚刚发布,数据令人瞩目。
内部评估中据说超越了 Claude Fable 5 和 GPT-5.6 零样本性能相比 3.1 Pro 显著提升 目前处于私有验证和测试阶段
- 公开发布
相似文章
Gemini 3.5 Flash 凭速度看很不错(8分钟阅读)
谷歌发布了 Gemini 3.5 Flash,这是一款混合速度模型,在速度和成本上与 Opus 4.7 和 GPT-5.5 相抗衡,同时在智能体和编程基准测试中表现良好。
Gemini 3.5 flash 得分,尚未超越 GPT 5.4 xhigh
Gemini 3.5 flash 在基准测试中取得了一定分数,但性能尚未超越 GPT 5.4 xhigh。
@jakevin7: 有个事挺有意思的。 DeepSeek V4 的技术报告,对所有主流大模型做了一轮横评,结论是——Gemini 3.1 Pro 的世界知识是所有模型里最强的。 不是 GPT,不是 Claude,是 Gemini。 但大家用 Gemini 的…
根据DeepSeek V4技术报告对主流大模型的横评,Gemini 3.1 Pro的世界知识被认为最强,但用户普遍觉得不好用,原因是该模型不主动调用搜索工具。
Gemini 3.5 Flash 基准测试
讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。
大家怎么看?我们能说 Qwen 3.6 27B 打败了 Gemini 2.5 Pro 吗?或者 Sonnet 3.7?因为我在测试中发现 27B 表现更好。
一位用户询问 27B 参数的 Qwen 3.6 模型是否能在深度网络搜索、编码和代理任务上超越 Gemini 2.5 Pro 和 Sonnet 3.7,并寻求能打败 Gemini 2.5 Pro 的最低参数模型建议。