GPT-6 Sol 在 Agents' Last Exam 上以低60%的成本超越 Claude Opus 5

Reddit r/singularity 模型

摘要

GPT-6 Sol 在 Agents' Last Exam 基准测试中优于 Claude Opus 5,同时成本降低60%,表明AI模型效率的重大进步。

暂无内容
查看原文

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)

TLDR AI

OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。