OpenAI的GPT 6 Astra是否真的落后于Fable,甚至Opus?

Reddit r/ArtificialInteligence 新闻

摘要

这篇文章基于对AI Analysis基准测试的讨论,推测OpenAI的GPT 6 Astra是否落后于Fable和Opus等竞争对手。

AI Analysis基准测试被数百万人提及。他们自称为独立的基准测试组织。在我看来,如果这是真的,那会相当糟糕。我确实因为OpenAI的过往记录而喜欢他们,并且绝对希望他们在AI竞赛中击败Anthropic。
查看原文

相似文章

GPT‑6 Astra

Simon Willison's Blog

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。