@j_dekoninck: GPT-6-Astra 在 MathArena 荣登榜首,预期性能高达90%!同时,它的令牌效率也非常高:…

X AI KOLs Timeline 模型

摘要

GPT-6-Astra 在 MathArena 上以90%的预期性能和高令牌效率夺得第一。

GPT-6-Astra 在 MathArena 上夺得第一,预期性能高达90%!它也非常注重令牌效率:平均每个问题仅使用12k令牌处理 BrokenArXiv 和 ArXivMath。https://t.co/ydbdtRC8OT
查看原文
查看缓存全文

缓存时间: 2026/09/07 19:12

GPT-6-Astra在MathArena夺得第一名,展现出高达90%的预期表现!其token使用效率也非常高:在BrokenArXiv和ArXivMath数据集上,平均每道题仅需12k token。https://t.co/ydbdtRC8OT

相似文章

GPT‑6 Astra

Simon Willison's Blog

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。