GPT-6.1 Sol 仅 7 天便取代 GPT-6 Sol,智能水平逼近 Astra
摘要
OpenAI 的 GPT-6.1 Sol 仅在 7 天后便取代了 GPT-6 Sol,其智能指数得分逼近 GPT-6 Astra,而每项任务的成本却不到前者的四分之一,进一步推进了成本效率的帕累托前沿。
暂无内容
查看缓存全文
缓存时间: 2026/09/30 11:01
# GPT-6.1 Sol 在仅 7 天后取代 GPT-6 Sol,智能水平接近 Astra
来源:https://artificialanalysis.ai/articles/gpt-6-1-sol-replaces-gpt-6-sol-after-just-7-days-with-near-astra-intelligence
参见模型页面(https://artificialanalysis.ai/models/gpt-6-1-sol)
**GPT-6.1 Sol 在仅 7 天后取代了 GPT-6 Sol。在智能指数(Intelligence Index)中,它比 GPT-6 Astra 低 1 分,而任务成本(Cost per Task)却不到后者的四分之一。**
定价与 GPT-6 Sol 相同,均为每百万输入/输出 token $2/$10,但缓存读取折扣从 90% 提高到 95%。因此,GPT-6.1 Sol 在 agentic 工作负载上的整体混合定价略低于 GPT-6 Sol。继 GPT-6 Sol 相比 GPT-5.6 Sol 原本 50% 的降价之后,这代表了又一次价格下调。
**核心要点:**
**➤ 接近 Astra 的智能水平:**GPT-6.1 Sol 的智能指数比 GPT-6 Sol 提高 4 分,比 GPT-5.6 Sol 提高 5 分——比 GPT-6 Astra 仅低 1 分。它在 agentic 知识工作方面取得了显著进步:在 AA-Briefcase v1.1 和 GDPval-AA v2.1 中分别提升 4 分和 5 分。其他值得关注的提升包括:Terminal-Bench 4.0 提升 12 分,Humanity's Last Exam 提升 5 分,GDP.pdf 提升 6 分,AA-Omniscience Accuracy 提升 8 分,同时幻觉率从 60% 降至 54%。
**➤ 推动成本效率前沿:**在 max effort 下,GPT-6.1 Sol 每个智能指数任务的成本不到 GPT-6 Astra 的四分之一($0.72 vs $3.26)。其单任务成本也比 GPT-6 Sol 低 31%($1.05),比 GPT-5.6 Sol 低 64%($1.99)。GPT-6.1 Sol 的所有 effort 级别都向外推展了成本效率的 Pareto 前沿:在给定的智能水平下,不存在更便宜的模型。
**➤ 推动 token 效率前沿,但输出 token 略多于 GPT-6 Sol:**GPT-6.1 Sol 在各 effort 级别下使用的输出 token 比 GPT-6 Sol 多约 10–30%。然而,由于智能指数得分提高,其低 effort 和中 effort 级别在 token 效率方面达到 Pareto 最优。
**➤ Coding Agent Index 取得提升:**在 Artificial Analysis Coding Agent Index 中,GPT-6.1 Sol 在 max effort 下比 GPT-6 Sol 高 3 分,比 GPT-6 Astra 低 2 分。
## Coding Agent Index
在 Artificial Analysis Coding Agent Index 与 Cost per Task 的 Pareto 前沿图中,GPT-6.1 Sol 主导了低价区间。GPT-6.1 Sol(xhigh)比 GPT-6 Astra 高 1 分,而成本却不到后者的 15%。这相比 GPT-6 Sol(max)提升了 6 分。我们观察到 xhigh effort 设置比 max effort 设置高 3 分。
## Token 效率
在智能指数的各 effort 设置下,GPT-6.1 Sol 使用的输出 token 比 GPT-6 Sol 多 10–30%。然而,由于智能水平的提升,其低 effort 和中 effort 设置在 token 效率方面达到 Pareto 最优。
## AA-Omniscience
在 max effort 下,GPT-6.1 Sol 的 AA-Omniscience Accuracy 提升 8 分,同时幻觉率降低 6 个百分点。
## AA-Briefcase
GPT-6.1 Sol 在 AA-Briefcase 中提升约 80 Elo。这主要由其 rubric 分数和 Analytical Quality Elo 的提高所驱动,而 Presentation Elo 略有下降。
## 各项评测结果
Artificial Analysis Intelligence Index v4.3.2 中各项评测的详细分解。
前往以下地址将 GPT-6.1 Sol 与其他领先模型进行比较:
artificialanalysis.ai/models/releases/gpt-6-1-sol(https://artificialanalysis.ai/models/releases/gpt-6-1-sol)
相似文章
GPT 6.1 Sol:接近Astra的智能,价格仅为五分之一
OpenAI推出GPT-6.1 Sol,这是一款升级的AI模型,以五分之一的价格提供接近GPT-6 Astra的智能,并在编码、专业任务和计算机使用方面有所改进。
GPT-6.1 Sol - 以更低成本在复杂工作中实现接近 Astra 的性能。
OpenAI 发布 GPT-6.1 Sol,这是一款在复杂编码、计算机使用和专业工作中以更低成本提供接近 Astra 性能的 AI 模型,支持多种推理任务。
OpenAI推出GPT-6.1 Sol,称其性能接近GPT-6 Astra且成本更低
OpenAI推出了GPT-6.1 Sol,这是一款在智能代理编程和专业任务方面性能接近GPT-6 Astra的AI模型,但成本更低,并增强了准确性和安全功能。
GPT 6.1 Sol:以五分之一的价格实现接近Astra的智能水平
Simon Willison讨论了GPT 6.1 Sol的发布,这是一款在价格显著降低的同时提供接近Astra智能水平的AI模型。
GPT-6.1 Sol 成本低廉。我们通过禁止它编写代码将其成本降低了77%
一项实际测试表明,在AI代理设置中,将GPT-6.1 Sol作为无写入权限的协调器,Qwen 3.8 27B作为工作器,可将成本降低77%,但会增加小任务的执行时间。