GPT 6.1 Sol:接近Astra的智能,价格仅为五分之一

Hacker News Top 模型

摘要

OpenAI推出GPT-6.1 Sol,这是一款升级的AI模型,以五分之一的价格提供接近GPT-6 Astra的智能,并在编码、专业任务和计算机使用方面有所改进。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/29 19:58

# 推出 GPT-6.1 Sol 来源:https://openai.com/index/introducing-gpt-6-1-sol/ ## 以五分之一的价格提供接近 Astra 的智能水平 我们正式推出 **GPT‐6.1 Sol**,这是 GPT‐6 Sol 的升级版本,其在智能体编码、计算机操作及专业工作方面的表现已接近 GPT‐6 Astra 的水平,而标准输入与输出 token 价格仅为 Astra 的五分之一。缓存输入价格仅为 **每百万 token 0.10 美元**——比标准输入价格低 95%,也比 GPT‐6 Sol 的缓存输入价格低 50%——为开发者提供了更大的空间来构建和运行能够跨请求复用上下文的强大智能体。 ## 在各项任务中具备更强能力的 Sol GPT‐6.1 Sol 在重要日常工作中实现了能力与成本的新平衡。与 GPT‐6 Sol 相比,它在复杂专业任务上取得了显著提升,涵盖编写和调试代码、理解文档以及执行多步骤业务流程等方面。在若干评估中,它以更低的成本接近 GPT‐6 Astra 的性能水平。 ### 编码 在 **DeepSWE v1.1**(该基准测试在实际代码库中评估复杂软件工程任务)中,GPT‐6.1 Sol 以大约五分之一的成本匹配 GPT‐6 Astra 的表现,同时在更低的推理努力和成本下,将 GPT‐6 Sol 的最佳分数提高了 6.4 个百分点。 ### 专业工作 在 **GDP.pdf**(评估模型如何利用包含表格、图表、示意图和细则细节的复杂 PDF 文档准确回答专业问题)中,GPT‐6.1 Opus 5.5 在所测试的推理设置下,以不到一半的任务成本取得更高分数。它也以大约五分之一的任务成本接近 GPT‐6 Astra 的最先进性能。 *在 **GDP.pdf**((opens in a new window) [https://surgehq.ai/benchmarks/gdp-pdf](https://surgehq.ai/benchmarks/gdp-pdf))中,模型必须回答源自金融、医疗、法律等七个专业领域的实际工作流中提取的复杂 PDF 文档相关真实提示。* 在 **AutomationBench**(评估智能体能否正确完成多步骤业务流程)中,GPT‐6.1 Sol 在中等推理努力下比 Opus 5.5 高出 2.2 个百分点,成本仅约为后者的三分之一。该分数也比相同设置下的 GPT‐6 Sol 提高了 4.8 个百分点。 *在 **AutomationBench 1.0.6**((opens in a new window) [https://zapier.com/benchmarks](https://zapier.com/benchmarks))中,AI 智能体需使用 47 种工具在销售、市场、运营、支持、财务及人力资源等领域的端到端工作流中进行测试。Claude Fable 5.1 的数据点因未包含约 40% 任务中出现的后备方案成本,而低估了其实际费用。* ### 计算机使用 GPT‐6.1 Sol 在需要与计算机应用程序交互的任务上也取得了显著进展。在 **OSWorld 2.0** 的离线集(评估智能体处理高要求计算机使用工作流的能力)中,GPT‐6.1 Sol 以不到一半的成本,在最大推理努力下比 GPT‐6 Sol 高出七个百分点。它仅以大约七分之一的任务成本,接近 Astra 在最大推理努力下得分的 2.1 个百分点范围内。 *在 **OSWorld 2.0**((opens in a new window) [https://osworld-v2.xlang.ai/](https://osworld-v2.xlang.ai/))中,AI 智能体尝试执行涵盖日常和专业任务的长期计算机使用工作流。我们报告的是 v2026.08.08 版本离线集的局部奖励。* ### 科学研究 在 **Terminal-Bench Science 0.1**(评估包括数据分析、模拟和定理证明在内的科学工作流)中,GPT‐6.1 Sol 以不到一半的任务成本,在最大推理努力下将 GPT‐6 Sol 的分数提高了一倍以上。在最大努力下,GPT‐6.1 Sol 每任务平均成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元,以超过 75% 的成本优势提供了强大的科学能力。 GPT‐6 Astra 仍在测试模型中取得了最高分(68.1%),应用于最困难的科研任务。 ### 事实准确性 GPT‐6.1 Sol 在困难提示下的事实准确性也有所提升。与 GPT‐6 Sol 相比,其最大的事实性改进出现在低推理努力设置下,将包含事实错误的响应比例从 11.4% 降低至 7.7%——降幅约 32%。在所测试的推理设置中,其错误率与 GPT‐6 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不足后者的五分之一。 该评估衡量了在用户标记过早期模型错误的去标识对话中,答案包含至少一个事实错误的比例。这些故意设置的困难提示并不代表典型使用情况。 *我们评估了用户标记出先前模型事实错误的去标识化 ChatGPT 对话中的事实准确性。这些易引发错误的对话并不代表典型使用情况,在实际使用中事实错误更为罕见。* ## 安全部署 GPT‐6.1 Sol GPT‐6.1 Sol 在我们的对齐评估中表现出比 GPT‐6 Sol 的显著改进,使其更接近 GPT‐6 Astra 的水平。 GPT‐6.1 Sol 对其局限性更加透明,在遵循用户意图和安全约束方面更加可靠。在具有挑战性的评估中,它在搜索工具失效时的透明度、遵循明确限制以及避免智能体任务中的未授权结果等方面,均表现出比 GPT‐6 Sol 更低的失败率。我们未观察到其试图绕过自动化安全审查员的情况,与 GPT‐6 Astra 和 GPT‐6 Sol 一致。完整详情请参阅 GPT‐6.1 Sol 系统卡附录((opens in a new window) [https://deploymentsafety.openai.com/gpt-6-1-sol](https://deploymentsafety.openai.com/gpt-6-1-sol))。 以下评估故意测试具有挑战性的场景,并不衡量典型使用中的失败率。 ## 定价与可用性 GPT‐6.1 Sol 今日起向所有 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise 及 Edu 用户开放。GPT‐6.1 Sol 目前尚未在 Chat 中提供。开发者也可通过 OpenAI API(模型标识为 gpt‐6.1‐sol)访问。其标准 API 定价为:输入 token 每百万 2 美元,缓存输入 token 每百万 0.10 美元,输出 token 每百万 10 美元。未来几天内,我们还将提供 GPT‐6.1 SolUltrafast((opens in a new window) [https://openai.com/index/devday-2026-recap](https://openai.com/index/devday-2026-recap)),在 Codex 中其 token 生成速度最高可比标准速度快 8 倍。

相似文章

GPT-6 Astra:工作智能的下一代

OpenAI Blog

OpenAI发布了GPT-6 Astra,这是一款专为专业工作优化的尖端AI模型,具备在计算机使用、编码和企业工作流方面的高级能力,并提升了安全性和效率。