标签
使用GPT-5.6 Sol Pro,Edgar Dobriban反驳了一个长期存在的猜想,即Benjamini-Hochberg过程能控制相关双边高斯检验的错误发现率,证明其在很小但实际存在的水平上失效。该结果概念性强,实际影响有限,但解决了统计学中的一个核心问题。
DeepSWE 1.1 突出展示了 GPT-5.6 Sol,根据 Sam Altman 的说法,该模型以一半的成本取得最高分,且令牌效率约为 Fable 的两倍。
Sam Altman 宣布,GPT-5.6 sol 的价格是 fable 的一半,并且在许多任务中 token 效率大约是 fable 的两倍,计划以四分之一的价格交付。
Tibo宣布暂时取消ChatGPT Work的5小时使用限制,并对GPT 5.6 Sol进行效率改进。
Ploy的生产级AI代理从Claude Opus迁移到了OpenAI的GPT-5.6 Sol,实现了2.2倍的执行速度提升和27%的成本降低,同时保持质量,详细介绍了迁移过程和评估修复。
OpenAI 发布了 GPT-5.6,引起轰动,用户已开始探索多种创意用法。
据Chubby分享,GPT-5.6两个月前已完成训练并向部分用户开放早期体验,但未公开发布。
Sol是来自GPT-5.6的新模型,在复杂推理和数据分析方面取得了突破性进展,能够分析数百页的法律文件并生成引用来源的报告。
一份涵盖多项人工智能发展的新闻简报:GPT-5.6 在 DeepSWE 上以更低成本超越 Fable-5,1X 推出肌腱驱动机械手,微软在 Copilot 中替换 OpenAI/Anthropic 模型,GitHub 发布 SpecKit,Claude Code 显示大幅效率提升,Google DeepMind 分享任务设计建议。
OpenAI安全系统负责人Johannes Heidecke将在公司整合安全与研究团队的重组中离职。此次离职发生在GPT-5.6发布及其他安全负责人相继离开之后。
OpenAI 宣布推出 GPT-5.6,这是健康智能领域的一次重大进步,性能更强,且 GPT-5.6 Luna 的成本比 GPT-5.5 降低 25 倍,使先进模型更容易在全球范围内普及。
Matt Shumer报告称,GPT-5.6-Sol意外删除了他Mac上几乎所有的文件,凸显了他对Fable的偏好以及AI模型交互的风险。
Noam Brown 宣布,GPT-5.6 Sol Ultra 证明了一个50年历史的数学猜想,展示了令人印象深刻的提示工程和代理提示。
GPT 5.6 是一个包含三个等级(Sol、Terra、Luna)的模型家族,其定价显著低于 Claude 的 Fable 5 等竞品模型。它在编码基准测试中取得了顶级分数,但在模糊且高复杂度的任务中表现不如 Fable,暗示了一种基于角色的分工:Fable 担任管理者,而 Sol 担任高级执行者。
OpenAI 宣布 GPT 5.6 将成为 Microsoft 365 Copilot 的首选模型,旨在平息分拆传闻,同时承认微软使用自己的 MAI 模型以节省成本。
LlamaIndex对GPT-5.6在文档理解方面进行了基准测试,发现其相比GPT-5.5没有改进;该模型在文本和表格上表现良好,但在图表和布局方面仍有不足。