@rohanpaul_ai: GPT-5.6 Sol Ultra vs GPT-5.5 在令人惊讶的HTML5物理测试演示中,Atomic Chat发现GPT-5.6 Sol Ultra的费用比GPT-5.5高出3倍…
摘要
Atomic Chat的一项物理测试显示,GPT-5.6 Sol Ultra的价格是GPT-5.5的三倍,但在HTML5 canvas物理演示中并无明显优势,突显出尽管成本更高,但在物理模拟方面存在弱点。
查看缓存全文
缓存时间: 2026/07/10 06:11
GPT-5.6 Sol Ultra vs GPT-5.5
在一次令人惊讶的 HTML5 物理测试演示中,Atomic Chat 发现 GPT-5.6 Sol Ultra 的价格是 GPT-5.5 的 3 倍,但在物理性能上却没有明显优势。
测试要求每个模型编写独立的 HTML5 Canvas 演示,内容涉及碰撞、翻转、跳跃和脱轨。
输出结果: GPT-5.6 Sol Ultra:32.9K tokens,0.33 Opus 4.8:9.2K tokens,0.24 GPT-5.5:12.4K tokens,0.11 Grok 4.5:7.0K tokens,0.08
物理演示暴露出一个常见编码基准测试往往掩盖的弱点:模型可能花费更多 token 来描述更丰富的场景,却仍然无法攻克真正的难点——在帧之间维持力、动量、碰撞时机以及可信的对象行为。
atomic.chat (@atomic_chat_hq): GPT-5.6 Sol Ultra 在物理性能上输给了 GPT-5.5,成本却是后者的 3 倍!
我们给 4 个模型同样的提示词:构建三个独立的 HTML5 Canvas 场景,实现真实的物理演示。
提示词:
- 一辆 monster truck 在倒翻到一辆停着的汽车上
- 一辆特技车飞跃六辆巴士后撞上砖墙
- 一
相似文章
@rohanpaul_ai: Fable 5 在 HTML5 物理竞赛中绝对碾压了对手,但成本是 Opus 4.8 的 6 倍、GLM 5.2 的 39 倍……
对四个 AI 模型(Fable 5、Opus 4.8、GLM 5.2、GPT 5.5)生成 HTML5 Canvas 物理演示的比较显示,Fable 5 在质量上优于其他模型,但每次测试的成本显著更高。
@VraserX: GPT-5.6 Sol 看起来简直太疯狂了。如果这些早期基准测试成立,Fable 5 就彻底被超越了。更好的性能,更好的效率…
关于 OpenAI 的 GPT-5.6 Sol 模型在基准测试中表现出色的传闻,暗示可能很快发布。
@rohanpaul_ai: atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4……进行了一次极具揭示性的对比。
atomic.chat进行了一项对比,显示Claude Sonnet 5在三个物理编码演示中与GPT 5.5表现相当,但成本低6倍,且使用的token数少于其他模型。
推进 GPT‑5.6 的性价比前沿
OpenAI 宣布 GPT-5.6 Luna(降价 80%)和 Terra(降价 20%)大幅降价,并推出 GPT-5.6 Sol 的快速模式,API 速度提升高达 2.5 倍,旨在提高客户的成本效益。
Artificial Analysis 的 GPT 5.6 系列基准测试
Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。