@rohanpaul_ai: GPT-5.6 Sol Ultra vs GPT-5.5 在令人惊讶的HTML5物理测试演示中,Atomic Chat发现GPT-5.6 Sol Ultra的费用比GPT-5.5高出3倍…

X AI KOLs Following 新闻

摘要

Atomic Chat的一项物理测试显示,GPT-5.6 Sol Ultra的价格是GPT-5.5的三倍,但在HTML5 canvas物理演示中并无明显优势,突显出尽管成本更高,但在物理模拟方面存在弱点。

GPT-5.6 Sol Ultra vs GPT-5.5 在令人惊讶的HTML5物理测试演示中,Atomic Chat发现GPT-5.6 Sol Ultra的费用比GPT-5.5高出3倍,但并未带来明显的物理优势。 该测试要求每个模型编写自包含的HTML5 canvas演示,涉及碰撞、翻转、跳跃和脱轨等场景。 输出结果: GPT-5.6 Sol Ultra: 32.9K tokens, $0.33 Opus 4.8: 9.2K tokens, $0.24 GPT-5.5: 12.4K tokens, $0.11 Grok 4.5: 7.0K tokens, $0.08 物理演示暴露了普通编码基准测试常常掩盖的弱点:模型可能花费更多token来描述更丰富的场景,但依然无法完成最困难的部分——即跨帧维持力、动量、碰撞时机以及可信的对象行为。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:11

GPT-5.6 Sol Ultra vs GPT-5.5

在一次令人惊讶的 HTML5 物理测试演示中,Atomic Chat 发现 GPT-5.6 Sol Ultra 的价格是 GPT-5.5 的 3 倍,但在物理性能上却没有明显优势。

测试要求每个模型编写独立的 HTML5 Canvas 演示,内容涉及碰撞、翻转、跳跃和脱轨。

输出结果: GPT-5.6 Sol Ultra:32.9K tokens,0.33 Opus 4.8:9.2K tokens,0.24 GPT-5.5:12.4K tokens,0.11 Grok 4.5:7.0K tokens,0.08

物理演示暴露出一个常见编码基准测试往往掩盖的弱点:模型可能花费更多 token 来描述更丰富的场景,却仍然无法攻克真正的难点——在帧之间维持力、动量、碰撞时机以及可信的对象行为。

atomic.chat (@atomic_chat_hq): GPT-5.6 Sol Ultra 在物理性能上输给了 GPT-5.5,成本却是后者的 3 倍!

我们给 4 个模型同样的提示词:构建三个独立的 HTML5 Canvas 场景,实现真实的物理演示。

提示词:

  • 一辆 monster truck 在倒翻到一辆停着的汽车上
  • 一辆特技车飞跃六辆巴士后撞上砖墙

相似文章

推进 GPT‑5.6 的性价比前沿

Hacker News Top

OpenAI 宣布 GPT-5.6 Luna(降价 80%)和 Terra(降价 20%)大幅降价,并推出 GPT-5.6 Sol 的快速模式,API 速度提升高达 2.5 倍,旨在提高客户的成本效益。

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。