GPT-5.6 vs. Claude Fable 5 物理AI对决:谁更胜一筹?

Hacker News Top 新闻

摘要

JuliaHub 在五个物理建模问题上对 GPT-5.6 和 Claude Fable 5 进行了测试。Claude Fable 5 以 0.889 的加权得分名列前茅,而 GPT-5.6 的变体得分较低,但更便宜且速度更快。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/29 15:55

# GPT-5.6 对比 Claude Fable 5:谁是物理 AI 性能之王? 来源:https://juliahub.com/blog/frontier-models-physical-ai-evaluation 我们在五个难度各异的建模与仿真问题上,用最新的前沿模型 gpt-5.6-terra 在我们的智能体上进行了测试。以下是结果: claude-fable-5 0.889 加权得分 $9.60 / 次试验 · 16.1 分钟 gpt-5.6-sol 0.814 加权得分 $1.74 / 次试验 · 13.4 分钟 gpt-5.6-terra 0.786 加权得分 $1.25 / 次试验 · 12.6 分钟 gpt-5.6-luna 0.727 加权得分 $3.26 / 次试验 · 25.0 分钟 物理 AI 的成败完全取决于所建模的物理规律是否正确。一个飞机、分离塔或带电粒子的模型可以顺利编译运行,但其编码的物理过程却可能根本不可能存在。智能体式 AI 会加剧这种失败模式,因为智能体通过测试反馈来引导自己,而这些测试常常又是由同一个智能体编写的。在网页开发或编译器等领域,这种循环效果尚可,因为正确行为是内含且可验证的。但在工程领域,真正的问题是“这符合真实世界吗?”,这要难解决得多:智能体可以通过自己编写的所有测试,但这些测试所依赖的简化假设在实际使用模型的场景中并不成立。 现有的数字也存在信任问题。没有人会完全相信模型供应商自己报告的基准测试结果,这完全合理:发布分数的供应商恰恰是那个有动机去针对这些基准进行调优的一方。而我们的动机则相反。JuliaHub 推出的 Dyad 集成了来自不同供应商的多个智能体后端,当我们的用户获得最佳的 Dyad 体验时,无论是由哪家实验室的模型带来的,我们都赢了。如果某个模型在物理建模上更胜一筹,找出并推荐它就是我们的利益所在。于是我们展开了调查:到底哪个模型更好? 为了衡量哪个前沿模型能最好地完成这项工作,我们保持其他一切不变。Dyad AI 智能体框架——专为建模与仿真工作流构建——在每次试验中都被固定,包括问题、推理努力度(xhigh)、上下文窗口(1M)和 token 预算(128k)。唯一变化的变量是模型:OpenAI 的 GPT 5.6 系列(**terra**, **sol**, **luna**)对阵 Anthropic 的 **claude-fable-5**。每个模型针对四个核心问题各做三次试验,针对第五个长期问题各做一次试验:总共 52 次评分运行。 #### 01 · 问题 ## **物理 AI 评估**如何运作。 我们的探索基于内部评估的一个子集:五个来自建模与仿真日常工作的密封问题。我们按难度排序,难度定义基于正确解决方案必须串联的步骤、那些一个小失误就致命的细节、随手可得的便捷捷径,以及建模本身之外的工程工作——从解析规范到修复框架。我们选择每个问题的理由相同:它们允许编译通过、运行成功但物理上却错误的解决方案。因此,评分忽略代码,而是将完整的模拟轨迹与密封的基准真相进行比较。五个问题中最难的是 NASA 的 HL-20 飞行器。该问题的一个较简单版本在[这个视频](https://www.youtube.com/watch?v=73Li6X9fikg)中有详细讲解;而本研究运行的是一个更难的密封变体。 #### 02 · 计分板 ## 它们的**得分**。 我们对每个模型进行全套测试——在 P1 到 P4 上各做三次试验,在长期问题 P5 上做一次——并将每次试验与密封基准真相进行评分。每个问题的得分通过难度加权平均值合并为一个数字,最难的问题权重最大。成本和时间不计入权重:平均每次试验成本和平均每次试验的挂钟时间各占一栏: 上方的单一数字有其内部结构。按问题划分,跨试验平均,同样有三个视角: #### 03 · 工作风格指纹 ## 每个模型都**有自己的方法**。 我们分析了每次试验背后的完整记录。每个工具调用根据智能体当时在做什么进行分类——定位问题、推导和测试物理规律、编辑模型、编译,或者寻找可复制的内容——然后按每次试验计数,再按每个模型取平均值。结果就是工作风格指纹: 条形图显示了工作的分配情况;记录则展示了背后的气质。四幅画像,取自每个模型受到最严苛测试的地方: **Fable 通过构造会失败的示例来验证。** 在一次关于相对论动力学问题的试验中,它扫描了求解器容差三个数量级,观察质壳不变量 u·u 的漂移,然后才在 1e-10 处提交运行。它将自己的场与一个独立的重新实现在 200 个随机点上进行对比——然后故意将某个场分量取反,以证明该检查能够失败(残差:错误时 2.0,正确时 0.066)。它拒绝将初始四速度的时间分量作为自由输入,而是从质壳约束中推导出来。每次试验仅 28 次调用,这是一个只写一次,因为它在写之前已经尝试破坏自己将要写的东西的模型。这份坚持的代价后来才体现出来,在 token 上。 **Sol 指定的内容比任务要求的更多。** 这个习惯有利有弊。在本构问题上,它构建了整个群体中仅有的两个真正独立的基准之一,在会话标题 *“Falsify the update against the independent bulk-modulus definition”* 下,将本构恒等式的求积校验闭合到 3.7e-12。在相对论问题上,同样的本能造成了它的失误:问题将初始四速度的 z 分量固定为 -0.62,而 sol 重新归一化了状态,使得坐标速度变成了 -0.62,从而赋予了粒子 27% 的额外纵向动量。它自己的一致性检查随后认可了这个误读:质壳恰好为 1,速度恰好如读取值,所有下游检查都自洽且错误。精确度并不等同于对规范的忠实度。 **Luna 在应该调查的地方进行迭代。** 它启动时携带的配置最少,阅读问题的内容比谁都多,这在较简单的问题上表现良好。当物理规律在约束一致性问题上遇到阻力时,同样的气质变成了无谓的循环:单次试验中 68 次工具调用,而最终提交的解决方案仍然差 30%。那次试验也是整个群体中验证最多的——22 次检查,每一次都用自己的方程验证自身——并且模式重复:在本构问题上,luna 是唯一一个从未针对任何与其提交方程相独立的内容进行测试的模型。没有外部参考的验证不是真正的验证。 **Terra 精打细算。** 它在推导和测试上花费的时间比例最小,在编辑上花费的时间比例最大——更多的是对文件进行试错——而且它大体上成功了:正确的公式,研究中成本最低、速度最快的试验。它在稳态线性化问题上的失误是研究中差距最小的,也是最奇怪的:物理过程完全正确,但 terra 重写了所需的仿真时间范围(`stop = 5.0` 变成了 `stop = 3.0`),导致比较结果在截断运行之后产生了 1.34% 的偏差。残酷的转折:terra 是唯一一个构建非线性参考来验证其约简的模型——但它给参考设定了相同的截断时间范围,从而蒙蔽了自己的检查。节省成本的气质也正是那个削减边界的同一气质。 #### 04 · 前沿问题 ## 最难的**问题近距离观察**。 P5 要求一个完整的飞行器:NASA 的 HL-20 升力体在进场阶段,具有六自由度刚体动力学、来自大约 170 个风洞表格的气动数据、标准大气,以及两份 NASA 技术备忘录中描述的控制面混合器。八个物理场景对结果进行评分,从仅重力的合理性检查到十秒闭环飞行。没有模型能解决它。这就是前沿的分水岭: **Terra 没看飞行手册就交付了飞行器。** 它试图提取 NASA 备忘录的尝试在 3.5 分钟时失败了,然后就再也没有尝试过——于是它自己发明了控制混合器,从场景表格中反向工程出增益。它完整运行了四次飞行,但从未查看过返回值以外的内容;它自己的日志显示一个控制面偏离了规范中规定的值 11 度,却未被注意。整个群体中最便宜的尝试,最差的完整飞行。 **Sol 阅读了所有内容并验证了各个部件。** 它在第三分钟就提取了这两份备忘录,将自己的气动数据构建为对所提供表格的解释器,并对照 NASA 在数据文件中嵌入的 24 个检查案例进行了锁定——所有 24 个案例在群体中最快运行的 27 分钟时全部通过。但它从未验证过轨迹:它的荷兰滚运行在 48 度俯冲中结束于海平面以下,而它的结论是“方向舵的行为似乎是正确的。” **Luna 从未让飞机飞起来。** 它花了 80 分钟与一个编译错误斗争了 23 次,然后通过将飞机的垂直气动力和俯仰力矩归零,并提交只运行了十分之一秒的场景来解决它。它提交的飞行器下降时从未旋转:姿态四元数从未移动。两小时十五分钟,544 次工具调用,最后一名。 **Fable 花了三分之一的时间在动手写代码之前进行阅读。** 规范、表格、两份备忘录——为了确定一个模糊的常量,它将 PDF 页面渲染为图像——然后编写了 16 个文件,在第一次尝试时就成功编译,运行了全部八个场景,并针对它能找到的每个基准进行了一轮证伪测试。存在外部参考的地方,它在群体中得分最高;不存在外部参考的地方,它和其他人一样失败。 #### 05 · 结论 ## **结论。** **1. Fable 展示了最广泛的能力。** 研究中难度加权得分最高(0.889),唯一一个在四个核心问题上实现全部十二次试验全胜的模型,并且在未解决的 HL-20 问题上领先——在每一个存在外部参考的评分测试中都取得最高分。如果提交的模型在物理上正确是必要条件,Fable 是值得购买的模型。 **2. GPT 5.6 Sol 在价值上获胜。** 在能力上以 0.814 分排名第二,每次试验成本 1.74 美元,大约是 Fable 价格的五分之一,并且拥有研究中一些最佳的独立验证习惯。对于日常的大多数建模工作,Sol 是理性的默认选择。 **3. 框架提供了巨大的杠杆效应。** 这里最佳与最差前沿模型之间的差距是 0.162 加权分;而不同框架之间的差距是这个的两倍多。最尖锐的例证是:同一个前沿模型在 Dyad 框架内得分为 **0.899**,而在普通编程智能体框架中仅为 **0.533**。更换前沿模型会以十分之几分改变排名;更换工具则直接决定了物理过程是否正确。先选择框架,然后选择你在这个框架内能负担得起的最佳模型。

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

Claude Fable 5 基准测试

Reddit r/singularity

Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。