@PrajwalTomar_: 一家较小的科技公司刚刚在 OSWorld 2.0 上以 73% 的准确率超越了 Claude 和 GPT。超越了 Opus 5,也超越了 GPT-5.6 Sol。成本大约只有……

X AI KOLs Following 模型

摘要

Simular 的计算机使用代理 sai_borg 在 OSWorld 2.0 基准测试中达到了 73% 的准确率,以大约每项任务成本三分之二的价格超越了 Claude 和 GPT 模型,并且所有轨迹都已公开。

一家较小的科技公司刚刚超越了 Claude 和 GPT 在 OSWorld 2.0 上达到 73%。超越了 Opus 5,也超越了 GPT-5.6 Sol。每项任务的成本大约只有三分之二。 区别在于 @sai_borg 不会重新思考它已经知道的工作。它将成功的运行保存为代码并重放,因此第二次运行的成本只是第一次的一小部分。 它在自己的云端计算机上工作,像人一样点击真实的网站,并在完成之前检查自己的工作。 所有轨迹都是公开的。OpenAI 和 Anthropic 没有提交任何东西。 这周我将在我的每周管理任务上运行它。稍后会报告结果。
查看原文
查看缓存全文

缓存时间: 2026/08/27 19:32

一家小型科技公司的产品刚刚超越Claude与GPT 在OSWorld 2.0基准测试中达到73%准确率。超越Opus 5。超越GPT-5.6 Sol。每任务成本仅为前两者约三分之二。

差异在于@sai_borg不会重复思考已知任务。它将成功运行流程保存为代码并回放执行,使得第二次运行成本仅为首次的一小部分。

它在云端自有计算机中独立运行,像人类一样点击真实网站操作,并在宣告完成前自我验证成果。

所有执行轨迹完全公开。OpenAI与Anthropic未提交任何参赛作品。

我将用其处理本周行政工作,稍后反馈结果

Simular (@SimularAI):
我们的计算机操作智能体@sai_borg在OSWorld 2.0基准测试中击败了Opus 5与GPT-5.6 Sol。

Sai在CUA基准测试中获得73%的分数——在该测试中,每个复杂任务需要熟练人类耗时超过一小时才能执行。

而Sai达成此成绩时,每任务成本仅为Opus和GPT的约三分之二 💸

关键突破在于我们的

相似文章

@PrajwalTomar_: https://x.com/PrajwalTomar_/status/2075532429641809935

X AI KOLs Timeline

GPT 5.6 是一个包含三个等级(Sol、Terra、Luna)的模型家族,其定价显著低于 Claude 的 Fable 5 等竞品模型。它在编码基准测试中取得了顶级分数,但在模糊且高复杂度的任务中表现不如 Fable,暗示了一种基于角色的分工:Fable 担任管理者,而 Sol 担任高级执行者。