@PrajwalTomar_: 一家较小的科技公司刚刚在 OSWorld 2.0 上以 73% 的准确率超越了 Claude 和 GPT。超越了 Opus 5,也超越了 GPT-5.6 Sol。成本大约只有……
摘要
Simular 的计算机使用代理 sai_borg 在 OSWorld 2.0 基准测试中达到了 73% 的准确率,以大约每项任务成本三分之二的价格超越了 Claude 和 GPT 模型,并且所有轨迹都已公开。
查看缓存全文
缓存时间: 2026/08/27 19:32
一家小型科技公司的产品刚刚超越Claude与GPT 在OSWorld 2.0基准测试中达到73%准确率。超越Opus 5。超越GPT-5.6 Sol。每任务成本仅为前两者约三分之二。
差异在于@sai_borg不会重复思考已知任务。它将成功运行流程保存为代码并回放执行,使得第二次运行成本仅为首次的一小部分。
它在云端自有计算机中独立运行,像人类一样点击真实网站操作,并在宣告完成前自我验证成果。
所有执行轨迹完全公开。OpenAI与Anthropic未提交任何参赛作品。
我将用其处理本周行政工作,稍后反馈结果
Simular (@SimularAI):
我们的计算机操作智能体@sai_borg在OSWorld 2.0基准测试中击败了Opus 5与GPT-5.6 Sol。Sai在CUA基准测试中获得73%的分数——在该测试中,每个复杂任务需要熟练人类耗时超过一小时才能执行。
而Sai达成此成绩时,每任务成本仅为Opus和GPT的约三分之二 💸
关键突破在于我们的
相似文章
@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
@VraserX: GPT-5.5 依然是王者。GPT-5.5 以几乎一半的成本和大约两倍的速度碾压 Claude Opus 4.8。OpenAI …
一条推文声称,OpenAI 的 GPT-5.5 以近乎一半的成本和双倍的速度表现优于 Claude Opus 4.8,宣称 OpenAI 在 AI 领域继续保持统治地位。
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
@PrajwalTomar_: https://x.com/PrajwalTomar_/status/2075532429641809935
GPT 5.6 是一个包含三个等级(Sol、Terra、Luna)的模型家族,其定价显著低于 Claude 的 Fable 5 等竞品模型。它在编码基准测试中取得了顶级分数,但在模糊且高复杂度的任务中表现不如 Fable,暗示了一种基于角色的分工:Fable 担任管理者,而 Sol 担任高级执行者。
@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。