你试过 Hark Handoff 了吗?它在评估中得分优于 GPT-5.5 和 Opus 4.8,成本却低 90%
摘要
据报道,Hark Handoff 在多个基准测试中优于 GPT-5.5 和 Opus 4.8,成本降低 90%,它使用 SFT 和基于 GRPO 的异步强化学习,基础模型未公开。作者对计算机使用代理的延迟表示怀疑,但对演示持乐观态度。
97.7 在 Online Mine 2Web 上,83.2 在内部测试上,68.6 在 WebTail Bench 上,全面领先,而且每百万 token 仅 2.37 美元,比 GPT-5.5 便宜 90%!他们是怎么训练的?他们使用了一个未公开的基础模型,并通过 SFT 来加速上市时间,同时结合了异步强化学习,尤其是利用了 GRPO 算法。如果你不知道的话,这类似于 DeepMind 历史上训练 AlphaGo 的方式。尽管他们提到延迟为 1-3 秒,但计算机使用代理最大的问题是页面渲染和状态解析,而且他们自己的数据表明这大约会增加 10 秒,所以我对这一点持怀疑态度,但我认为延迟并不总是重要的。我对 CUA 持乐观态度,我大部分时间都在网上瞎逛,这个演示视频让我大开眼界。与任何实验室无关。我希望我有关联 :) https://preview.redd.it/wf6n7usifiih1.png?width=812&format=png&auto=webp&s=52b08113306b0737127f0bf725f09cff7da0d485
相似文章
@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。
@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
令牌在吃我的钱包,所以我试了 GLM5.2,并将其与 Fable 5 和 Opus 4.8 进行比较
一位开发者在 OpenRouter 上比较了 GLM 5.2 与 Fable 5 和 Opus 4.8,发现 GLM 5.2 在代码审计和审查方面成本效益高,但由于测试-错误-编辑成本的累积,不适合长时间的无人值守构建。
@dhh:过去一周多我一直在使用低推理模式下的 GPT5.5,效果非常好,效率极高。完全没有想转向 Opus 的冲动……
DHH 称赞 GPT-5.5 在低推理设置下的表现和效率,指出其超越了 Opus 和 Kimi。
Opus 5 对比 Opus 4.8 与 GPT-5.6 Sol,免费测试。模型选择从来不是我的问题。
一位独立开发者通过多模型路由器,利用免费额度测试了 Opus 5、Opus 4.8、GPT-5.6 Sol 和 Kimi K3,发现评估预算和输入预处理比原始模型选择更重要。