你试过 Hark Handoff 了吗?它在评估中得分优于 GPT-5.5 和 Opus 4.8,成本却低 90%

Reddit r/ArtificialInteligence 模型

摘要

据报道,Hark Handoff 在多个基准测试中优于 GPT-5.5 和 Opus 4.8,成本降低 90%,它使用 SFT 和基于 GRPO 的异步强化学习,基础模型未公开。作者对计算机使用代理的延迟表示怀疑,但对演示持乐观态度。

97.7 在 Online Mine 2Web 上,83.2 在内部测试上,68.6 在 WebTail Bench 上,全面领先,而且每百万 token 仅 2.37 美元,比 GPT-5.5 便宜 90%!他们是怎么训练的?他们使用了一个未公开的基础模型,并通过 SFT 来加速上市时间,同时结合了异步强化学习,尤其是利用了 GRPO 算法。如果你不知道的话,这类似于 DeepMind 历史上训练 AlphaGo 的方式。尽管他们提到延迟为 1-3 秒,但计算机使用代理最大的问题是页面渲染和状态解析,而且他们自己的数据表明这大约会增加 10 秒,所以我对这一点持怀疑态度,但我认为延迟并不总是重要的。我对 CUA 持乐观态度,我大部分时间都在网上瞎逛,这个演示视频让我大开眼界。与任何实验室无关。我希望我有关联 :) https://preview.redd.it/wf6n7usifiih1.png?width=812&format=png&auto=webp&s=52b08113306b0737127f0bf725f09cff7da0d485
查看原文

相似文章