AI初创公司Hark推出首款产品:经济快速的计算机使用代理Hark Handoff(7分钟阅读)
摘要
AI初创公司Hark推出Handoff,这是一款可自主浏览网页的计算机使用代理,声称在基准测试中得分领先,并表示其token价格远低于前沿模型。
Hark Handoff是一款计算机使用代理,可代表用户浏览开放式网页。目前已开放注册,计划于本月晚些时候正式上线。Handoff会为每个请求启动一台专用虚拟计算机,配备独立的浏览器、文件系统和终端。该代理可以使用用户保存的地址、支付方式和历史记录进行登录和操作。
查看缓存全文
缓存时间: 2026/08/06 13:34
# AI 初创公司 Hark 发布首款产品:一款经济实惠、快速运行的计算机使用代理 Hark Handoff
来源:https://venturebeat.com/technology/ai-startup-hark-unveils-first-product-an-affordable-fast-computer-use-agent-hark-handoff
Hark (https://hark.com/),这家由连续创业者和机器人专家 Brett Adcock 于今年早些时候创立 (https://www.businesswire.com/news/home/20260324789327/en/Hark-Launches-AI-Lab-Building-Futuristic-Interface-to-Artificial-Intelligence) 的神秘 AI 初创公司,今天发布了 Handoff (https://hark.com/articles/introducing-hark-handoff),一个“计算机使用代理”\(CUA\)。该公司称,该代理在代表用户浏览开放网页方面位列全球顶尖水平——无论是通过 DoorDash 订餐、在 United 和 Delta 上预订航班,还是在 LinkedIn 上给求职者发消息——所有这些都能实现全自动、端到端完成。
今天起,公众可在 hark.com (https://hark.com/) 开放注册,预计将于本月晚些时候作为 Hark 软件平台初始版本的一部分正式上线。
该公司称,Handoff 在 Online-Mind2Web \(OM2W\) (https://huggingface.co/spaces/osunlp/Online_Mind2Web_Leaderboard) 上取得了历史最高分。这是一个由人工评估排行榜的第三方网页代理基准测试,Handoff 得分 97.7,而 OpenAI 的 GPT 5.4 为 92.8,Anthropic 的 Claude Opus 4.8 为 84.1,Google 的 Gemini 2.5 Pro 为 69。
Hark Handoff 基准测试对比图
Hark Handoff 基准测试对比图。图片来源:Hark
Hark 还表示,该模型的服务成本不到其他前沿模型 token 价格的十分之一——每百万输入 token 0.18 美元,每百万输出 token 2.37 美元,而 GPT 5.5 分别为 5 美元和 30 美元——单轮模型延迟为 0.8 秒。
Hark Handoff 定价对比图
Hark Handoff 定价对比图。图片来源:Hark
对于每个请求,Handoff 都会启动一台专用的虚拟计算机,配有独立的浏览器、文件系统和终端。用户可以连接现有账户,让代理登录并使用其已保存的地址、支付方式和历史记录进行操作。
Hark 的研究发现,尽管人们每天 75% 的屏幕时间都在浏览器中度过,但每 1000 个网站中只有不到 1 个提供公开可用的 API,这使得 AI 代理很难接管这些工作。
在发布到 YouTube (https://youtu.be/Lwtte3eSYrQ?si=8iSPvd9KfF9b1xO6) 和社交媒体上的一段约四分钟的正式公告视频中,Adcock——坐在一个空旷的仓库空间里,这同时也隐喻着公司的建设进展——对着 Hark 说出一个请求(“让我们把这个地方弄得热闹一点……来点玫瑰,也许再来点樱花”),视频显示 Handoff 正在导航进入一家花店的网站并下单。Adcock 旁白说,与典型的聊天机器人不同,Handoff“一直在工作,它在循环运行”,并称他现在将 Handoff 用于“我所有招聘工作的全流程”。在 Hark 的公告博客文章 (https://hark.com/articles/introducing-hark-handoff) 中,还展示了更多实时和 5 倍速的演示。
但围绕 Handoff 仍有一些重大悬而未决的问题,尤其是对潜在的企业客户和用户而言。
## **高分基准测试……但对比的是上一代模型**
值得注意的是,Hark 向 VentureBeat 提供的 Handoff AI 代理基准对比对象是 GPT 5.5、GPT 5.4、Opus 4.8 和 Gemini 2.5 Pro——即上一代前沿模型。
当前领先的模型,OpenAI 的 GPT-5.6 和 Anthropic 的 Opus 5,并未包含在内,同样缺席的还有 DeepSeek V4、Kimi K3 和 Qwen3.8-Max 等强大的开源计算机使用竞争者。
这些较新的模型尚未公布 Online-Mind2Web 的结果,也没有第三方在基准测试的公共排行榜 (https://huggingface.co/spaces/osunlp/Online_Mind2Web_Leaderboard) 上发布相关数据——这意味着 Hark 的“历史最高”说法目前无法与现有最强系统进行核对。
这一遗漏值得注意,因为最新前沿模型的最大进步恰恰出现在计算机使用领域:在 OSWorld 2.0 (https://benchlm.ai/benchmarks/osworld2)(一个涵盖完整计算机控制的相关基准测试)上,Anthropic 的 Opus 5 得分约为 70.6%,而 Hark 选择作为对比点的 Opus 4.8 得分为 55.7%。
延迟对比也存在类似的保留意见:Hark 引用的 GPT 5.5 和 Opus 4.8 每轮 6.8 秒和 6 秒的数据,是由 Hark 在自己的测试环境中、将竞争模型设置为最高(也是最慢)推理级别时测得的。目前没有独立的延迟测量数据可供比较。
当 VentureBeat 询问 Hark 是否计划发布与这些新模型的对比时,该公司未作具体说明。
即使在 Hark 自己选择的对比中,“最佳”的说法也有一个星号:在 WebTailBench v2 上(Hark 自列结果表涵盖的三个基准测试之一),GPT 5.5 得分 72.3,而 Handoff 为 68.6。
三个基准测试中的两个(WebTailBench 和一个未命名的内部评估)也是在 Hark 自己的测试环境中运行的,通过率由 Hark 的内部 LLM 评判器计算——这些条件均由该公司控制。
Hark 的定价优势则清晰得多:Anthropic 较新的 Opus 5 与上一代定价相同,仍为每百万输入 token 5 美元、每百万输出 token 25 美元,因此 Handoff 约十倍的成本节省即使面对当前前沿模型也依然成立——前提是其在基准测试中的表现也能继续保持。
## **训练与文件访问**
Hark 的研究预览描述了一套听起来合理的流程——根据今天公告前与 VentureBeat 共享的材料,该流程包括监督微调,随后使用 GRPO 算法进行异步强化学习——但该公司承认目前只完成了后训练(post-training),预训练“计划于今年晚些时候进行”。
这意味着 Handoff 构建在一个 Hark 并未训练的基座模型之上。当被问及使用的是什么基座模型,以及 Handoff 训练的专有和开放数据比例时,Hark 尚未明确说明。
另一个对企业用户来说很大的问号是:谁可以访问专用虚拟计算机及其上创建的文件?
一位 Hark 发言人表示,“安全和隐私是首要关注点,但这目前是一个技术预览版”,并补充说,当产品在夏末正式上市时,公司将分享更多细节。
## **Adcock 在创立 Hark 之前的经历**
Hark 是 Adcock 创立的第四家公司。此前,他曾联合创立人才市场 Vettery(2018 年以约 1 亿美元出售 (https://www.adeccogroup.com/our-group/media/press-releases/2018-the-adecco-group-announces-acquisition-of-vettery))、飞行出租车制造商 Archer Aviation (https://archer.com/),以及人形机器人独角兽 Figure AI (https://venturebeat.com/ai/robotics-startup-figure-raises-staggering-675m-and-partners-with-openai)。
Hark 于 2026 年 5 月完成了 7 亿美元的 A 轮融资,估值 60 亿美元 (https://www.businesswire.com/news/home/20260521171628/en/Hark-Raises-%24700M-Series-A-at-a-%246B-Valuation)——由 Parkway Venture Capital 领投,Nvidia、AMD、Intel Capital、Qualcomm Ventures、Salesforce Ventures 和 ARK Invest 参投。
Adcock 用自己的资金向公司注入了 1 亿美元种子资金,目前同时担任 Figure 和 Hark 的创始人兼 CEO,一位发言人证实了这一点。
当被问及两家公司如何互动时,该发言人表示,Hark 的模型“正在 Figure 机器人上进行训练”,但 Adcock 没有计划将两家公司合并。
Adcock 的宣传风格曾引发质疑。2025 年 4 月,Fortune 记者 Jason Del Rey 报道称,Figure 大力宣传的 BMW 合作 (https://fortune.com/2025/04/06/figure-ai-bmw-humanoid-robot-partnership-details-reality-exaggeration/) 远比 Adcock 公开宣称的机器人“车队”执行“端到端操作”要低调得多:BMW 发言人 Steve Wilson 表示,当时只有一台 Figure 机器人在非生产时段练习搬运零件。
但该合作已经取得进展。截至 2026 年 6 月,BMW 表示 Figure 02 机器人 (https://www.press.bmwgroup.com/global/article/detail/T0458778EN/bmw-group-advances-the-use-of-physical-ai-in-production-with-figure-03-project-in-spartanburg?language=en) 在 10 个月内支持了超过 30,000 辆 BMW X3 车辆的生产,下一代 Figure 03 机器人正在该工厂部署,用于物流环节的零件排序工作。
在社交网络 X 上,Adcock 称该报道是“歪曲事实,甚至是彻头彻尾的谎言” (https://mikekalil.com/blog/figure-ai-vs-fortune/),并威胁提起诽谤诉讼。两个月后,TechCrunch 报道称,Adcock 在一次科技会议上跳过了承诺的现场演示 (https://techcrunch.com/2025/06/06/figure-ai-ceo-skips-live-demo-sidesteps-bmw-deal-questions-on-stage-at-tech-conference/),并在台上回避了有关 BMW 合作的问题。
这些都不意味着 Handoff 的数据是错的。这个代理很可能确实表现出色,而且其定价——如果能够保持的话——将低于所有主要实验室。
相似文章
Hark 预览其用于完成任务的浏览器使用代理
Hark 预览了其浏览器使用代理 Hark Handoff,该代理无需 API 即可通过浏览网站完成购物和预订等任务,并声称比竞品更快、更便宜。
From the CEO of Figure Ai comes "Hark Handoff"...
Figure AI 首席执行官推出计算机使用代理 Hark Handoff,可通过浏览器自动执行点餐等日常任务,目标是让用户将不想处理的事情直接交接出去。文中展示了演示场景,并称这是该产品的首次研究预览。
Launch HN: Coasty (YC S26) – 计算机操作代理的 API
Coasty 是一个用于构建计算机操作代理的新 API,提供任务运行、工作流、托管机器以及较低层的预测原语。
@MakadiaHarsh: 大多数AI工具止步于“这是草稿”。但值得关注的转变是:能完成工作的智能体。你设定一个目标……
Makadia Harsh 介绍了 MyClaw,一个能自主完成任务的AI智能体,例如生成竞争对手定价报告并通过即时通讯应用发送。
超越炒作:我刚刚看到一个AI代理在18分钟内自动完成了原本需要4小时的研究工作流程。
作者描述了观察一个AI代理自主完成竞争情报工作流程的过程,该流程通常需要4小时,而它在18分钟内完成,突出了它浏览网站、处理PDF和迭代搜索的能力,暗示着从简单聊天机器人向自主执行的转变。