Hark 推出 Handoff,声称在 OM2W 基准测试中创下纪录,击败其他顶尖模型,且运行成本低得多
摘要
Hark 发布了 AI 模型 Handoff,据报道其在 OM2W 基准测试中取得创纪录分数,以远低于其他顶尖模型的运行成本实现了更优性能。
暂无内容
相似文章
你试过 Hark Handoff 了吗?它在评估中得分优于 GPT-5.5 和 Opus 4.8,成本却低 90%
据报道,Hark Handoff 在多个基准测试中优于 GPT-5.5 和 Opus 4.8,成本降低 90%,它使用 SFT 和基于 GRPO 的异步强化学习,基础模型未公开。作者对计算机使用代理的延迟表示怀疑,但对演示持乐观态度。
质量差距不到2%但成本相差10倍:在相同的工具调用任务上测试5个模型[D]
一位开发者在工具调用任务上测试了五个AI模型,发现廉价模型的表现与Opus等昂贵模型相差不到2%,腾讯混元(Tencent's Hunyuan)成本低于1.50美元,而Opus为15美元,通过将简单任务路由到廉价模型,每日成本从40美元降至9美元。
Show HN: Echo – 使用开放权重模型,以三分之一成本达到Fable级别效果
Echo是一个系统,通过高效地在开放权重模型间分配推理任务,以三分之一的成本达到与Fable模型相当的性能。它提供免费额度,且无需信用卡。
@aaron_epstein: 新发布的模型在OCR、视觉和STT任务上击败了sonnet 4.6、gemini 3 flash和gpt 5.4 mini @interfaze_ai
来自interfaze_ai的新AI模型声称在OCR、视觉和语音转文字任务上超越领先模型(sonnet 4.6、gemini 3 flash、gpt 5.4 mini)。
@NielsRogge: Holo 3.1 在流行的计算机使用代理基准 AndroidWorld 上达到了新的 SOTA,可在此处探索 https://paper…
Holo 3.1 在面向计算机使用代理的 AndroidWorld 基准测试中取得了最先进的性能,展示了在本地部署中改进的速度和成本效益。