@Miles_Brundage: 重磅:Clear AVERI Pronunciation Guide Bench 上 SOTA 分数大幅提升,来自我的同事 Carly
摘要
Miles Brundage 宣布由同事 Carly 在 Clear AVERI Pronunciation Guide Bench 上实现了最先进(SOTA)分数的提升。
重磅:通过我的同事 Carly,在 Clear AVERI Pronunciation Guide Bench 上大幅提升了 SOTA 分数 https://t.co/6ucOvO5wX5
查看缓存全文
缓存时间: 2026/06/04 01:58
重大突破:通过我的同事Carly,在Clear AVERI Pronunciation Guide Bench上的SOTA评分大幅提升 https://t.co/6ucOvO5wX5
相似文章
SimpleBench迎来新王者
在SimpleBench基准测试中取得了新的最高分,几乎与人类基线持平。
@nick_kango: 再加一个任务到我的推特基准测试集合里:) 对了,Opus 4.8 和所有 SOTA 模型都通过了,但我试的时候 Sonnet 4.6 和 Grok 4.3 没有通过…
Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。
每周都有新SOTA
关于人工智能领域每周不断涌现最新成果的评论。
@cline: Claude Opus 5 在 SWE-Bench 上以 97% 的成绩排名第一,并声称以半价提供 Fable 5 级别的智能。令人难以置信的是,在……
Anthropic 发布了 Claude Opus 5,该模型在 SWE-Bench 上取得了 97% 的成绩,并声称以一半的价格提供 Fable 5 级别的智能,展示了 SOTA 的快速提升。
@patpcj: Fable-5/Mythos 今早发布了,我们在智能体搜索上测试了一下——结果它成了新的 SOTA。性能差距确实存在……
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。