twitter-benchmark

标签

Cards List
#twitter-benchmark

@nick_kango: 再加一个任务到我的推特基准测试集合里:) 对了,Opus 4.8 和所有 SOTA 模型都通过了,但我试的时候 Sonnet 4.6 和 Grok 4.3 没有通过…

X AI KOLs Timeline ↗ · 2026-05-30 缓存

Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈