OpenMythos 基准测试
摘要
OpenMythos 推出了一个新的开源基准测试,用于评估 AI 模型在神话知识方面的表现。
暂无内容
相似文章
它能媲美Mythos吗?
作者测试其他AI模型是否能匹配Mythos在寻找安全漏洞方面的卓越能力,建立了一个由Mythos发现的漏洞基准,并测试了像Opus这样的模型。初步结果表明Mythos可能具有独特的能力。
@AnthropicAI:每次发布新模型时,我们都会运行相同的测试:给模型一段训练小型AI模型的代码,要求新模型对其进行加速。
Anthropic 分享了内部基准测试结果,展示了AI编码能力的显著提升:2024年5月,Claude Opus 4 在机器学习代码优化任务上平均加速约3倍;而今年4月发布的新模型 Mythos Preview 达到了约52倍加速,相比之下,一位熟练人类工程师需要4-8小时才能实现4倍加速。
@NielsRogge:在 http://paperswithcode.co 上,你可以看到 Mythos 5 在流行的图表理解基准 CharXiv 上被一个 4B 开源模型超越……
一个4B开源模型在 CharXiv 图表理解基准上击败了 Mythos 5,展示了可自由获取的小模型的强大性能。
Mythos 可以将训练代码的速度提升 52 倍(相比之下,人类在 4-8 小时内只能提升 4 倍)
Anthropic 的 Mythos 系统在优化训练代码方面实现了 52 倍的加速,而人类在同任务上 4-8 小时内只能实现 4 倍加速,但需要注意的是,绝对倍数在很大程度上取决于起始代码的质量。同类比较显示,过去一年中各模型的改进约为 3 倍到 52 倍。
Claude Mythos、Deepseek v4、HappyHorse、Meta 新 AI、实时视频游戏:AI 新闻
Anthropic 公布被雪藏的 Claude Mythos 模型,可自主挖掘数千个 0-day;ZAI 开源 1.5 TB GLM-5.1,登顶开放权重基准;阿里巴巴未发布的 HappyHorse 视频模型冲上公开榜第一;Deepseek 放出“专家模式”v4 预览。