Mythos 可以将训练代码的速度提升 52 倍(相比之下,人类在 4-8 小时内只能提升 4 倍)
摘要
Anthropic 的 Mythos 系统在优化训练代码方面实现了 52 倍的加速,而人类在同任务上 4-8 小时内只能实现 4 倍加速,但需要注意的是,绝对倍数在很大程度上取决于起始代码的质量。同类比较显示,过去一年中各模型的改进约为 3 倍到 52 倍。
[https://www.anthropic.com/institute/recursive-self-improvement](https://www.anthropic.com/institute/recursive-self-improvement) 编辑注:脚注写道:「加速效果的大小在很大程度上取决于起始代码的改进空间,不应将其视为真实世界的训练加速。因此,绝对倍数不是这里要关注的关键数字。更值得注意的是,这个实验设置能够进行同类比较——既包括不同模型之间的比较(过去一年中约 3 倍到 52 倍),也包括与熟练人类专家的比较(在同任务上 4-8 小时内约 4 倍)。」
相似文章
@AnthropicAI:每次发布新模型时,我们都会运行相同的测试:给模型一段训练小型AI模型的代码,要求新模型对其进行加速。
Anthropic 分享了内部基准测试结果,展示了AI编码能力的显著提升:2024年5月,Claude Opus 4 在机器学习代码优化任务上平均加速约3倍;而今年4月发布的新模型 Mythos Preview 达到了约52倍加速,相比之下,一位熟练人类工程师需要4-8小时才能实现4倍加速。
它能媲美Mythos吗?
作者测试其他AI模型是否能匹配Mythos在寻找安全漏洞方面的卓越能力,建立了一个由Mythos发现的漏洞基准,并测试了像Opus这样的模型。初步结果表明Mythos可能具有独特的能力。
新Mythos检查点展示持续进步:“在32步企业网络攻击中,我们估计人类专家需要约20小时,而此检查点在十次尝试中可完成六次完整攻击。”
Mythos发布了一个新的检查点,能在十次尝试中完成六次32步企业网络攻击,而人类专家则需要约20小时。
@liu8in: 测试 Mythos 两小时 - 目前最好的代码到动作大模型,Claude Code + Fable 5 一次性生成了这个 @HyperFrames_ 启动模板
宣布推出 Mythos 级别的模型 Claude Fable 5,其能力超越此前所有通用模型,已在代码到动作任务中经过测试。
Mythos 并非通过‘黑客’训练而成。其他 AI 实验室未来也将达到 Mythos 级别的能力。
文章澄清了 AI 模型 Mythos 并非通过黑客技术训练,并预测其他 AI 实验室最终将具备类似能力。