@NielsRogge:在 http://paperswithcode.co 上,你可以看到 Mythos 5 在流行的图表理解基准 CharXiv 上被一个 4B 开源模型超越……
摘要
一个4B开源模型在 CharXiv 图表理解基准上击败了 Mythos 5,展示了可自由获取的小模型的强大性能。
在 https://t.co/tOqTY2ZA6h 上,你可以看到 Mythos 5 在流行的图表理解基准 CharXiv 上被一个4B开源模型击败
一个在 @huggingface 上可自由获取的小型模型,可以部署在任何地方!https://t.co/e1BPGGE2JW
查看缓存全文
缓存时间: 2026/06/10 13:50
在 https://t.co/tOqTY2ZA6h 上,你可以看到 Mythos 5 被一个 4B 开源模型在 CharXiv(一个流行的图表理解基准测试)上击败。
一个可在 @huggingface 上免费获取、可在任何地方部署的小型模型!https://t.co/e1BPGGE2JW
相似文章
Mythos在网络安全/黑客攻击方面优势的更多证据——与5.5版本相比,它完成了41个n-day漏洞利用中的18个,而5.5只有1个。开源/权重模型则一个都没有。
Mythos在网络安全黑客攻击中展现了强大性能,实现了41个n-day漏洞利用中的18个,而5.5版本只有1个,开源模型则一个都没有。
@AnthropicAI:每次发布新模型时,我们都会运行相同的测试:给模型一段训练小型AI模型的代码,要求新模型对其进行加速。
Anthropic 分享了内部基准测试结果,展示了AI编码能力的显著提升:2024年5月,Claude Opus 4 在机器学习代码优化任务上平均加速约3倍;而今年4月发布的新模型 Mythos Preview 达到了约52倍加速,相比之下,一位熟练人类工程师需要4-8小时才能实现4倍加速。
OpenMythos 基准测试
OpenMythos 推出了一个新的开源基准测试,用于评估 AI 模型在神话知识方面的表现。
更新后的GPT-5.5 Cyber在CyberGym中击败Mythos 5
更新后的GPT-5.5 Cyber模型在CyberGym基准测试中超越了Mythos 5。
@karpathy: 这是一个超激动人心的发布——Claude Fable 5 与 Mythos 使用相同的基础模型,但增加了安全措施。……
Claude Fable 5 已发布,据称在各项基准测试中达到最先进水平,并在质量上有改进,尤其在复杂长任务上。它与 Mythos 使用相同的基础模型,但增加了安全措施。