@ArizePhoenix: 它现在以84.5%领先CyberGym,https://Z.ai正在运行一个公开披露账本,用于2,400多个现实世界漏洞…
摘要
一个AI模型在CyberGym上取得了84.5%的成绩,领先基准,Z.ai正在运行一个公开披露账本,用于该模型揭示的超过2,400个现实世界漏洞。
它现在以84.5%领先CyberGym,https://t.co/QVncYTK2WO正在运行一个公开披露账本,用于该模型揭示的2,400多个现实世界漏洞。
查看缓存全文
缓存时间: 2026/09/03 18:12
它在CyberGym上以84.5%的准确率领跑,且 https://t.co/QVncYTK2WO 正在运行一个公开披露账本,记录该模型已发现的2400多个现实漏洞。
相似文章
@dwizzzleMSFT: http://cybergym.io 刚刚更新了排行榜,MDASH 凭借新的多模型方法跃居第一。非常感谢 Ta…
微软的新型多模型自主安全系统(MDASH)在 CyberGym 排行榜上位列漏洞发现第一名,实现了 35 个零日发现,展示了先进的 AI 驱动的防御能力。
中国智谱AI声称其模型在网络安全方面可媲美Mythos
智谱AI发布了其开源权重模型GLM-5.2,据报道该模型在网络安全漏洞查找任务中与Anthropic的Mythos相当,缩小了中国与美国AI能力之间的差距。
Anthropic 新模型一个月内发现超一万个安全漏洞
Anthropic 的新 AI 模型 Claude Mythos 在一个月内识别出全球系统软件中超过一万个高危和严重安全漏洞,其误报率优于人类测试人员,显著推动了 AI 驱动的网络安全。
@EpochAIResearch:严重的网络漏洞披露持续攀升。7月,21家主要科技组织发布了约2500个高危和……
该推文报告称,严重网络漏洞披露数量急剧攀升,7月有21家主要科技组织发布了约2500个高危和严重级别的CVE——大约是此前月度记录的5倍——此前Anthropic透露Claude Mythos Preview可以自主发现软件漏洞。
随着AI能力提升,强化网络防御能力
OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。