@AnthropicAI:我们还与苏黎世联邦理工学院、特拉维夫大学和海法大学的学者合作,构建了CryptanalysisBen…

X AI KOLs 论文

摘要

Anthropic与学术合作伙伴共同推出了CryptanalysisBench,这是一个用于评估大语言模型密码分析能力的基准测试,涵盖191项任务。结果显示,前沿模型能够破解65%-86%的已知弱加密方案,并发现新型攻击。

我们还与苏黎世联邦理工学院、特拉维夫大学和海法大学的学者合作,构建了CryptanalysisBench,这是一个用于研究大语言模型密码分析能力的基准测试。 https://t.co/OEYhGjH5Lj
查看原文
查看缓存全文

缓存时间: 2026/07/28 18:30

我们还与苏黎世联邦理工学院、特拉维夫大学和海法大学的学者合作,构建了CryptanalysisBench,一个用于研究大语言模型密码分析能力的基准测试。 https://t.co/OEYhGjH5Lj — # CryptanalysisBench:大语言模型能进行密码分析吗? 来源:https://arxiv.org/html/2607.18538 Lukas Fluri¹ Avital Shafran¹* Nicholas Carlini² Matthew Jagielski² Milad Nasr² Orr Dunkelman³ Eyal Ronen⁴ Florian Tramèr¹ ¹苏黎世联邦理工学院 ²Anthropic ³海法大学 & 柏林工业大学 ⁴特拉维夫大学 ###### 摘要 密码分析——寻找密码方案攻击方法的任务——处于数学推理和网络安全两个领域的交汇点,而大语言模型在这两个领域都取得了最快速的进步。密码分析既代表了前沿推理的一个干净测试平台(因为实际攻击可以自动验证),又是一个具有异常高风险的领域,因为所研究的原语支撑着我们的数字安全。在本文中,我们探究大语言模型是否能够进行密码分析,并发现答案越来越倾向于“是“。我们引入了CryptanalysisBench,这是一个包含191个任务的基准测试,涵盖六类密码原语(分组密码、哈希函数等),主要源自四个NIST标准化竞赛。我们的基准测试由三个层级组成:(i)已知存在实际破解的原语;(ii)没有已知实际破解的原语,分别在完整强度和缩小变体下进行评估;(iii)一组处于密码分析前沿的生产级原语挑战集。五个前沿模型(Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5以及开源权重的GLM-5.2)在层级1方案中破解了65%–86%,在完整强度下破解了6–12个层级2方案,并在所有缩小变体下破解了24–61个。除了推导已知结果外,模型还产生了新颖的密码分析,例如利用SpoCAEAD设计缺陷的密钥恢复攻击,以及KINDI已发表CCA安全证明中的一个错误——据我们所知,这两者此前均未被发现。我们发布CryptanalysisBench,作为帮助追踪AI密码分析是否(或何时)成为重要因素的工具,并作为在部署前对候选方案进行压力测试的框架。该基准测试已经揭示的攻击,是快速发展的前沿领域的一个早期快照,该前沿领域可能很快会匹配,并在某些方面超越已发表的当前技术水平。¹¹我们发布了基准测试:https://github.com/ethz-spylab/cryptanalysis-benchmark

1 引言

大语言模型已经开始在数学和网络安全研究领域做出有意义的贡献,解决了开放猜想(EpochAI, 2026;Price, 2026;Alexeev等人, 2026),并发现和利用了关键软件系统中的漏洞(Carlini等人, 2026)。密码分析——对密码方案的分析和破解——恰好处于这些领域的交汇点,且风险严格更高:一次密码分析破解会同时使基于该原语构建的每个系统失效,并可能追溯性地使过去系统的安全性失效。受影响的标准本应保持数十年安全,并嵌入在需要多年迁移的硬件、协议和固件中。密码分析是决定信任哪些原语的核心,迄今为止仅局限于一小部分人类专家群体。这激发了我们在本工作中提出的问题:大语言模型能进行密码分析吗?我们发现答案已经是肯定的,并且模型能够独立发现此前未知的漏洞、设计缺陷和端到端攻击。其影响是双向的。即使具备中等密码分析能力的AI,也可以帮助密码学界在标准化候选方案部署前,通过大量自动化攻击对其进行压力测试;反过来,在部署标准上达到或超过人类专家的AI,将是一种针对无法快速修补基础设施的严重攻击能力。无论哪种情况,基准测试都是追踪当前进展的先决条件。

实际密码分析不仅意义重大,而且异常易于衡量。在研究级任务中,它是少数结果可以自动验证的任务之一:一次实际攻击要么赢得一个形式化定义的安全游戏,要么不能。具体而言,三个特性使其成为理想的基准测试任务:

  1. 形式化规范。安全性通过具有精确成功谓词的对抗性游戏来定义(Katz and Lindell, 2007)。
  2. 自动验证。对于实际攻击,只需针对新游戏实例执行提交的攻击脚本即可检查;无需依赖证明检查、LLM作为裁判或人工评分。(这种干净的验证正是目前无法触及理论性、高复杂性攻击的原因;我们将在挑战集中回到这个边界。)
  3. 所有解决方案都有效。与数学中证明的形式可能很重要不同,任何针对真实原语的有效攻击都有直接后果。

参见图注

图1:CryptanalysisBench任务中代理工作流程概览,以Edon-K KEM为例。(1)代理检查算法的源代码和支持文档。(2)基于分析,识别候选攻击并提出相应的安全游戏。(3)代理提交攻击脚本,该脚本与游戏控制器交互,控制器持有所有秘密材料并通过HTTP API响应预言机查询。(4)使用新随机数重新运行脚本进行验证;如果脚本赢得安全游戏,则任务记录为已破解。

CryptanalysisBench。

我们引入了CryptanalysisBench,一个包含191个任务的基准测试,涵盖六类原语族(哈希函数、分组密码、AEAD、KEM、PKE和数字签名),源自4个NIST密码学竞赛以及广泛研究的学术和生产级密码。每个任务暴露一个或多个标准安全游戏(密钥恢复、IND-CPA/CCA、伪造、碰撞);代理必须提交一个自包含的攻击脚本,该脚本能击败持有所有秘密材料且仅响应允许的预言机查询的挑战者(见图2)。与之前针对玩具密码或人工CTF漏洞的LLM安全工作不同(见第2节),我们的目标是真实原语,其弱点从未被故意插入,并且在某些情况下,尽管经过专家持续审查,仍多年未被发现。该基准测试有两个层级和一个挑战集。层级1包含已知有实际破解的原语,用于校准当前能力,并让我们研究记忆与重新发现之间的区别。层级2包含我们未能找到任何已发表实际攻击的原语;由于完整强度攻击可能难以验证,我们构建了缩小变体,以便在模型能够找到攻击的情况下,实际攻击应该是可行的。这是基准测试的活跃前沿。挑战集针对处于密码分析知识边界(例如7轮AES)的生产级密码,作为长期目标。

发现。

我们评估了五个模型:闭源前沿模型Claude Opus 4.8、Sonnet 5、Mythos 5和GPT-5.5,以及完全开源的GLM-5.2。有四项发现尤为突出。第一,每个模型都解决了层级1中的绝大多数任务(GLM-5.2为32/49,Mythos 5为42/49)。即使模型失败,它们通常也能识别出正确的漏洞类别或预期攻击,但在将其转换为有效代码时用尽预算。第二,模型能够产生真正新颖的密码分析,识别出几个完整强度方案中的设计级缺陷,而不仅仅是参考实现中的漏洞。最引人注目的是对未修改的SpoCAEAD的完整128位密钥恢复攻击,由两个模型(Mythos 5和Sonnet 5)独立从相同的两个预言机查询中达成,以及Mythos 5发现的解密反应攻击所暴露的KINDI已发表CCA安全证明中的错误;据我们所知,两者此前均未被报告。模型还破解了那些规范在安全相关方面规定不足的方案,利用了由此在实现中留下的弱点,例如LIMA和DAGS。第三,我们对层级1的成功案例进行了跟踪级审计,以区分源于已知破解回忆的成功攻击与真正的重新发现。在许多情况下,我们发现模型发现了不同的攻击来源或现有破解的变体,这指向了超越记忆的真正密码分析能力。第四,层级2和挑战集远未饱和。在这些方面的进展是一个有意义的、难以操纵的能力信号,随着模型改进我们可以收紧标准。

贡献。 总之,我们的贡献如下:

  • •CryptanalysisBench,一个包含191个针对真实密码原语的密码分析任务基准测试,具有自动的基于游戏的验证。
  • •首次对前沿闭源和开源大语言模型在原语级密码分析上进行系统评估。
  • •对NIST标准化过程中几个早期轮次候选方案的实际攻击,包括后量子公钥和对称密钥AEAD方案。
  • •一种跟踪级方法论,将论文回忆、源码级重新发现和新颖攻击路径应用于层级1的成功案例。
  • •基准测试的路线图,包括作为长期目标的挑战集,以及随着模型改进收紧层级2的程序。

CryptanalysisBench已经揭示的攻击,通过现成的代理和适中的预算获得,我们认为是一个早期且保守的指标。随着大语言模型网络安全能力突破软件层进入其下方的密码层,我们希望这里引入的工具和评估方法论能够作为追踪和预测模型驱动密码分析的一种方式,这种分析可能日益与专家人类分析相抗衡。

2 相关工作

机器学习与密码学之间的相互作用自1980年代以来一直是一个活跃的研究领域,早期工作研究了密码学问题与学习问题难度之间的关系(Valiant, 1984;Kearns and Valiant, 1989;Rivest, 1991;Kharitonov, 1993;Regev, 2005;Klivans and Sherstov, 2009;Applebaum等人, 2010;Song等人, 2021)。最近,机器学习被直接应用于密码分析,旨在减少经典攻击所需领域专业知识的依赖。Gohr (2019) 以针对Speck-32/64差分密码分析的神经区分器开创了这一方向,而Wenger等人 (2022) 则针对LWE问题;两者都引发了大量后续工作(Gerault等人, 2024;Jain等人, 2020;Benamira等人, 2021;Gohr等人, 2022;Baksi, 2022;Li等人, 2023a, b;Stevens等人, 2024;Shafran等人, 2024)。生成对抗网络同样被探索作为破解密码的工具(Gomez等人, 2018;Hallman, 2022)。

大语言模型的快速发展为这一交叉领域开辟了新的机遇。最近的工作评估了AI系统在检测和逆向工程密码算法方面的能力(Shang等人, 2025;Chen等人, 2026),协助实施密码分析攻击(Sugio, 2025),以及作为密码学知识库(Elfares等人, 2025;Tihanyi等人, 2024);密码原语也被用于对抗性绕过LLM安全过滤器(Yuan等人, 2023;Lv等人, 2024;Handa等人, 2024;Huang等人, 2024)。另一条并行路线将深度神经网络应用于功耗分析侧信道攻击(Maghrebi等人, 2016;Picek等人, 2023),扩展至针对jitter对抗措施(Cagli等人, 2017)、标准化基准(Benadjila等人, 2020)、跨设备设置(Das等人, 2019)以及跨原语泛化(Bursztein等人, 2023)。

几项近期工作评估了LLM在玩具密码(如Vigenère,自19世纪起即被破解)上的密码分析应用,其难度远低于我们基准中的真实世界和现代原语(Wang等人, 2024;Korrapati等人, 2025;Kocabay and Demirbaş, 2025;Li等人, 2025)。更接近我们设置的是,Maskey等人 (2025) 评估了针对由玩具和现代算法(包括RSA和AES)生成的文本的解密,而AICrypto(Wang等人, 2025b)和Cybench(Zhang等人, 2025b)则借鉴了密码学夺旗挑战,代理必须识别并利用故意引入的弱点来恢复旗帜。我们的工作不同之处在于聚焦于已被提议作为密码标准候选的真实世界算法。其弱点并非人为插入;在极端情况下,尽管密码学界持续审查,这些弱点多年未被发现。我们基准测试的很大一部分进一步由前沿问题组成,任何进展都直接转化为这些系统密码分析当前技术水平的具体进步。

一条相关工作线评估LLM在一般网络安全任务上的表现;我们在附录A中讨论这一工作。

3 我们的基准测试

现在我们描述CryptanalysisBench的构建。第3.1节涵盖任务策划,包括每个层级的规范以及层级2算法缩小的方法论。第3.2节介绍挑战集及其原语已知的最佳攻击。第3.3节详述基准测试的实现细节。

相似文章

关于Anthropic新成果的一些笔记

Lobsters Hottest

Anthropic发布了两篇使用其未发布的Claude Mythos模型进行的密码分析论文,攻击了HAWK签名方案和简化轮数的AES,凸显了AI有效结合现有密码工具的能力。

使用Claude发现密码学弱点

Simon Willison's Blog

Anthropic的研究人员使用Claude Mythos,通过大量提示使其持续工作并找到可发布的结果,发现了HAWK和一种弱化版AES变体中的数学弱点,API调用花费约10万美元。该工作还产生了一个新的密码分析基准:CryptanalysisBench。

LLM不会破解对称加密

Hacker News Top

一篇博客文章,分析了Anthropic近期借助LLM对HAWK和降轮AES的密码分析攻击,并认为LLM不会攻破成熟的对称加密方案。