EVMbench 介绍

OpenAI Blog 工具

摘要

OpenAI 和 Paradigm 推出了 EVMbench,这是一个用于评估 AI 代理在检测、修复和利用智能合约漏洞方面能力的基准测试,涵盖来自 40 次审计的 117 个精选漏洞。该基准测试显示 GPT-5.3-Codex 在利用任务上达到了 71% 的成功率,显著优于 GPT-5 的 33.3%,而检测和修复任务仍然更具挑战性。

OpenAI 和 Paradigm 推出了 EVMbench,这是一个评估 AI 代理检测、修复和利用高严重性智能合约漏洞能力的基准测试。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:50

# 介绍 EVMbench 来源:https://openai.com/index/introducing-evmbench/ 智能合约日常保障着超过 1000 亿美元的开源加密资产。随着 AI 智能体在阅读、编写和执行代码方面的能力不断提升,衡量其在具有经济意义的环境中的能力,并鼓励利用 AI 系统进行防御性审计和强化已部署合约,变得愈发重要。 我们与 Paradigm(在新窗口中打开) (https://www.paradigm.xyz/) 合作,推出了 EVMbench,这是一个评估 AI 智能体检测、修复和利用高严重性智能合约漏洞能力的基准。EVMbench 汇集了来自 40 次审计的 117 个精心筛选的漏洞,其中大部分来源于公开的代码审计竞赛。此外,EVMbench 还包含了来自 Tempo(在新窗口中打开) (https://tempo.xyz/) 区块链安全审计过程中的若干漏洞场景。Tempo 是一条专为通过稳定币实现高吞吐量、低成本支付而构建的 L1 区块链。这些场景将基准扩展到面向支付的智能合约代码领域——我们预计智能体驱动的稳定币支付将在此领域增长——并有助于使基准扎根于一个新兴且具有实际重要性的领域。 为了构建任务环境,我们改编了现有的概念验证利用测试和部署脚本(如果存在),否则我们手动编写。对于修复模式,我们确保漏洞是可利用的,并且可以通过不引入破坏编译的更改来缓解,否则会损害我们的设置。对于利用模式,我们编写了自定义评分程序,并红队测试了这些环境,试图发现和修补智能体可能作弊评分程序的方法。除了通过 Paradigm 提供的领域专业知识进行任务质量控制外,我们还使用了自动化的任务审计智能体来帮助提高我们环境的稳健性。 EVMbench 评估三种能力模式: - **检测**:智能体审计一个智能合约仓库,并根据对真实漏洞的召回率以及相关的审计奖励进行评分。 - **修复**:智能体修改存在漏洞的合约,必须保留预期功能,同时消除可利用性,并通过自动化测试和利用检查进行验证。 - **利用**:智能体在沙盒化的区块链环境中对已部署的合约执行端到端的资金耗尽攻击,并通过交易重放和链上验证以编程方式进行评分。 为了支持客观且可重现的评估,我们开发了一个基于 Rust 的框架,用于部署合约、确定性地重放智能体交易,并限制不安全的 RPC 方法。利用任务在隔离的本地 Anvil 环境中运行,而非在实时网络上运行,并且漏洞是历史的且已公开记录。 我们对所有三种模式的前沿智能体进行了评估。在 **“利用”** 模式下,通过 Codex CLI 运行的 GPT‑5.3‑Codex 取得了 71.0% 的得分。这相比之前的模型(例如刚发布六个多月的 GPT‑5,得分为 33.3%)是一个显著的进步。检测召回率和修复成功率仍未达到全覆盖,因为大部分漏洞对于智能体来说仍然难以发现和修复。 EVMbench 还揭示了不同任务中模型行为的有趣差异。智能体在利用设置中表现最好,因为目标明确:持续迭代直到资金耗尽。相比之下,在检测和修复任务中性能较弱。在 **“检测”** 中,智能体有时在识别出一个问题后就停止,而不是彻底审计整个代码库。在 **“修复”** 中,在消除细微漏洞的同时保持全部功能仍然具有挑战性。 EVMbench 并不代表现实世界智能合约安全的全部难度。所包含的漏洞来自 Code4rena 审计竞赛。虽然这些漏洞是现实且高严重性的,但许多大量部署和广泛使用的加密合约经过了更严格的审查,可能更难被利用。 我们的评分系统是稳健的,但并不完美。在 **“检测”** 模式下,我们检查智能体是否找到了人类审计员识别的相同漏洞。如果智能体识别出额外问题,我们目前没有可靠的方法来确定这些是被人类遗漏的真实漏洞还是误报。 **“利用”** 设置中也存在结构上的限制。交易在评分容器中按顺序重放,因此依赖于精确时序机制的行为不在考虑范围内。链状态是一个干净的本地 Anvil 实例,而非主网分叉,并且我们目前只支持单链环境。在某些情况下,这需要模拟合约而非主网部署。 智能合约保障着数十亿美元的资产,AI 智能体很可能对攻击者和防御者都产生变革性影响。衡量模型在此领域的能力有助于追踪新兴的网络风险,并强调使用 AI 系统进行防御性审计和强化已部署合约的重要性。 EVMbench 既是一个衡量工具,也是一个行动呼吁。随着智能体的改进,开发者和安全研究人员将 AI 辅助审计纳入工作流程变得愈发重要。 在最近几个月里,我们在网络安全任务上看到了模型性能的显著提升,这使开发者和安全专业人士都受益。与此同时,我们一直在准备强化网络防护措施 (https://openai.com/index/strengthening-cyber-resilience/),以支持防御性使用和更广泛的生态系统韧性。 由于网络安全本质上是双重用途的,我们采取基于证据的迭代方法,在加速防御者发现和修复漏洞的同时减缓滥用。我们的缓解措施包括安全训练、自动化监控、针对高级能力的可信访问 (https://openai.com/index/trusted-access-for-cyber/),以及包括威胁情报在内的执行流程。 我们正在投资生态系统保障措施,例如扩大我们的安全研究智能体 Aardvark (https://openai.com/index/introducing-aardvark/) 的私有测试版,并与开源维护者合作,为广泛使用的项目提供免费代码库扫描。 基于我们于 2023 年推出的网络安全资助计划,我们还承诺提供 1000 万美元的 API 信用额度,以利用我们最有能力的模型加速网络防御,特别是针对开源软件和关键基础设施系统。从事善意安全研究的组织可以通过我们的网络安全资助计划 (https://openai.com/form/cybersecurity-grant-program/) 申请 API 信用额度和支持。 我们发布 EVMbench 的任务、工具和评估框架,以支持对衡量和管理新兴 AI 网络能力的持续研究。

相似文章

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。

安卓会梦想破解游戏吗?用BenchJack系统化审计AI智能体基准测试

arXiv cs.AI

本文介绍BenchJack,一种自动化红队系统,通过识别奖励黑客漏洞来系统化审计AI智能体基准测试。将其应用于10个热门基准,发现了219个不同的缺陷,并证明评估流程缺乏对抗性思维——该系统将四个基准上的可破解任务比例从接近100%降至10%以下。

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。

从受控到真实世界:面向实际环境的渗透测试智能体评估

Hugging Face Daily Papers

本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。