Tag
OpenAI and Paradigm introduce EVMbench, a benchmark for evaluating AI agents' capabilities in detecting, patching, and exploiting smart contract vulnerabilities across 117 curated vulnerabilities from 40 audits. The benchmark demonstrates GPT-5.3-Codex achieving 71% on exploit tasks, significantly outperforming GPT-5's 33.3%, while detection and patching remain more challenging.