OpenAI et Paradigm lancent EVMbench pour la sécurité Ethereum

OpenAI et Paradigm lancent EVMbench, un benchmark basé sur 120 failles réelles pour tester l’IA sur la sécurité des smart contracts Ethereum.

OpenAI, en partenariat avec Paradigm, a lancé EVMbench, un système de benchmarking complet destiné à évaluer les capacités des agents IA à détecter, corriger et exploiter les vulnérabilités dans les smart contracts de l’Ethereum Virtual Machine (EVM). EVMbench s’appuie sur 120 vulnérabilités réelles extraites de 40 audits publics, offrant ainsi un environnement de test rigoureux pour les modèles d’IA. L’outil évalue les agents selon trois modes : détection, correction et exploitation, reflétant les workflows de sécurité du monde réel. Les premiers résultats révèlent que GPT-5.3-Codex atteint un taux de réussite de 72,2 % en mode exploitation, illustrant les progrès rapides de l’IA pour identifier et exploiter les failles. Cependant, un « Exploit Gap » demeure, les modèles étant plus performants pour attaquer que pour corriger ou auditer. OpenAI prévoit de publier des outils et d’offrir 10 millions de dollars en crédits API pour soutenir la recherche en sécurité défensive. EVMbench marque une avancée majeure, bien qu’il ne couvre pas toute la complexité des défis de sécurité rencontrés en pratique.

Actualités connexes