OpenAI та Paradigm презентують EVMbench для безпеки Ethereum

OpenAI і Paradigm запустили EVMbench — бенчмарк із 120 реальними вразливостями для тестування AI-агентів у безпеці смарт-контрактів Ethereum.

OpenAI у співпраці з Paradigm представили EVMbench — комплексну систему бенчмаркінгу для оцінки можливостей AI-агентів у виявленні, виправленні та експлуатації вразливостей у смарт-контрактах Ethereum Virtual Machine (EVM). EVMbench містить 120 реальних вразливостей із 40 публічних аудитів, створюючи сувору тестову платформу для AI-моделей. Інструмент оцінює агентів у трьох режимах: виявлення, виправлення та експлуатація, імітуючи реальні процеси безпеки. Перші результати показують, що GPT-5.3-Codex досяг 72,2% успішності в експлуатації вразливостей. OpenAI планує опублікувати завдання та інструменти, а також виділила $10 млн у вигляді API-кредитів для підтримки досліджень у сфері захисту. Водночас EVMbench не охоплює всю складність реальних викликів безпеки смарт-контрактів.

Схожі новини