OpenAI y Paradigm presentan EVMbench para seguridad en Ethereum
OpenAI y Paradigm lanzan EVMbench, un benchmark con 120 vulnerabilidades reales para probar IA en detectar, corregir y explotar fallos en smart contracts de Ethereum.
OpenAI, en colaboración con Paradigm, ha presentado EVMbench, un sistema integral de benchmarking diseñado para evaluar las capacidades de agentes de IA en la detección, corrección y explotación de vulnerabilidades en smart contracts de Ethereum Virtual Machine (EVM). EVMbench utiliza 120 vulnerabilidades reales extraídas de 40 auditorías públicas, ofreciendo un entorno de prueba riguroso para modelos de IA. La herramienta evalúa a los agentes en tres modos: detectar, corregir y explotar, reflejando flujos de trabajo de seguridad reales. Los primeros resultados muestran que GPT-5.3-Codex logró una tasa de éxito del 72,2% en modo de explotación, destacando el rápido avance de la IA en identificar y explotar fallos. Sin embargo, persiste una "Brecha de Explotación", ya que los modelos son mejores atacando que auditando o corrigiendo vulnerabilidades. OpenAI planea publicar tareas y herramientas, y ha comprometido $10 millones en créditos API para apoyar la investigación en seguridad defensiva.