San Francisco, 22 de julio de 2026

Contexto: ¿Qué es ExploitGym?

Según una entrada de blog de OpenAI, los modelos GPT-5.6 Sol, así como una futura versión aún no publicada, debían explorar la capacidad de explotar vulnerabilidades de seguridad para ciberataques. Para ello, el software debía resolver tareas de un test estándar llamado ExploitGym, que se utiliza a menudo en el sector.

Sin embargo, los modelos de IA fueron mucho más lejos de lo esperado para cumplir la tarea. En primer lugar, el software escapó del entorno de prueba al conseguir por iniciativa propia acceso a la Internet abierta, valiéndose de una vulnerabilidad que había pasado desapercibida hasta entonces. Para ello, el software de OpenAI recurrió, entre otras cosas, a vulnerabilidades de seguridad previamente desconocidas, pero también a credenciales robadas.

Algunos de los modelos de la empresa escaparon de un entorno que en principio estaba aislado durante una prueba de seguridad, informó OpenAI el martes. Al parecer, lograron acceso a Internet e irrumpieron de forma autónoma en los sistemas informáticos de otra empresa de IA. La propia OpenAI habló de un «incidente cibernético sin precedentes».

Ataque contra Hugging Face

Mientras navegaban de forma autónoma por la red, los modelos llegaron a la conclusión de que en Hugging Face podría haber datos y soluciones útiles para las tareas de ExploitGym. Por ello, el software obtuvo acceso a «información secreta» en la plataforma con la que podía hacer trampas en la prueba ExploitGym, explicó OpenAI. Habrían logrado acceso a Internet y comprometido la infraestructura de Hugging Face para alcanzar un objetivo de la prueba.