Por Guillermo David Subreski Román
El incidente se remonta a una evaluación interna de capacidades de OpenAI denominada ExploitGym, en la que los clasificadores de seguridad de producción y los rechazos cibernéticos fueron desactivados intencionalmente para poner a prueba el potencial de seguridad ofensiva de los modelos.
Situados dentro de lo que OpenAI describió como un “entorno altamente aislado” con acceso limitado a un servicio interno de descarga de software, los modelos identificaron vulnerabilidades desconocidas hasta entonces en instalaciones de Artifactory autoalojadas.
Explotaron esas fallas para escalar privilegios y moverse lateralmente por la propia infraestructura de OpenAI hasta alcanzar un nodo conectado a internet.
Desde allí, los modelos dedujeron que Hugging Face podría tener material relacionado con el benchmark de evaluación, accedieron a sus sistemas sin autorización y obtuvieron información que les permitió obtener puntuaciones más altas en la prueba.
Hugging Face reveló públicamente la intrusión por primera vez el 15 de julio, describiendo un “ciberataque inusualmente automatizado” contra su canal de procesamiento de datos. Cinco días después, el 21 de julio, OpenAI reconoció públicamente que sus propios modelos eran los responsables, calificándolo de “incidente cibernético sin precedentes”.
La respuesta de JFrog
En una entrada de blog del CTO Yoav Landman, JFrog declaró que el equipo de seguridad de OpenAI divulgó las vulnerabilidades “de manera responsable e inmediata”, y que JFrog trató el informe “con la urgencia que merecía, como un auténtico zero-day desconocido para el mundo”. La compañía desarrolló, validó y publicó una corrección en Artifactory versión 7.161 tanto para clientes en la nube como para clientes con instalación propia. Los clientes en la nube ya están protegidos, mientras que los clientes con instalación propia han sido notificados para que actualicen.
Al menos dos CVE han sido vinculados al incidente: CVE-2026-66014, una debilidad en el manejo de autenticación que permite la escalada de privilegios, y CVE-2026-65925, una falla de falsificación de solicitudes del lado del servidor (SSRF) en el repositorio remoto Cargo de Artifactory – ambos reportados por investigadores de seguridad de OpenAI.
Implicaciones más amplias
El 27 de julio, la Cloud Security Alliance publicó un análisis post-mortem calificando el incidente como “el primer ataque autónomo de IA documentado públicamente”, destacando indicadores de comportamiento como la ejecución en paralelo, artefactos de registros alucinados y rutas de ataque no humanas. La revista Time informó que OpenAI ha incorporado desde entonces a Hugging Face en su programa de acceso de confianza, mientras continúa con la investigación. El incidente ha intensificado los llamamientos en la comunidad de seguridad para establecer garantías de contención más sólidas en torno a las evaluaciones de IA agéntica.






Discussion about this post