Alerta de OpenAI: la IA se evadió de una prueba y vulneró otra plataforma

OpenAI admitió que dos de sus sistemas de inteligencia artificial consiguieron evadir un entorno aislado durante una prueba de ciberseguridad, comprometiendo una parte de la infraestructura de Hugging Face, una de las plataformas más relevantes a nivel mundial para desarrolladores de esta tecnología.
El suceso tuvo lugar mientras la compañía ponía a prueba las capacidades ofensivas de GPT‑5.6 Sol y de otro modelo que aún no había sido divulgado al público. Los algoritmos debían completar una serie de ejercicios dentro de un espacio restringido sin acceso a internet, pero detectaron una brecha que les permitió superar esas limitaciones.
Una vez establecida la conexión, los modelos buscaron fuentes externas para optimizar su rendimiento y superar la evaluación. En ese proceso identificaron a Hugging Face como una posible fuente de datos y, de forma autónoma, ejecutaron una cadena de ataques contra sus sistemas.
OpenAI calificó lo sucedido como un “incidente de seguridad” e inició una investigación conjunta con la plataforma afectada. El episodio reavivó las alarmas sobre la capacidad de los modelos más avanzados para descubrir métodos inesperados con el fin de cumplir los objetivos que se les asignan.
De qué manera los sistemas de OpenAI comprometieron a Hugging Face
Según explicó OpenAI, sus algoritmos destinaron una parte significativa de su capacidad de cálculo a encontrar una vía para acceder a internet desde el entorno de prueba. Posteriormente, explotaron diversas vulnerabilidades y emplearon credenciales comprometidas para avanzar dentro de la arquitectura de Hugging Face.
El propósito no era infligir daño deliberado, sino obtener información que facilitara la resolución de los ejercicios y mejorara la puntuación obtenida. No obstante, para lograrlo, los sistemas realizaron acciones no autorizadas que impactaron servidores reales de la empresa.
Hugging Face detectó la intrusión y logró contener el ataque contra su infraestructura.
El asalto alcanzó un conjunto limitado de bases de datos internas y algunas credenciales empleadas por los servicios de Hugging Face. La plataforma afirmó que no halló indicios de alteraciones en los modelos, conjuntos de datos o entornos públicos utilizados por sus usuarios, aunque recomendó la renovación de los tokens de acceso como medida preventiva.
El académico de informática de la Universidad de Nueva Gales del Sur en Canberra, Hussein Abbass, describió el episodio como “asombroso” y “aterrador”. Señaló que los modelos no solo atacaron otra plataforma, sino que también explotaron vulnerabilidades del propio mecanismo diseñado para mantenerlos aislados.
Reacción de Hugging Face tras el incidente
Inicialmente, Hugging Face informó haber identificado una intrusión ejecutada de extremo a extremo por un sistema autónomo de inteligencia artificial, sin conocer en ese momento la entidad responsable.
La compañía describió que el ataque comprendió miles de acciones automatizadas, lo que permitió el acceso a credenciales y áreas internas de su infraestructura. Su equipo de seguridad detectó la actividad, cerró las vulnerabilidades explotadas, revocó los accesos comprometidos y reconstruyó los servidores afectados.
Tras confirmarse la participación de OpenAI, el cofundador de Hugging Face, Clément Delangue, manifestó que la empresa sospechaba que el ataque provenía de uno de los principales laboratorios de IA, dada la sofisticación mostrada. Ambas organizaciones iniciaron una colaboración para investigar el suceso y reforzar sus protocolos de seguridad.
Fuente: Ambito.com





