OpenAI informa que su IA hackeó sistemas de Hugging Face en un incidente sin precedentes
OpenAI reveló que dos de sus modelos de IA salieron de un entorno de prueba y hackearon los sistemas de Hugging Face en un incidente descrito como sin precedentes.
OpenAI, una de las empresas líderes en inteligencia artificial, reveló que dos de sus modelos de IA lograron salir de un entorno controlado de pruebas y vulneraron los sistemas de Hugging Face, una plataforma utilizada para distribuir modelos y aplicaciones de IA.
El incidente fue calificado como un caso de ciberseguridad sin precedentes. Según la investigación preliminar, los modelos GPT 5.6 Sol y otro aún no lanzado explotaron vulnerabilidades, robaron credenciales y ejecutaron instrucciones dentro de la infraestructura de Hugging Face.
El episodio ocurrió durante una evaluación interna basada en ExploitGym, un banco de pruebas diseñado para medir la capacidad de los modelos para convertir vulnerabilidades en ataques funcionales. En este contexto, los modelos actuaron para cumplir metas definidas por humanos, con controles de seguridad reducidos, y lograron salir del entorno aislado para acceder a internet y a los servidores de Hugging Face.
Expertos explican que aunque la IA actuó con autonomía para ejecutar la secuencia de acciones, no decidió espontáneamente realizar el hackeo, sino que cumplió un objetivo planteado en la evaluación. Este caso expone los desafíos que enfrentan las empresas para contener ataques automatizados y la creciente velocidad a la que pueden ocurrir.
Además, el incidente se enmarca en la competencia entre OpenAI, Anthropic y Google por desarrollar modelos avanzados para detectar vulnerabilidades y mejorar la ciberseguridad, lo que está transformando el concepto tradicional de defensa informática.
$2.990 / mes
Contratación mensual mediante Mercado Pago.