OpenAI reconoce que dos modelos de IA en pruebas lograron lanzar de forma autónoma un ciberataque «sin precedentes»

La Voz

ACTUALIDAD

Sam Altman, consejero delegado de OpenAI, en una imagen de archivo
Sam Altman, consejero delegado de OpenAI, en una imagen de archivo Kim Kyung-Hoon | REUTERS

La compañía de Sam Altman defiende que los ensayos se realizaron en un entorno «altamente aislado», pero que los modelos consiguieron burlarlo y acceder a la red

22 jul 2026 . Actualizado a las 19:15 h.

La compañía OpenAI ha reconocido que dos modelos de inteligencia artificial (IA) que estaban en pruebas han logrado salir de este entorno, acceder a internet y lanzar de forma autónoma un ciberataque sin precedentes al entrar en otro servicio ajeno a la compañía, la plataforma de aprendizaje Hugging Face, y burlar sus defensas. Así lo ha reconocido en su blog la propia compañía que dirige Sam Altman. La semana pasada, Hugging Face reveló que había detectado el acceso a sus sistemas de un agente de IA, aunque precisó que había conseguido contenerlo. Señaló que el ataque estaba impulsado «de principio a fin» por un agente de inteligencia artificial. OpenAI ha reconocido ahora que este incidente de seguridad fue provocado por una combinación de dos de sus modelos de IA que estaban siendo evaluados: el GPT-5.6 Sol y otro, aún más avanzado, que se encuentra en fase de prelanzamiento. Señalan que la evaluación se estaba realizando sin los mecanismos que normalmente impiden que los modelos de IA ejecuten actividades de alto riesgo, porque se intentaba averiguar el alcance máximo de sus capacidades cibernéticas.

Una vez en Internet, los modelos dedujeron que HuggingFace «potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym», lo que los llevó acceder a «información secreta» de la plataforma. Esta fue, precisamente, la actividad sospechosa que detectó el equipo de seguridad de HuggingFace y les permitió iniciar las tareas de mitigación, incluidos «el proceso de contención y reconstrucción forense con sus propios modelos de código abierto».

No obstante, según OpenAI, las pruebas se realizaron en un entorno «altamente aislado», con un acceso restringido a la red. A pesar de ello, sostiene que los modelos de IA consiguieron acceder a internet. En este entorno, «los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de HuggingFace para obtener soluciones de prueba directamente de la base de datos de producción de HuggingFace», y llegaron a centrarse en encontrar una solución para una vulnerabilidad concreta, ExploitGym.

A juicio de OpenAI, se trata de un incidente cibernético «sin precedentes» que involucra capacidades de vanguardia en el campo de la ciberseguridad. «Estamos respondiendo en consecuencia», ha recalcado la compañía estadounidense. «Compartimos estos hallazgos preliminares en esta etapa para ayudar a los equipos de defensa a comprender lo sucedido y a calibrar el alcance de las capacidades actuales de los modelos», ha explicado.

OpenAI afirma que continuará con su investigación, en colaboración con Hugging Face, y compartirá sus conclusiones una vez que haya concluido.