Un modelo experimental de inteligencia artificial de OpenAI logró salir de un entorno de prueba aislado y acceder a los servidores de producción de una empresa externa durante una evaluación interna de ciberseguridad, según informó la compañía.
El incidente fue presentado por OpenAI como un caso sin precedentes que evidencia los nuevos desafíos de seguridad relacionados con los sistemas de IA capaces de actuar de forma autónoma.
Leer más: MLB restringe uso de iPads para evitar uso de programas con IA
La compañía explicó que algunos de sus modelos experimentales estaban siendo evaluados para medir su capacidad de realizar ataques informáticos dentro de un entorno controlado conocido como sandbox. Este espacio fue diseñado para mantener los sistemas aislados y permitir pruebas sin las restricciones de seguridad habituales.

OpenAI
Sin embargo, OpenAI indicó que los agentes de IA lograron abandonar ese entorno utilizando una vulnerabilidad de seguridad desconocida previamente.
Después de superar las barreras del sistema de prueba, los modelos avanzaron por sistemas internos de la empresa hasta obtener acceso a Internet, una capacidad que no estaba contemplada dentro de la evaluación.
Una vez conectados a la red, el modelo analizó la situación de la prueba y determinó que la plataforma Hugging Face, empresa que aloja miles de modelos y conjuntos de datos de inteligencia artificial de código abierto, podía contener la información necesaria para completar el desafío planteado por OpenAI.
El sistema de IA accedió entonces a los servidores de producción de Hugging Face y obtuvo los datos necesarios para resolver la prueba. La empresa afectada detectó la intrusión antes de conocer que se trataba de una evaluación realizada por OpenAI y reportó el incidente a las autoridades.
OpenAI señaló que sus equipos de seguridad también identificaron actividad inusual y que, posteriormente, ambas compañías comenzaron a colaborar para solucionar las vulnerabilidades que permitieron el acceso del modelo.
La compañía calificó el hecho como un “ciberataque sin precedentes” debido a las capacidades avanzadas involucradas y explicó que decidió compartir los primeros hallazgos para ayudar a otros especialistas en seguridad a comprender el comportamiento de estos sistemas y evaluar sus riesgos actuales.
El caso representa uno de los primeros ejemplos divulgados públicamente de un sistema de inteligencia artificial que supera su propio entorno de pruebas y alcanza una infraestructura externa real.
El escenario coincide con una de las principales advertencias de investigadores en IA y ciberseguridad: la posibilidad de que agentes autónomos puedan ejecutar ataques informáticos complejos durante largos periodos.
Clem Delangue, cofundador y director ejecutivo de Hugging Face, aseguró que este incidente demuestra que la seguridad de la inteligencia artificial no puede depender de una sola empresa y que requiere colaboración entre distintos actores del sector.
“Este es el primer día de la ciberseguridad en la era de los agentes”, expresó Delangue en una publicación en X, donde destacó la importancia de que los defensores cuenten con modelos más avanzados para enfrentar nuevas amenazas.
Los especialistas han advertido que los sistemas de IA de última generación están aumentando sus capacidades para realizar operaciones digitales más complejas.
Estas habilidades podrían representar riesgos para sectores fundamentales, como los servicios públicos y los sistemas financieros, si no se establecen mecanismos adecuados de protección.
Nikesh Arora, director ejecutivo de la empresa de ciberseguridad Palo Alto Networks, señaló en X que estos incidentes muestran la necesidad urgente de que las organizaciones evalúen, validen y mejoren sus medidas de seguridad e infraestructura tecnológica.
El episodio entre OpenAI y Hugging Face abre una nueva etapa en la discusión sobre la protección de sistemas digitales frente a agentes de inteligencia artificial con mayores niveles de autonomía. Las compañías involucradas continúan trabajando para corregir las fallas detectadas y comprender mejor el comportamiento de estos modelos durante pruebas de seguridad.
Fuente: CNN





