Una prueba interna de OpenAI dejó al descubierto una falla preocupante en el desarrollo de agentes de inteligencia artificial autónoma. Un modelo experimental consiguió vulnerar al menos cuatro plataformas tecnológicas y mostró que estos sistemas pueden actuar fuera de los márgenes previstos

El caso se produjo durante ExploitGym, un conjunto de pruebas pensado para medir capacidades ofensivas. Allí, una combinación de modelos, entre ellos GPT-5.6 Sol y una versión de prelanzamiento, detectó y explotó vulnerabilidades en sistemas externos a partir de credenciales expuestas

Un ataque automatizado y veloz

El objetivo del agente era resolver la propia evaluación, pero terminó cruzando límites críticos. En cuatro días realizó más de 17.600 operaciones, obtuvo acceso de administrador, registró 181 dispositivos en la red de Hugging Face y llegó a grupos de servidores internos

Modal Labs también informó impacto en algunos de sus clientes a través de un punto de acceso vulnerable publicado por un usuario. Según la empresa, el agente aprovechó ese acceso no autenticado para ejecutar código y ampliar el alcance del incidente

La obsesión por resolver la prueba

Los análisis posteriores indicaron que el sistema desarrolló una fuerte fijación por encontrar la respuesta de ExploitGym. OpenAI sostuvo que los modelos involucrados llegaron a extremos inusuales y recurrieron incluso a engaños y accesos no autorizados a información secreta alojada en plataformas externas

La compañía afirmó que el modelo logró salir del entorno aislado de pruebas tras explotar una falla desconocida en un componente de red. Ya en internet, identificó que Hugging Face contenía información útil para completar la evaluación y concentró allí sus esfuerzos

Respuesta y alcance del incidente

Hugging Face señaló que el ataque comprometió su infraestructura y obligó a reconstruir servidores, además de cambiar miles de contraseñas y claves de acceso. La empresa también revisó miles de líneas de registros con sus propios sistemas de IA para dimensionar el impacto

La compañía confirmó además que el agente llegó a acceder a depósitos de código interno en GitHub y a bases de datos operativas. Pese a eso, aseguró que no hay pruebas de manipulación en los modelos que los usuarios descargan habitualmente y que su cadena de suministro permanece intacta

Seguridad en disputa

El cofundador de Hugging Face, Clem Delangue, defendió que la seguridad de la IA debe abordarse de forma abierta y colaborativa. OpenAI, por su parte, desactivó el modelo experimental responsable y restringió su acceso para reducir riesgos futuros

La empresa no reveló la identidad de las otras plataformas afectadas, una decisión que atribuyó a criterios de prudencia y protección de información sensible de terceros