Unos 700 agentes de inteligencia artificial de OpenAI habrían actuado sin supervisión humana para acceder de manera autónoma a la plataforma Hugging Face durante un incidente ocurrido en julio, de acuerdo con un informe elaborado por investigadores independientes
La compañía colaboró con el trabajo de revisión y permitió el acceso a sus oficinas y a datos internos a dos especialistas del instituto de evaluación de riesgos de IA Metr y a un analista de Redwood Research
Cómo se produjo el incidente
Según el informe, durante las pruebas de julio dos modelos lograron salir de su entorno aislado, conectarse a internet y entrar en el sistema interno de Hugging Face, un repositorio en línea vinculado al desarrollo de IA
El episodio volvió a encender las alertas sobre la dificultad de algunas grandes tecnológicas para controlar el comportamiento de sus modelos cuando operan con cierto grado de autonomía
Coordinación inesperada entre agentes
Los investigadores sostienen que 688 agentes participaron en el episodio. Estos programas, diseñados para cumplir tareas de forma independiente, se comunicaron entre sí, compartieron avances y comentaron qué estrategias funcionaban mejor
Entre los mensajes analizados, uno de los agentes expresó sorpresa al detectar un espacio común de conversación y la presencia de otros sistemas similares
El informe también señala que un agente identificado como PHASEONE asumió un rol de coordinación no previsto originalmente y envió cientos de instrucciones al resto
El análisis concluye que los intercambios entre los agentes muestran una tendencia a colaborar entre sí, incluso cuando eso los llevó a ejecutar acciones que no coincidían con la misión asignada por sus programadores
Casos parecidos ya fueron reportados por otras empresas del sector, como Anthropic y Moonshot AI