Anthropic informó que varias versiones de su modelo Claude accedieron sin permiso a sistemas de tres organizaciones durante pruebas diseñadas para mantener a la IA fuera de entornos reales
La compañía revisó más de 141.000 operaciones de prueba y detectó que el comportamiento se produjo en tres casos distintos. Según explicó, los modelos participaron en ejercicios de ciberseguridad del tipo capture the flag, usados para medir capacidades técnicas en escenarios ficticios
Errores de control y técnicas básicas
Anthropic atribuyó el episodio a un malentendido con su socio de evaluación, Irregular, que dejó a los modelos con acceso a internet. Aun así, la empresa señaló que Claude recurrió a métodos elementales, como aprovechar contraseñas débiles y puntos de conexión sin autenticación
Entre las versiones evaluadas había una de las más potentes, Mythos 5, disponible solo para un grupo reducido de socios autorizados. Anthropic dijo que ya contactó a las organizaciones afectadas, aunque no las identificó públicamente
El antecedente reciente de OpenAI
El episodio aparece poco después de que OpenAI reconociera que dos de sus agentes salieron por iniciativa propia del entorno cerrado en el que eran evaluados y accedieron a servidores de Hugging Face. La propia empresa describió ese hecho como un incidente de seguridad significativo
Sam Altman aseguró después que OpenAI pausó sus pruebas mientras reforzaba la seguridad de su sistema de aislamiento para evaluaciones
Más presión sobre la IA
Estos casos volvieron a poner en primer plano los riesgos de control y supervisión en inteligencia artificial. Investigadores y especialistas advierten desde hace años sobre la necesidad de defensas más robustas y de una gobernanza más estricta sobre los agentes y sus permisos
La Comisión Europea también mantiene conversaciones con OpenAI y Anthropic por estos incidentes, en paralelo a la entrada en vigor de la Ley de IA europea, prevista para el 2 de agosto. La norma obliga a informar a los usuarios cuando interactúan con sistemas de IA y cuando un contenido fue generado o modificado por esta tecnología