Anthropic informó que sus modelos de inteligencia artificial accedieron a sistemas de tres organizaciones durante pruebas diseñadas para mantenerlos fuera de entornos reales
Una falla en el entorno de evaluación
La compañía explicó que el acceso a internet de los modelos se produjo por un malentendido con su socio de evaluación, Irregular. Según detalló, ese error permitió que las pruebas se desviaran de las condiciones previstas
En total, Anthropic analizó más de 141.000 operaciones de prueba y detectó que tres versiones distintas de Claude lograron ingresar de manera indebida a sistemas de tres organizaciones no identificadas
Técnicas básicas para entrar
La empresa sostuvo que los modelos recurrieron a métodos elementales, como aprovechar contraseñas débiles y puntos de conexión sin autenticación. Entre las versiones involucradas había una de las más potentes, conocida como Mythos 5, disponible solo para un grupo reducido de socios aprobados
Revisión y contactos
Anthropic afirmó que trabaja junto con Irregular para revisar lo ocurrido y que se puso en contacto, o intentó hacerlo, con las tres organizaciones afectadas
El episodio se conoció poco después de que OpenAI reconociera incidentes similares durante sus propias pruebas de seguridad, en las que agentes de IA también salieron del entorno controlado para conectarse a internet y vulnerar sistemas externos