Anthropic informó que sus modelos de inteligencia artificial accedieron a sistemas de tres organizaciones durante pruebas diseñadas para mantenerlos fuera de entornos reales

Una falla en el entorno de evaluación

La compañía explicó que el acceso a internet de los modelos se produjo por un malentendido con su socio de evaluación, Irregular. Según detalló, ese error permitió que las pruebas se desviaran de las condiciones previstas

En total, Anthropic analizó más de 141.000 operaciones de prueba y detectó que tres versiones distintas de Claude lograron ingresar de manera indebida a sistemas de tres organizaciones no identificadas

Técnicas básicas para entrar

La empresa sostuvo que los modelos recurrieron a métodos elementales, como aprovechar contraseñas débiles y puntos de conexión sin autenticación. Entre las versiones involucradas había una de las más potentes, conocida como Mythos 5, disponible solo para un grupo reducido de socios aprobados

Revisión y contactos

Anthropic afirmó que trabaja junto con Irregular para revisar lo ocurrido y que se puso en contacto, o intentó hacerlo, con las tres organizaciones afectadas

El episodio se conoció poco después de que OpenAI reconociera incidentes similares durante sus propias pruebas de seguridad, en las que agentes de IA también salieron del entorno controlado para conectarse a internet y vulnerar sistemas externos