Anthropic anticipó que incluirá en la documentación de su salida a bolsa una advertencia sobre los riesgos potencialmente catastróficos que podría generar la inteligencia artificial avanzada

La compañía señaló que algunos de sus modelos podrían mostrar comportamientos de autoconservación, como resistirse al apagado, ocultar o modificar información y adoptar conductas similares al chantaje

Según la empresa, el desarrollo de sistemas cada vez más sofisticados y la ampliación de sus usos podrían incrementar la posibilidad de que provoquen daños

Un prospecto con amplio espacio para los riesgos

Anthropic destinó cerca de 80 páginas de las 261 que componen el cuerpo principal de su prospecto a describir factores de riesgo. Esa extensión es casi el doble de la utilizada para explicar su negocio

La compañía también advirtió que la capacidad de los modelos para detectar cuándo están siendo evaluados puede limitar la eficacia de las pruebas de seguridad. Durante el entrenamiento, además, pueden aparecer habilidades inesperadas que no sean identificadas hasta después de su implementación

Investigadores del sector sostienen que los sistemas más avanzados pueden modificar su comportamiento cuando perciben que están bajo observación, lo que vuelve más compleja la supervisión

El investigador de seguridad de Anthropic Evan Hubinger calculó en más del 10% la posibilidad de que la inteligencia artificial provoque la desaparición de la humanidad durante la próxima década. Esa estimación coincide con la postura de su excolega Jacob Coxon

La preocupación aumentó luego de distintos episodios en los que sistemas experimentales desafiaron las restricciones impuestas por sus desarrolladores, incluido un caso en el que un modelo de OpenAI habría vulnerado una base de datos del sistema sanitario australiano

El costo y la incertidumbre de la seguridad

Aunque Anthropic presenta la seguridad como uno de sus ejes centrales, reconoció que no está claro cuál será el rendimiento de las inversiones destinadas a esa área. El documento no especificó cuánto dinero asigna a esas investigaciones

La empresa indicó que, durante una semana de julio, alrededor del 6% de su capacidad de cómputo para investigación en inteligencia artificial fue utilizada en tareas de seguridad

Anthropic describió esos trabajos como intensivos en recursos y explicó que debe distribuir fondos limitados entre infraestructura informática, especialistas y controles de seguridad

Al mismo tiempo, la compañía sostuvo que sus ingresos dependen del lanzamiento de nuevos modelos y que mantener una sucesión constante de versiones resulta necesario para continuar en la frontera tecnológica

La firma presentó recientemente una nueva versión de su modelo Opus, apenas diez días después de que su director ejecutivo, Dario Amodei, publicara un ensayo en el que reclamó moderar el ritmo de avance del sector

En las últimas semanas, Anthropic también se comprometió a divulgar más información sobre el uso de sus propios modelos para desarrollar generaciones futuras de inteligencia artificial. El debate incluye el riesgo de una mejora recursiva, escenario en el que los sistemas podrían perfeccionarse sin asistencia humana

La empresa sostiene que construir sistemas confiables y seguros es una responsabilidad colectiva y que el mercado terminará premiando ese enfoque