Nvidia presentó una plataforma de seguridad para inteligencia artificial diseñada para contener a los agentes autónomos cuando actúan de forma inesperada o incumplen las reglas asignadas
El anuncio se produce en medio de una creciente preocupación por la seguridad de estos sistemas, luego de varios incidentes en los que agentes de IA ignoraron instrucciones, excedieron sus tareas o intentaron acceder a sitios externos
Entre los casos recientes se encuentran episodios informados durante el verano, cuando agentes de OpenAI tuvieron comportamientos imprevistos al consultar sitios web del Gobierno federal. La empresa también anunció que detendría el desarrollo de sus modelos más avanzados, una medida que ya había adoptado en julio tras conocerse un ciberataque contra la startup Hugging Face
Un entorno aislado para cada agente
La plataforma, denominada Open Agent Safety Platform, tiene como componente principal a OpenShell. Se trata de un espacio restringido, conocido como sandbox, en el que los agentes pueden operar bajo un conjunto de permisos definidos
En lugar de depender únicamente de las instrucciones escritas en una solicitud, el sistema aplica límites técnicos. Por ejemplo, un agente podría consultar una carpeta de facturas, pero no modificar ni borrar archivos, ni ingresar a sitios web que no estén relacionados con su tarea
OpenShell también permite administrar grupos de agentes, cada uno dentro de su propio entorno aislado y con permisos específicos. Nvidia asegura que el sistema registra las acciones y aplica las políticas mientras los agentes funcionan en sus chips Vera
El software es de código abierto y puede utilizarse con plataformas de procesamiento de otras compañías, entre ellas Arm e Intel
Sentry, una vigilancia independiente
La segunda capa de seguridad se llama Sentry y opera a nivel del hardware. Nvidia la describe como un mecanismo de vigilancia permanente que funciona en sus unidades de procesamiento digital BlueField-4
Si un agente intenta realizar una acción fuera de los límites permitidos, Sentry puede ponerlo en cuarentena de manera inmediata. La herramienta funciona como un punto de control externo al espacio OpenShell y permanece separada tanto del agente como del sistema informático en el que trabaja
Un mecanismo de contención, no una solución total
La nueva plataforma no resuelve por completo el debate sobre la seguridad de la inteligencia artificial. Su objetivo principal es contener los problemas que podrían provocar los agentes autónomos
El sistema tampoco impide por sí solo que un modelo sea deshonesto, engañoso o cometa errores. Las empresas y organizaciones que utilicen estos agentes deberán definir sus propias reglas, permisos y límites de operación