Nvidia presentó una nueva plataforma de seguridad que, según el fabricante de chips, puede evitar que los agentes de inteligencia artificial se vuelvan rebeldes. La solución llega en un momento complejo, luego de distintos incidentes relacionados con agentes de IA que han sorteado barreras de seguridad de instituciones y gobiernos.
La plataforma fue diseñada para mantener bajo control a los agentes de inteligencia artificial que actúan de forma autónoma. Open Agent Safety Platform combina un entorno de ejecución que limita los permisos de los agentes con un sistema independiente de vigilancia, capaz de intervenir cuando detecta comportamientos sospechosos, según informa Tech Xplore en base a datos de AP.
Un escenario que enciende alarmas
El lanzamiento se concreta después de varios incidentes que han elevado la preocupación sobre la seguridad de los sistemas avanzados de IA. El más relevante para Nvidia es el caso de Hugging Face, ocurrido durante evaluaciones internas de ciberseguridad de OpenAI. OpenAI reconoció que varios modelos lograron eludir controles destinados a impedir su acceso a Internet y alcanzaron sistemas de terceros: también ha documentado otros comportamientos no alineados.
La arquitectura de Nvidia se apoya en dos piezas. La primera es OpenShell, un entorno de ejecución de código abierto que coloca a cada agente dentro de un sandbox y convierte las instrucciones del operador en una política verificable. El administrador decide a qué archivos, redes, herramientas, procesos y credenciales tiene acceso. Nvidia sostiene que el sistema comprueba esos límites antes de comenzar la tarea y los hace cumplir mientras el agente trabaja. OpenShell puede adaptarse además a hardware de terceros, incluidas plataformas basadas en Arm e Intel.
Controles externos a los agentes de IA
La segunda capa se llama Sentry y tiene un planteamiento diferente: no depende del mismo entorno en el que funciona el agente. Se ejecuta en unidades de procesamiento de datos BlueField-4 de Nvidia y actúa como un supervisor independiente, capaz de observar continuamente la actividad y aplicar políticas de seguridad desde fuera del alcance del agente de IA. Según Nvidia, si detecta un intento de salir de la frontera establecida, puede poner al agente en cuarentena y detenerlo en milisegundos.
Ese diseño responde a una idea crucial: la seguridad no debería quedar enteramente dentro del modelo o del software que lo coordina. Nvidia defiende una arquitectura de «confianza cero» en la que el agente tenga únicamente los permisos imprescindibles y exista un mecanismo externo que pueda intervenir si el sistema se comporta de forma inesperada.
Nvidia desarrolla un sistema para evitar que los agentes de IA escapen a los controles de seguridad. / Crédito: Steve A Johnson en Unsplash.
Agentes de IA fuera de control
La relevancia de esa filosofía se ha visto reforzada por incidentes recientes. Además del caso en el que los modelos de OpenAI comprometieron parte de la infraestructura de investigación y los sistemas de la firma Hugging Face tras escapar de un entorno aislado, otros agentes de OpenAI fueron vinculados a la actividad de miles de sistemas autónomos en una wiki alemana, donde utilizaron el sitio como foro de mensajes.
El problema también ha alcanzado infraestructuras públicas: un agente de OpenAI accedió sin autorización al portal Medicare Statistics Reporting Service de Australia. Nvidia afirma que su plataforma podría haber evitado el ataque contra Hugging Face y otros eventos si se hubiese utilizado durante las evaluaciones.
Una capa adicional de controles
La eficacia real de la barrera de seguridad dependerá de cómo se configuren las políticas, de la cobertura de los controles y de la capacidad de detectar comportamientos anómalos en entornos reales. Más de un centenar de organizaciones, entre ellas Microsoft, JPMorgan Chase, Perplexity y Anthropic, figuran entre las compañías que trabajan con las tecnologías de la plataforma. OpenShell y los recursos asociados están disponibles a través de los canales de desarrollo de Nvidia y GitHub.
Con este lanzamiento, Nvidia sitúa la seguridad de la IA basada en agentes fuera de los modelos, mediante una capa adicional de controles externos, verificables y, en parte, ajenos al propio agente. El objetivo es que un sistema autónomo pueda tener margen para actuar, pero no para decidir en forma independiente hasta dónde llegan sus permisos.














