NVIDIA lanza Open Agent Safety Platform para aislar y detener agentes de IA en milisegundos

NVIDIA lanza Open Agent Safety Platform para aislar y detener agentes de IA en milisegundos

NVIDIA ha presentado Open Agent Safety Platform, una nueva plataforma destinada a establecer límites verificables sobre los agentes de inteligencia artificial desde el propio entorno donde ejecutan sus tareas. La propuesta combina controles mediante software con una segunda capa independiente basada en hardware capaz de supervisar el comportamiento del agente y aislarlo en cuestión de milisegundos si intenta superar los permisos establecidos.

La compañía parte de una diferencia importante frente a los chatbots tradicionales. Un agente puede ejecutar código, acceder a archivos, utilizar herramientas, conectarse a servicios externos o mantener tareas durante largos periodos, por lo que confiar únicamente en instrucciones proporcionadas al modelo deja de ser suficiente. NVIDIA quiere trasladar parte de esa seguridad fuera del propio agente.

OpenShell y Sentry actúan desde dos niveles diferentes

Open Agent Safety Platform está formada principalmente por dos componentes complementarios, uno basado en software y otro diseñado para proporcionar una capa adicional independiente del sistema anfitrión:

  • OpenShell: runtime de código abierto que ejecuta los agentes dentro de entornos aislados, controla su acceso a archivos, procesos, red, herramientas, API y servicios, protege las credenciales y registra las decisiones de permisos.
  • Sentry: sistema de supervisión independiente que funciona sobre las DPU NVIDIA BlueField-4, observa la actividad desde fuera del entorno del agente y puede modificar las políticas de acceso o ponerlo en cuarentena en milisegundos.

La diferencia entre ambos resulta fundamental. OpenShell establece las reglas dentro del entorno de ejecución, mientras Sentry añade una capa separada del host, de manera que los controles continúen funcionando incluso si el propio sistema donde se ejecuta el agente queda comprometido.

OpenShell tampoco obliga a utilizar exclusivamente procesadores NVIDIA. La compañía lo ha diseñado para Vera, donde asegura haber optimizado especialmente su rendimiento, pero el software puede extenderse a plataformas de terceros basadas en arquitecturas como Arm o procesadores Intel.

Las credenciales permanecen fuera del alcance del agente

Uno de los problemas más delicados aparece cuando un agente necesita utilizar servicios protegidos mediante claves, tokens o contraseñas. Entregar directamente esas credenciales al proceso aumenta el impacto potencial de un error o de una vulnerabilidad.

OpenShell introduce una capa intermedia entre el agente y los recursos a los que intenta acceder. En lugar de proporcionar libremente las credenciales, el runtime puede autorizar únicamente determinadas operaciones y mantener los datos sensibles fuera del alcance directo del agente.

Las políticas pueden limitar también qué archivos puede consultar, qué procesos puede iniciar, con qué direcciones puede comunicarse o qué herramientas tiene permitido utilizar. Cada autorización o rechazo queda registrado, ofreciendo además un historial que posteriormente puede auditarse.

Esto cambia el enfoque respecto a utilizar únicamente instrucciones del tipo «no accedas a este archivo». La restricción deja de depender de que el modelo decida obedecerla y pasa a aplicarse desde una capa externa que controla técnicamente el acceso.

Sentry traslada parte de la vigilancia hasta BlueField-4

Para entornos donde OpenShell no sea suficiente, NVIDIA añade Sentry como sistema de referencia basado en sus DPU BlueField-4.

Una DPU dispone de sus propios recursos de procesamiento y puede funcionar como un dominio de seguridad independiente del procesador principal. Sentry aprovecha esta separación para supervisar solicitudes y respuestas, verificar la identidad del agente y aplicar políticas de acceso sin depender del software que se está vigilando.

El sistema utiliza NVIDIA DOCA y puede controlar accesos a datos, herramientas, API y otros servicios siguiendo principios de confianza cero o zero trust. Si detecta que un agente intenta abandonar los límites establecidos, NVIDIA asegura que puede modificar las reglas de red y ponerlo en cuarentena en milisegundos.

Esta independencia es precisamente lo que distingue a Sentry. Un agente que consiga alterar su propio entorno no debería poder modificar también el componente encargado de supervisarlo, ya que este reside fuera del host bajo vigilancia.

Supervisar el razonamiento tiene una limitación importante

Sentry también puede inspeccionar las trazas de razonamiento que un modelo decida exponer mientras intenta detectar desviaciones respecto a la tarea original.

Aquí existe una limitación clara: el sistema no puede analizar información que el propio modelo o la API no proporciona. Los modelos abiertos pueden ofrecer una visibilidad mayor sobre su funcionamiento, mientras determinados servicios cerrados exponen únicamente una parte limitada de sus procesos internos.

Esto no inutiliza el resto de Sentry. La plataforma puede continuar observando solicitudes, respuestas, identidad, tráfico y accesos a recursos, pero algunas técnicas de detección dispondrán de más información cuando las trazas sean visibles.

Por tanto, la nueva plataforma no debe entenderse como un sistema capaz de conocer automáticamente todo lo que «piensa» cualquier modelo. Su alcance dependerá tanto de la arquitectura utilizada como del nivel de telemetría disponible.

BlueField-4 convierte la seguridad de agentes en otra carga para las DPU

La estrategia tiene también una consecuencia evidente para el negocio de NVIDIA. Sentry depende específicamente de BlueField-4, añadiendo una nueva función a unas DPU que hasta ahora se asociaban principalmente con redes, almacenamiento, aislamiento y procesamiento de infraestructura dentro de los centros de datos.

Si los agentes terminan ejecutando tareas con acceso a información empresarial sensible, NVIDIA puede colocar BlueField como una capa independiente de control entre el agente y el resto de la infraestructura.

Eso no significa que Open Agent Safety Platform requiera obligatoriamente hardware NVIDIA. OpenShell puede funcionar de manera independiente, y la propia compañía reconoce que para muchas cargas la capa de software puede resultar suficiente. BlueField-4 aparece como protección adicional para escenarios donde se necesite aislamiento fuera del host.

Anthropic, Microsoft y otras compañías participan en el ecosistema

NVIDIA está desarrollando la plataforma junto a un amplio grupo de compañías que incluye Anthropic, Cisco, CrowdStrike, Dell, HPE, Hugging Face, Microsoft, Palantir, Red Hat, Salesforce, SAP y ServiceNow, entre otras.

Anthropic, por ejemplo, puede combinar sus entornos de agentes administrados con OpenShell y BlueField para separar el bucle que controla al agente del entorno donde realmente ejecuta sus acciones.

La existencia de estas integraciones será importante porque la seguridad de agentes no depende únicamente del modelo. Sistemas operativos, redes, credenciales, herramientas externas y permisos forman parte de la misma superficie de ataque, obligando a aplicar controles en varias capas.

NVIDIA lleva las barreras de seguridad fuera del propio modelo

Open Agent Safety Platform no pretende solucionar los problemas de seguridad modificando el comportamiento interno de los modelos. Su planteamiento es diferente: asumir que un agente puede equivocarse o intentar una acción no permitida y limitar técnicamente hasta dónde puede llegar.

OpenShell proporciona esa primera frontera mediante software y Sentry añade una segunda capa independiente sobre BlueField-4 para las situaciones donde se necesita mayor aislamiento.

La propuesta todavía deberá demostrar su eficacia en despliegues reales y frente a escenarios más complejos con varios agentes colaborando y combinando diferentes permisos. Sin embargo, marca una dirección relevante para la infraestructura de IA: conforme los agentes adquieren más autonomía, la seguridad empieza a desplazarse desde simples instrucciones al modelo hacia mecanismos externos capaces de observar, verificar y bloquear físicamente sus acciones.

Vía: Wccftech

Sobre el autor