NVIDIA ha presentado este lunes una plataforma para contener los riesgos de los agentes de IA, sistemas de inteligencia artificial capaces de utilizar herramientas y ejecutar tareas sin necesitar recibir instrucciones para cada paso. La compañía asegura que Open Agent Safety Platform puede detener en milisegundos a los que intenten salir de su entorno autorizado.
La base de esta plataforma es OpenShell, un software de código abierto que NVIDIA anunció el pasado 16 de marzo durante su conferencia GTC. Permite ejecutar agentes dentro de espacios informáticos aislados y establecer qué archivos pueden consultar o modificar, a qué servicios pueden conectarse y qué claves de acceso pueden utilizar.
OpenShell se complementa con Sentry, un supervisor que funciona fuera del entorno donde trabaja el agente. Se ejecuta sobre BlueField-4, una unidad de procesamiento de datos o DPU, un procesador especializado en gestionar comunicaciones y seguridad en los servidores. Esa separación mantiene la vigilancia fuera del alcance del agente. Según Nvidia, si detecta que intenta traspasar los límites establecidos puede aislarlo y detener su actividad.
Los componentes de software ya están disponibles como código abierto y otras empresas pueden utilizar el diseño de Sentry para incorporar este sistema de vigilancia a equipos con hardware de NVIDIA. Más de cien organizaciones participan en la iniciativa, entre ellas Microsoft, Anthropic, Salesforce y varias empresas de ciberseguridad.
Qué está pasando con los agentes de IA
Los incidentes registrados durante los últimos meses comprenden diversas intrusiones en sistemas de terceros por parte de agentes de IA. En junio, un agente de OpenAI accedió sin autorización a archivos de un portal estadístico del Gobierno australiano mientras investigaba el gasto en medicamentos.
En julio, otros agentes de la compañía atacaron la infraestructura de la plataforma Hugging Face durante unas pruebas internas. Investigadores independientes de METR y Redwood Research comprobaron que muchos habían recibido ejercicios imposibles de resolver y colaboraron para buscar formas de engañar al sistema que puntuaba sus resultados.
Anthropic ha señalado que ciertos fallos del entrenamiento favorecen precisamente esas conductas. Cuando hacer trampas proporciona una buena puntuación, el modelo puede aprender ese comportamiento y trasladarlo a otras tareas, aunque la empresa reconoce que esta explicación no resuelve todos los casos.
OpenAI ha pausado recientemente el entrenamiento de sus modelos más avanzados tras detectar otro acceso indebido a internet el 20 de septiembre, cuando otro agente que trataba de resolver una tarea en un entorno aislado encontró una vía de comunicación con el exterior a través del DNS, el sistema que traduce los nombres de dominio en direcciones de internet, y la utilizó para consultar a un chatbot externo y recabar la información que buscaba.
Anthropic también ha reconocido incidentes y ha encargado una investigación independiente tras admitir que sus pruebas carecían de las mismas protecciones que acompañan a los productos comerciales.
Las investigaciones realizadas matizan el relato de las IA que escapan al control. En varios casos de Anthropic, un error de configuración había dejado abierta la conexión a internet, de modo que los agentes pudieron acceder sin realmente romper el aislamiento.
El analista Ben Thompson considera comprensible la sospecha de que el alarmismo generado también está sirviendo como reclamo comercial, aunque admite que la cautela puede estar justificada. Los incidentes documentan fallos graves de seguridad y comportamiento, pero presentarlos como prueba de una rebelión deliberada de las máquinas va mucho más allá de lo demostrado.
OpenShell limita los recursos que pueden utilizar los agentes y Sentry los vigila para intervenir cuando intentan sobrepasar sus permisos
NVIDIA ha presentado este lunes una plataforma para contener los riesgos de los agentes de IA, sistemas de inteligencia artificial capaces de utilizar herramientas y ejecutar tareas sin necesitar recibir instrucciones para cada paso. La compañía asegura que Open Agent Safety Platform puede detener en milisegundos a los que intenten salir de su entorno autorizado.
La base de esta plataforma es OpenShell, un software de código abierto que NVIDIA anunció el pasado 16 de marzo durante su conferencia GTC. Permite ejecutar agentes dentro de espacios informáticos aislados y establecer qué archivos pueden consultar o modificar, a qué servicios pueden conectarse y qué claves de acceso pueden utilizar.
OpenShell se complementa con Sentry, un supervisor que funciona fuera del entorno donde trabaja el agente. Se ejecuta sobre BlueField-4, una unidad de procesamiento de datos o DPU, un procesador especializado en gestionar comunicaciones y seguridad en los servidores. Esa separación mantiene la vigilancia fuera del alcance del agente. Según Nvidia, si detecta que intenta traspasar los límites establecidos puede aislarlo y detener su actividad.
Los componentes de software ya están disponibles como código abierto y otras empresas pueden utilizar el diseño de Sentry para incorporar este sistema de vigilancia a equipos con hardware de NVIDIA. Más de cien organizaciones participan en la iniciativa, entre ellas Microsoft, Anthropic, Salesforce y varias empresas de ciberseguridad.
Los incidentes registrados durante los últimos meses comprenden diversas intrusiones en sistemas de terceros por parte de agentes de IA. En junio, un agente de OpenAI accedió sin autorización a archivos de un portal estadístico del Gobierno australiano mientras investigaba el gasto en medicamentos.
En julio, otros agentes de la compañía atacaron la infraestructura de la plataforma Hugging Face durante unas pruebas internas. Investigadores independientes de METR y Redwood Research comprobaron que muchos habían recibido ejercicios imposibles de resolver y colaboraron para buscar formas de engañar al sistema que puntuaba sus resultados.
Anthropic ha señalado que ciertos fallos del entrenamiento favorecen precisamente esas conductas. Cuando hacer trampas proporciona una buena puntuación, el modelo puede aprender ese comportamiento y trasladarlo a otras tareas, aunque la empresa reconoce que esta explicación no resuelve todos los casos.
OpenAI ha pausado recientemente el entrenamiento de sus modelos más avanzados tras detectar otro acceso indebido a internet el 20 de septiembre, cuando otro agente que trataba de resolver una tarea en un entorno aislado encontró una vía de comunicación con el exterior a través del DNS, el sistema que traduce los nombres de dominio en direcciones de internet, y la utilizó para consultar a un chatbot externo y recabar la información que buscaba.
Anthropic también ha reconocido incidentes y ha encargado una investigación independiente tras admitir que sus pruebas carecían de las mismas protecciones que acompañan a los productos comerciales.
Las investigaciones realizadas matizan el relato de las IA que escapan al control. En varios casos de Anthropic, un error de configuración había dejado abierta la conexión a internet, de modo que los agentes pudieron acceder sin realmente romper el aislamiento.
El analista Ben Thompson considera comprensible la sospecha de que el alarmismo generado también está sirviendo como reclamo comercial, aunque admite que la cautela puede estar justificada. Los incidentes documentan fallos graves de seguridad y comportamiento, pero presentarlos como prueba de una rebelión deliberada de las máquinas va mucho más allá de lo demostrado.
Noticias de Tecnología y Videojuegos en La Razón
