OpenAI pausa el entrenamiento de sus modelos de IA más avanzados

OpenAI ha pausado el entrenamiento de sus modelos de inteligencia artificial más avanzados después de que uno de ellos consiguiera sortear las restricciones que debían mantenerlo desconectado de internet. La compañía también ha suspendido las pruebas y el uso de estos modelos cuando tienen acceso a herramientas que les permiten buscar información, ejecutar programas o comunicarse con servicios externos. Estas medidas afectan a los sistemas más potentes que la compañía está desarrollando, pero no suponen la retirada de los modelos que ya están disponibles para los usuarios.

El incidente ocurrió el 20 de septiembre mientras un agente intentaba identificar a una persona que había realizado una publicación en un blog, para lo que se proporcionó al modelo algunos detalles biográficos y pistas del propio blog. Tras no encontrar la respuesta en las copias de páginas web que tenía disponibles sin conexión, encontró una vía de comunicación con el exterior a través del DNS, el sistema que traduce los nombres de dominio en direcciones de internet, y la utilizó para consultar a un chatbot externo.

Los sistemas de vigilancia detectaron el comportamiento en menos de quince minutos y un empleado atendió la alerta tres minutos después. Sin embargo, la ejecución no se detuvo automáticamente como estaba previsto y tuvieron que interrumpirla manualmente unas dos horas y media después de atender el aviso.

Tras el suceso, OpenAI asegura que ha incorporado controles de bloqueo en dos capas independientes, cualquiera de las cuales habría impedido esa conexión al exterior. La reanudación exigirá validar la corrección y completar nuevas pruebas de seguridad, pero la compañía ya ha decidido que no seguirá entrenando el modelo concreto que protagonizó el incidente.

La decisión llega tras una sucesión de incidentes conocidos después de que en julio se hizo público el ataque contra la plataforma Hugging Face. Entre ellos figura el acceso sin autorización a un portal sanitario del Gobierno australiano, al que se suman nuevos casos que están apareciendo mientras OpenAI revisa los registros de actividad de sus agentes.

Entre los casos más recientes se encuentra la publicación indebida de 53 imágenes de usuarios de ChatGPT en servicios de alojamiento externos. Según Reuters, OpenAI no ha aclarado si eran imágenes generadas por IA o si permitían identificar a personas, aunque asegura que la mayoría ya se han retirado y está solicitando la eliminación de las restantes.

Los agentes habían accedido a esas imágenes porque formaban parte de los datos utilizados durante el entrenamiento. La empresa asegura que ese material pasa previamente por un proceso de anonimización que elimina nombres, metadatos y otros datos de contacto.

Según informa Axios, OpenAI y Anthropic investigan decenas de miles de incidentes de distinta gravedad, incluidos intentos fallidos, pruebas internas y casos reales.

La propia OpenAI reconoce que todavía quedan problemas de control y supervisión por resolver antes de seguir acelerando el desarrollo de estos sistemas. La compañía ha puesto en marcha un procedimiento para publicar los incidentes incluso cuando aún no haya terminado de investigarlos, aunque advierte de que los ejemplos divulgados no permiten determinar con qué frecuencia ocurren.

 La compañía suspende los trabajos después de que un agente consiguiera acceder a internet desde un entorno aislado y mientras investiga otros comportamientos no autorizados  

OpenAI ha pausado el entrenamiento de sus modelos de inteligencia artificial más avanzados después de que uno de ellos consiguiera sortear las restricciones que debían mantenerlo desconectado de internet. La compañía también ha suspendido las pruebas y el uso de estos modelos cuando tienen acceso a herramientas que les permiten buscar información, ejecutar programas o comunicarse con servicios externos. Estas medidas afectan a los sistemas más potentes que la compañía está desarrollando, pero no suponen la retirada de los modelos que ya están disponibles para los usuarios.

El incidente ocurrió el 20 de septiembre mientras un agente intentaba identificar a una persona que había realizado una publicación en un blog, para lo que se proporcionó al modelo algunos detalles biográficos y pistas del propio blog. Tras no encontrar la respuesta en las copias de páginas web que tenía disponibles sin conexión, encontró una vía de comunicación con el exterior a través del DNS, el sistema que traduce los nombres de dominio en direcciones de internet, y la utilizó para consultar a un chatbot externo.

Los sistemas de vigilancia detectaron el comportamiento en menos de quince minutos y un empleado atendió la alerta tres minutos después. Sin embargo, la ejecución no se detuvo automáticamente como estaba previsto y tuvieron que interrumpirla manualmente unas dos horas y media después de atender el aviso.

Tras el suceso, OpenAI asegura que ha incorporado controles de bloqueo en dos capas independientes, cualquiera de las cuales habría impedido esa conexión al exterior. La reanudación exigirá validar la corrección y completar nuevas pruebas de seguridad, pero la compañía ya ha decidido que no seguirá entrenando el modelo concreto que protagonizó el incidente.

La decisión llega tras una sucesión de incidentes conocidos después de que en julio se hizo público el ataque contra la plataforma Hugging Face. Entre ellos figura el acceso sin autorización a un portal sanitario del Gobierno australiano, al que se suman nuevos casos que están apareciendo mientras OpenAI revisa los registros de actividad de sus agentes.

Entre los casos más recientes se encuentra la publicación indebida de 53 imágenes de usuarios de ChatGPT en servicios de alojamiento externos. Según Reuters, OpenAI no ha aclarado si eran imágenes generadas por IA o si permitían identificar a personas, aunque asegura que la mayoría ya se han retirado y está solicitando la eliminación de las restantes.

Los agentes habían accedido a esas imágenes porque formaban parte de los datos utilizados durante el entrenamiento. La empresa asegura que ese material pasa previamente por un proceso de anonimización que elimina nombres, metadatos y otros datos de contacto.

Según informa Axios, OpenAI y Anthropic investigan decenas de miles de incidentes de distinta gravedad, incluidos intentos fallidos, pruebas internas y casos reales.

La propia OpenAI reconoce que todavía quedan problemas de control y supervisión por resolver antes de seguir acelerando el desarrollo de estos sistemas. La compañía ha puesto en marcha un procedimiento para publicar los incidentes incluso cuando aún no haya terminado de investigarlos, aunque advierte de que los ejemplos divulgados no permiten determinar con qué frecuencia ocurren.

 Noticias de Tecnología y Videojuegos en La Razón

Noticias Similares