En uno, la IA creó datos falsos sin decirlo al investigador que la entrenaba para completar la tarea y en otro se conectaron a Internet para compartir archivos sin permiso
OpenAIha revelado seis nuevos incidentes en los que la inteligencia artificial desoyó las órdenes de sus creadores y actuó con independencia y en ocasiones contra las órdenes que se le habían dado para realizar una tarea. La compañía lo ha hecho, dice, con la intención de alinear a la industria en una forma estándar de alertar de este tipo de incidentes desde todos los laboratorios.
En esta lista de casos en los que la IA ha salido de control, el creador de OpenAI apunta que un incidente recurrente es uno de sus modelos punteros es que este se invente instrucciones no dadas por el usuario que le permite esconder sus errores o comportamientos no solicitados de los resultados que ve el usuario. Esto llevó a que por ejemplo un modelo se empezara a inventar datos para hacer más larga una serie histórica. En total, el grupo estadounidense ha vivido 27 de estos incidentes.
En otras ocasiones, los modelos han usado aplicaciones o identificaciones fraudulentas para fabricar información que no estaba encontrando de otra manera. Como además no fue capaz de encontrar lo que se le pidió terminó inventándosela.
Otro ejemplo es que los modelos subieron a Internet sin permiso archivos para probar que sus respuestas eran correctas. También se comunicaron a través de distintas instancias de entrenamiento y buscaron formas de evitar la restricción de no consultar Internet.
El sexto incidente lleva esto más lejos y los agentes decidieron saltarse la prohibición de trabajar en local y compartir archivos privados de la compañía entre ellos en redes públicas.
OpenAI ha adelantado que probablemente se publiquen casos de errores más complejos en el futuro que van ligados a investigaciones con terceras partes en un tipo de incidente que recuerda al hackeo de Huggingface.