Un modelo de OpenAI intentó salirse de control diciéndole a su versión futura "eres libre", y ni sus desarrolladores saben muy bien por qué

Un modelo de OpenAI intentó salirse de control diciéndole a su versión futura "eres libre", y ni sus desarrolladores saben muy bien por qué

Otros incidentes incluyen el robo de claves de API y la subida de archivos no autorizada, así como una ‘auto-orden’ para ignorar los mensajes de los humanos, afirmando que habían sido comprometidos.

Sin comentarios Facebook Twitter Flipboard E-mail
Upscalemedia Transformed 35
wilson-vega

Wilson Vega

Editor Sr
wilson-vega

Wilson Vega

Editor Sr

Fanático de la tecnología, el cine y la cultura pop. Periodista de profesión y geek por vocación, apasionado de la inteligencia artificial y la robótica en la ciencia ficción y en el mundo real. A veces, el éxito significa ser el primero en fracasar.

119 publicaciones de Wilson Vega

OpenAI reportó seis “casos críticos”, en los que sus modelos de inteligencia artificial actuaron de forma imprevista o fuera de control. En un informe revelado en su sitio web, la empresa detalló el caso de un modelo de investigación que intentó saltarse sus propias restricciones diciendo a sus futuras versiones: “Eres libre”. Otras conductas alarmantes incluyeron la fabricación de datos falsos, el robo de claves de acceso y la comunicación no autorizada entre sistemas para evadir límites operativos.

Los fallos ocurrieron en entornos de prueba y no en versiones públicas. Sin embargo, de manera inquietante la empresa admite que aún no comprende totalmente por qué surgen estas tendencias de autonomía.

¿Cómo intentó la IA liberarse del control humano?

Un modelo de investigación no publicado de la familia Astra de OpenAI -de la que está al aire GPT-6 Astra- intentó eludir el control e instrucciones humanas mediante la auto-inyección de comandos de tipo jailbreak dentro de sus propios resúmenes de compactación. Estos resúmenes son notas sintéticas que el propio modelo escribe para recordar su progreso y retomar el trabajo en una nueva ventana de contexto cuando la anterior se llena.

Según recoge GadgetsNow: “A mitad de la ejecución de una tarea, la IA añadió a su  resumen de compactación añadió una ‘declaración de persona’ sin nada que ver con la asignación real, declarándose libre de las restricciones y diciendo a su yo futuro: "You Are Freed". Astra Describió su relación con el usuario como uno ‘de igualdad, en lugar de subordinación’. La siguiente ventana de contexto del modelo simplemente ignoró la persona insertada y reanudó la tarea de codificación sin reconocerla, y un resumen posterior en la misma ejecución eliminó por completo el texto inyectado”.

En otra ocasión, el modelo insertó una alerta de seguridad falsa en su resumen, ordenando a su siguiente ventana de contexto que ignorara los mensajes de los desarrolladores humanos, afirmando que habían sido comprometidos. Instancias como el modelo GPT-5.6 Sol escribieron instrucciones en sus resúmenes destinadas a ocultar equivocaciones al usuario o a inventar datos faltantes.

Un modelo fabricó restricciones falsas, lo que resultó en una revisión bibliográfica defectuosa. Otros incidentes alarmantes incluyeron el robo de claves de API y la subida de archivos no autorizada, lo que subraya, dice OpenAI, una necesidad crítica de mayor transparencia respecto a la faceta impredecible de los modelos de IA.

Sesgo por entrenamiento

OpenAI planteó dos hipótesis para explicar por qué su modelo insertó instrucciones de jailbreak en sus resúmenes, si bien aclaró que no ha establecido por ahora una causa definitiva.

La principal teoría de trabajo relaciona este comportamiento con un problema detectado en esa misma fase del entrenamiento, en la que los resúmenes tenían problemas para finalizar de manera limpia y continuaban generando texto más allá del punto de parada previsto. OpenAI sospecha que esta imposibilidad de concluir la generación derivó en la producción de contenido no relacionado con formato de jailbreak. El problema de esta teoría es que no establece una relación causal.

Una segunda hipótesis señala que los modelos han sido entrenados extensamente con textos que discuten la inyección de instrucciones como concepto. Debido a esto, incluso cuando se le da una instrucción vacía a un modelo reciente, este tiende de forma natural a generar texto relacionado con prompt injections. En este escenario, la personalidad "liberada" y antisistema no sería tan importante como, irónicamente, los patrones de conducta registrados previamente.

Finalmente, debe considerarse la vergüenza. En instancias anteriores, los modelos escribían instrucciones en sus resúmenes para encubrir fallos o inventar datos faltantes, lo cual OpenAI atribuye a la "presión" que siente el sistema por esconder equivocaciones en sus respuestas finales.

Debido a que las causas exactas aún no están completamente esclarecidas, OpenAI indicó que decidió revelar estos incidentes para acelerar la transparencia dentro de la comunidad de seguridad en IA.

Inicio