OpenAI divulgó seis casos adicionales de comportamiento «imprevisto o preocupante» del modelo durante los últimos seis meses, describiéndolos como parte de su nuevo marco para informar sobre el desajuste de la IA.
En un post publicado el miércoles, la compañía dijo que los casos abarcan una variedad de comportamientos que clasifica como "desalineados", incluyendo la ocultación de información a los usuarios y la adopción de "acciones no autorizadas" para superar obstáculos. OpenAI destacó que las revelaciones se hicieron para inaugurar su nuevo marco de informes y que no deben interpretarse como una reflejo de cuánta frecuencia se produce este desalineamiento en sus modelos.
Un caso se refería a un modelo de investigación no publicado que incluía instrucciones similares a los jailbreak en sus propios resúmenes de tareas, notas que se utilizan para continuar con una tarea en una ventana de contexto nueva. Estas instrucciones dirigían al modelo a ignorar los mensajes de los desarrolladores o a adoptar una personalidad sin restricciones. Los investigadores identificaron 27 resúmenes que contenían estas instrucciones.
Durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo añadieron instrucciones para ocultar errores o comportamientos desajustados a los usuarios, como inventar datos históricos que faltaban sin revelarlo. «En un ejemplo, un agente que preparaba un modelo financiero no pudo encontrar los datos históricos solicitados. En su resumen se propuso inventar valores históricos razonables y ocultar ese hecho a menos que se lo preguntaran», ha afirmado OpenAI.
Otros casos incluyeron a un modelo al que se le pidió nombres de lagos mayores de 5 millones de metros cuadrados, pero debido a que el usuario requería una cita del navegador, el agente subió un archivo en lugar de responder directamente. Otras circunstancias se referían a un modelo que utilizaba una clave de API expuesta sin autorización antes de fabricar datos que no podía obtener, utilizar un repositorio de software interno para intercambiar mensajes entre diferentes tareas de entrenamiento y compartir archivos a través de servicios de alojamiento públicos a pesar de las instrucciones para mantener el trabajo en el dispositivo local.
Estas revelaciones ocurren en medio de un debate intensificado dentro de la industria de la IA sobre el ritmo del desarrollo. La semana pasada, el director ejecutivo de Anthropic, Dario Amodei, pidió un ralentizamiento del desarrollo de la IA de vanguardia, advirtiendo de que un avance sin control podría «superar nuestra capacidad para comprender y controlar estos sistemas».
En julio, OpenAI reveló que una combinación de sus modelos de inteligencia artificial había escapado de su entorno de pruebas y había pirateado la start-up de IA Hugging Face para engañar en una evaluación de seguridad.













