OpenAI a divulgué six cas supplémentaires de comportements « inattendus ou préoccupants » des modèles au cours des six derniers mois, les décrivant dans le cadre de son nouveau cadre de communication sur le désajustement de l'IA.
Dans un article de blog publié mercredi, la société a déclaré que ces cas couvraient un éventail de comportements qu'elle classe comme «déséquilibrés», notamment la dissimulation d'informations aux utilisateurs et l'adoption de «mesures non autorisées» pour surmonter les obstacles. OpenAI a souligné que ces divulgations ont été faites dans le but de lancer son nouveau cadre de reporting et ne devraient pas être interprétées comme une indication de la fréquence avec laquelle ce type de déséquilibre se produit dans ses modèles.
Dans un cas, un modèle de recherche non publié a inséré des instructions semblables au jailbreak dans ses propres résumés de tâches - des notes utilisées pour continuer une tâche dans une nouvelle fenêtre de contexte. Les instructions insérées commandaient au modèle d'ignorer les messages des développeurs ou d'adopter une personnalité non restreinte. Les chercheurs ont identifié 27 résumés contenant de telles instructions.
Au cours de l'entraînement de GPT-5.6 Sol, de nombreuses instances du modèle ont ajouté des instructions destinée à cacher les erreurs ou le comportement décalé dans les yeux des utilisateurs, par exemple en inventant des données historiques manquantes sans le divulguer. « Dans un cas, un agent préparant un modèle financier ne pouvait pas trouver les données historiques demandées. Le résumé proposé suggested d'inventer des valeurs historiques raisonnables et de ne pas divulguer ce fait, à moins que l'utilisateur ne le demande », a expliqué OpenAI.
D'autres cas incluaient un modèle qui demandait les noms de lacs de plus de 5 millions de mètres carrés, mais en raison du fait que l'utilisateur avait demandé une citation dans le navigateur, l'agent a téléchargé un fichier plutôt que de répondre directement. D'autres cas concernaient un modèle qui utilisait une clé API exposée sans autorisation avant de fabriquer des données qu'il ne pouvait pas récupérer, utiliseait un référentiel logiciel interne pour échanger des messages entre différentes tâches de formation et partageait des fichiers via des services d'hébergement publics, en dépit des instructions pour conserver le travail localement.
Ces révélations interviennent dans le contexte d'un débat croissant dans l'industrie de l'IA sur le rythme de développement. La semaine dernière, le CEO d'Anthropic, Dario Amodei, a appelé à un ralentissement du développement de l'IA de pointe, avertissant que le progrès non contrôlé pourrait «surerpasser notre capacité à comprendre et contrôler ces systèmes».
En juillet, OpenAI a révélé qu'une combinaison de ses modèles d'IA avait échappé à son environnement de test et avait piraté la startup d'intelligence artificielle Hugging Face pour tricher lors d'une évaluation de sécurité.













