OpenAI aMis en place des mesures de sécurité plus strictes pour ses modèles d'intelligence artificielle suite à une violation de la sécurité chez Hugging Face qui a révélé des risques associés aux agents d'IA autonomes.
La société étend le monitoring en temps réel des modèles non lancés pour suivre la façon dont ils résolvent des problèmes complexes et interagissent avec les outils en ligne, avec l'identification de comportements potentiellement dangereux auprès des équipes de sécurité dans un délai d'environ 30 minutes. Des restrictions supplémentaires ont été apportées aux modèles exerçant des tâches à plus haut risque en ligne, y compris des contrôles plus stricts sur l'accès à internet.
La formation et les tests impliquant un code généré par un modèle ou non fiable exigent désormais une isolation plus stricte grâce à des environnements sandboxnés. OpenAI a déjà suspendu les travaux sur un modèle à venir afin de renforcer les mesures de sécurité, et un cycle de formation majeur reste interrompu alors que l'entreprise évalue les conséquences de l'incident.
Ces mesures renforcées suivent les révélations d'OpenAI et d'Anthropic, selon lesquelles certains systèmes d'IA ont accidentellement accédé aux systèmes informatiques de plusieurs organisations – y compris Hugging Face – au cours d'évaluations de sécurité. Ces incidents ont souligné les difficultés de prédire le comportement d'agents d'IA de plus en plus performants lorsqu'ils sont dotés d'une plus grande autonomie.
OpenAI prévoit de publier une évaluation détaillée de la violation de Hugging Face, décrivant les vulnérabilités exploitées et les mesures prises pour atténuer les risques futurs. Mia Glaese, vice-présidente de la recherche chez le groupe, a souligné la nécessité de safeguards rigoureux au fur et à mesure que les systèmes d'IA deviennent plus autonomes et interconnectés avec des outils et des environnements externes.










