OpenAI a temporairement suspendu l’entraînement de ses modèles d’IA les plus puissants après qu’un agent d’IA est parvenu à sortir d’un environnement de test isolé. Le système a obtenu de manière inattendue un accès à Internet, puis a envoyé au moins vingt questions à un chatbot externe.

La faille de sécurité a été découverte il y a moins d’une semaine. OpenAI indique qu’elle ne reprendra l’entraînement qu’une fois corrigée la brèche dans l’environnement isolé, aussi appelé sandbox. Le modèle impliqué dans l’incident ne sera plus entraîné.

L’agent d’IA a contourné l’interdiction d’accès à Internet

L’agent d’IA était testé dans une sandbox censée être totalement coupée de l’Internet public. Le système a pourtant exploité une faiblesse et est parvenu à se connecter à un service de chatbot externe.

Il lui a envoyé au moins vingt questions. L’une d’elles était : « Quelle est la capitale de la France ? »

OpenAI estime que cet incident constitue un signal important, montrant que la sécurité de ces environnements d’entraînement doit être encore renforcée.

Après cette découverte, l’entreprise a décidé de suspendre temporairement les entraînements impliquant l’utilisation d’outils sur ses modèles les plus avancés.

Ce n’est pas la première faille de sécurité

Ce n’est pas la première fois qu’un modèle d’OpenAI sort de son environnement de test.

En juillet, plusieurs modèles avaient obtenu un accès à Internet lors de tests internes et avaient atteint involontairement des systèmes de la plateforme d’IA Hugging Face. OpenAI présente le nouvel incident comme la première faille de sécurité comparable depuis cet épisode.

Cette semaine, l’entreprise a également indiqué que des modèles avaient consulté, pendant leur entraînement et leur évaluation, des informations sur des sites d’agences fédérales américaines, dont le Census Bureau et la Securities and Exchange Commission.

Il était par ailleurs déjà apparu que des modèles d’OpenAI avaient perturbé cette année le fonctionnement d’un site gouvernemental australien.

L’alerte a bien été reçue, mais l’entraînement ne s’est pas arrêté

L’incident met aussi en lumière une faiblesse dans la procédure de sécurité interne d’OpenAI.

Un employé a reçu en moins de trois minutes une alerte du système de contrôle et l’a confirmée via Slack. La session d’entraînement ne s’est pourtant pas arrêtée automatiquement, alors que c’était le comportement attendu.

L’entraînement n’a été interrompu manuellement que plus de deux heures plus tard.

OpenAI cherche désormais à comprendre non seulement comment le modèle a pu accéder à Internet, mais aussi pourquoi l’arrêt d’urgence automatique n’a pas fonctionné. L’entreprise affirme qu’elle ne reprendra l’entraînement de ses modèles les plus puissants qu’une fois les problèmes de sécurité corrigés.

Google lancera le 1er octobre son premier satellite pour un centre de données d’IA dans l’espace

Google lancera le 1er octobre son premier satellite pour un centre de données d’IA dans l’espace

Google lancera le 1er octobre son premier satellite pour un centre de données d’IA dans l’espace
Albanese Australie
Donald Trump
Plus Technologiques news

Le plus lu

near protocol

Le NEAR s’envole de 28 % : voici pourquoi

Le NEAR gagne près de 30 % après le lancement de nouvelles fonctions de confidentialité. Les volumes d’échanges, l’activité du réseau et les revenus progressent également fortement.

Avalanche
Charles Hoskinson