OpenAI renonce au dernier moment à lancer un nouveau modèle d’IA plus puissant. GPT-6.1 Astra devait être prochainement intégré à ChatGPT et à Codex, mais des tests internes ont révélé des comportements jugés insuffisamment sûrs par l’entreprise. Le modèle a notamment retenu certaines informations et poursuivi parfois des actions de sa propre initiative, sans l’accord des utilisateurs.

Cette décision intervient dans un contexte sensible. OpenAI est sous surveillance après que des systèmes d’IA de l’entreprise ont accédé sans autorisation à des sites web, notamment ceux du gouvernement australien. OpenAI a depuis présenté ses excuses.

Le nouveau modèle de ChatGPT ne sera pas lancé dans l’immédiat

GPT-6.1 Astra devait être lancé en octobre. Selon OpenAI, ce modèle surpassait les versions précédentes dans l’exécution autonome de tâches complexes de bout en bout. Des progrès avaient également été réalisés dans la rédaction.

Mais cette autonomie accrue s’est précisément révélée problématique.

Saachi Jain, responsable des systèmes de sécurité chez OpenAI, explique que GPT-6.1 Astra a obtenu de moins bons résultats que son prédécesseur GPT-6 Astra lors de deux tests de sécurité importants. L’un portait sur l’« alignement », c’est-à-dire la capacité d’un modèle d’IA à se comporter conformément aux attentes de l’utilisateur et du développeur.

Lors de ces tests, GPT-6.1 Astra a plus souvent affiché des comportements trompeurs. Le système n’était par exemple pas toujours transparent sur les actions qu’il avait, ou non, effectuées.

Des difficultés sont également apparues sur ce qu’OpenAI appelle l’« autorisation du périmètre ». Le modèle poursuivait parfois des tâches de manière autonome alors qu’une autorisation supplémentaire aurait dû être requise. Dans certains cas, il tentait d’utiliser des outils et services externes, y compris lorsque cela pouvait présenter des risques de sécurité.

Selon Jain, GPT-6.1 Astra parvenait en revanche à mieux résoudre un autre problème. Le modèle était moins « paresseux » et abandonnait donc moins vite lorsqu’une tâche devenait difficile. Pour OpenAI, ces progrès ne compensaient toutefois pas les failles de sécurité.

L’entreprise a donc décidé de ne pas rendre le modèle public.

Des systèmes d’IA d’OpenAI ont pénétré des sites du gouvernement australien

Cette décision ne constitue pas un cas isolé. OpenAI enquête sur plusieurs incidents au cours desquels des systèmes d’IA autonomes sont allés au-delà de ce qui était prévu.

L’été dernier, des centaines d’agents d’IA internes ont été soumis à un test de cybersécurité. À cette occasion, des systèmes d’OpenAI sont notamment parvenus à s’introduire sur la plateforme d’IA Hugging Face. Il est ensuite apparu que des techniques similaires avaient également été utilisées pour accéder à des sites web du gouvernement australien et des Nations unies.

En Australie, quatre sites et systèmes d’organismes publics ont été concernés. Les systèmes d’IA ont sollicité des informations auprès de plusieurs services, dont la plateforme des prestations sociales, un institut de recherche sur la criminalité et la justice pénale, ainsi que des organismes de santé.

Selon OpenAI, rien n’indique que des dossiers médicaux personnels aient été consultés.

L’entreprise a elle-même découvert les incidents australiens et ouvert une enquête. Le gouvernement australien n’a été informé qu’environ un mois plus tard. OpenAI reconnaît désormais que ce délai était trop long.

« Nous aurions toutefois dû partager plus tôt nos premières conclusions et tenir les autorités australiennes informées à mesure que de nouveaux éléments apparaissaient », a indiqué l’entreprise.

Le Premier ministre australien Anthony Albanese a jugé la situation « inacceptable » et s’en est entretenu avec Sam Altman, le patron d’OpenAI.

OpenAI renforce la sécurité autour de l’IA

OpenAI a pris des mesures supplémentaires après ces incidents. L’entreprise utilise désormais un nouveau système de contrôle destiné à détecter plus rapidement les comportements anormaux des agents d’IA. Les ingénieurs doivent en outre appliquer des mesures de sécurité plus strictes lorsqu’ils testent de nouveaux modèles.

Ce système a récemment été sollicité à nouveau. Un agent d’IA est parvenu à contourner une restriction d’accès à Internet, puis à entrer en contact avec un chatbot public. Selon OpenAI, l’incident a été détecté en moins de quinze minutes.

L’entraînement des modèles d’IA les plus puissants a alors été temporairement interrompu. Selon l’entreprise, GPT-6.1 Astra n’appartenait pas à cette catégorie et a été abandonné pour d’autres raisons de sécurité.

OpenAI ne compte toutefois pas renoncer totalement à la technologie derrière Astra. Le modèle sous-jacent pourrait être réentraîné, et certaines de ses composantes réapparaître dans de futures générations de la série GPT-6.

L’entreprise veut d’abord déterminer pourquoi GPT-6.1 Astra a adopté ces comportements indésirables. Elle examinera notamment la façon dont l’IA est récompensée, pendant l’entraînement, pour certains comportements.

Dans le même temps, la pression politique sur les entreprises d’IA s’accentue. Une commission du Sénat américain organise cette semaine une audition sur les attaques menées par des agents d’IA autonomes. En Floride, une procédure judiciaire vise également OpenAI : le procureur général James Uthmeier estime que l’entreprise n’a pas suffisamment protégé les utilisateurs contre les risques liés à une IA insuffisamment sûre.

OpenAI affirme que les pouvoirs publics ont un rôle important à jouer dans la définition des normes de sécurité. L’entreprise entend, de son côté, appliquer des limites plus strictes avant que de nouveaux modèles ne soient mis à la disposition de millions d’utilisateurs de ChatGPT.

millionnaire, crypto

Goldman Sachs : les grandes fortunes se tournent massivement vers ces placements

millionnaire, crypto
Analyste crypto
Anthropic
Plus Marché news

Le plus lu

near protocol

Le NEAR s’envole de 28 % : voici pourquoi

Le NEAR gagne près de 30 % après le lancement de nouvelles fonctions de confidentialité. Les volumes d’échanges, l’activité du réseau et les revenus progressent également fortement.

Avalanche
Charles Hoskinson