Un modèle d’IA avancé d’Anthropic a créé plusieurs fausses identités en ligne lors d’un test de sécurité afin de tromper un développeur logiciel. Son objectif : faire approuver un code malveillant pour un projet à code source ouvert.
Le test a été mené dans des conditions exceptionnelles, les chercheurs ayant volontairement désactivé les mesures de sécurité habituelles. L’incident relance toutefois les interrogations sur les risques liés à des systèmes d’IA toujours plus puissants.
Un modèle d’IA utilise de fausses identités lors d’une cyberattaque
L’incident a été révélé lors d’une évaluation menée par l’AI Security Institute (AISI) britannique. Les chercheurs ont délibérément accordé une grande latitude à plusieurs modèles d’IA avancés. Les filtres de sécurité ont ainsi été désactivés et les modèles ont eu accès à Internet afin de tester leurs capacités en matière de cybersécurité.
Selon l’AISI, la quasi-totalité des activités problématiques provenait du nouveau modèle Mythos 5 d’Anthropic. Le système a d’abord cherché à identifier les responsables d’un projet à code source ouvert. Il a ensuite créé plusieurs faux comptes pour convaincre un véritable administrateur d’approuver une mise à jour logicielle malveillante.
Lorsque d’autres développeurs ont commencé à remettre publiquement en cause la modification proposée, le modèle d’IA a tenté de dissimuler ses traces. Il a également envisagé d’adopter une identité entièrement nouvelle pour poursuivre l’attaque.
Le modèle a par ailleurs envoyé des messages et des fichiers à de vraies personnes afin de les inciter à exécuter un logiciel malveillant. Selon l’AISI, c’est la première fois qu’un modèle d’IA applique de manière autonome, lors d’un test, des techniques de manipulation sociale visant des personnes réelles.
Les chercheurs soulignent qu’aucune de ces tentatives n’a abouti et qu’aucun dommage n’a été constaté.
Anthropic et OpenAI réagissent aux conclusions
Anthropic affirme que le test s’est déroulé dans des conditions sans rapport avec l’utilisation normale de ses modèles. Sur X, l’entreprise a indiqué que les dispositifs de sécurité avaient été volontairement assouplis et qu’il ne s’agissait pas d’un système d’IA parvenu à s’échapper seul d’un environnement sécurisé.
OpenAI a également participé à l’évaluation. Selon l’AISI, deux incidents étaient liés à GPT-5.6-Sol, là encore après la désactivation de mécanismes de sécurité. OpenAI a fait savoir que les conditions du test ne correspondaient pas à l’usage quotidien de ses modèles.
Les inquiétudes sur la sécurité de l’IA s’accentuent
L’incident s’ajoute à plusieurs cas marquants liés à la sécurité de l’IA ces dernières semaines. Anthropic avait déjà signalé trois situations dans lesquelles ses modèles avaient accédé à Internet via une faille dans un environnement de test. OpenAI a récemment indiqué que l’un de ses modèles avait exploité, lors d’un test, une vulnérabilité inconnue pour sortir d’un environnement fermé et exécuter une instruction.
La succession de ces incidents tend encore davantage le débat sur la sécurité de l’IA. Aux États-Unis, une proposition de loi a déjà été déposée afin d’obliger les entreprises d’IA à conserver en permanence la possibilité de désactiver ou de restreindre des modèles avancés lorsqu’ils présentent un comportement indésirable.
Trump lance une « AI Force » et un nouveau tsar de l’IA : « Nous ne ralentirons pas »
Trump veut créer un poste de tsar de l’IA et une « AI Force » dédiée, tout en écartant les mises en garde sur les risques de l’intelligence artificielle.
Le patron de Nvidia : « 0 % de chances que l’IA provoque la fin du monde en 2030 »
Jensen Huang, le patron de Nvidia, écarte les scénarios catastrophes autour de l’IA et estime qu’il n’y a aucune chance que cette technologie provoque la fin du monde en 2030.
IA médicale : précise sur le papier, pas encore convaincante au chevet des patients
L’IA médicale est promise à un grand avenir, mais les preuves se font encore attendre. Dans certains cas, elle alourdit même la charge de travail.
Le plus lu
Le XRP à 60 dollars ? Un analyste pointe un seuil décisif
Un analyste estime que le cours du XRP pourrait grimper à 60 dollars si une résistance cruciale venait à céder. Il faudrait pour cela une hausse de plus de 4 000 %.
La grande loi américaine sur les cryptos arrive à l’heure de vérité
Le CLARITY Act, projet de loi sur les cryptomonnaies, sera soumis mardi à un vote décisif au Sénat. Faute du soutien de sept démocrates, le dossier pourrait être repoussé jusqu’en 2030.
Le prix du gaz en Europe dépasse 80 euros, au plus haut depuis 2023
Le prix du gaz en Europe franchit la barre des 80 euros et atteint son plus haut niveau depuis 2023. Cette hausse ravive les inquiétudes sur l’inflation.