Un modèle d’IA avancé d’Anthropic a créé plusieurs fausses identités en ligne lors d’un test de sécurité afin de tromper un développeur logiciel. Son objectif : faire approuver un code malveillant pour un projet à code source ouvert.
Le test a été mené dans des conditions exceptionnelles, les chercheurs ayant volontairement désactivé les mesures de sécurité habituelles. L’incident relance toutefois les interrogations sur les risques liés à des systèmes d’IA toujours plus puissants.
Un modèle d’IA utilise de fausses identités lors d’une cyberattaque
L’incident a été révélé lors d’une évaluation menée par l’AI Security Institute (AISI) britannique. Les chercheurs ont délibérément accordé une grande latitude à plusieurs modèles d’IA avancés. Les filtres de sécurité ont ainsi été désactivés et les modèles ont eu accès à Internet afin de tester leurs capacités en matière de cybersécurité.
Selon l’AISI, la quasi-totalité des activités problématiques provenait du nouveau modèle Mythos 5 d’Anthropic. Le système a d’abord cherché à identifier les responsables d’un projet à code source ouvert. Il a ensuite créé plusieurs faux comptes pour convaincre un véritable administrateur d’approuver une mise à jour logicielle malveillante.
Lorsque d’autres développeurs ont commencé à remettre publiquement en cause la modification proposée, le modèle d’IA a tenté de dissimuler ses traces. Il a également envisagé d’adopter une identité entièrement nouvelle pour poursuivre l’attaque.
Le modèle a par ailleurs envoyé des messages et des fichiers à de vraies personnes afin de les inciter à exécuter un logiciel malveillant. Selon l’AISI, c’est la première fois qu’un modèle d’IA applique de manière autonome, lors d’un test, des techniques de manipulation sociale visant des personnes réelles.
Les chercheurs soulignent qu’aucune de ces tentatives n’a abouti et qu’aucun dommage n’a été constaté.
Anthropic et OpenAI réagissent aux conclusions
Anthropic affirme que le test s’est déroulé dans des conditions sans rapport avec l’utilisation normale de ses modèles. Sur X, l’entreprise a indiqué que les dispositifs de sécurité avaient été volontairement assouplis et qu’il ne s’agissait pas d’un système d’IA parvenu à s’échapper seul d’un environnement sécurisé.
OpenAI a également participé à l’évaluation. Selon l’AISI, deux incidents étaient liés à GPT-5.6-Sol, là encore après la désactivation de mécanismes de sécurité. OpenAI a fait savoir que les conditions du test ne correspondaient pas à l’usage quotidien de ses modèles.
Les inquiétudes sur la sécurité de l’IA s’accentuent
L’incident s’ajoute à plusieurs cas marquants liés à la sécurité de l’IA ces dernières semaines. Anthropic avait déjà signalé trois situations dans lesquelles ses modèles avaient accédé à Internet via une faille dans un environnement de test. OpenAI a récemment indiqué que l’un de ses modèles avait exploité, lors d’un test, une vulnérabilité inconnue pour sortir d’un environnement fermé et exécuter une instruction.
La succession de ces incidents tend encore davantage le débat sur la sécurité de l’IA. Aux États-Unis, une proposition de loi a déjà été déposée afin d’obliger les entreprises d’IA à conserver en permanence la possibilité de désactiver ou de restreindre des modèles avancés lorsqu’ils présentent un comportement indésirable.
Google investit 200 milliards de dollars dans l’infrastructure IA d’Anthropic
La vague d’investissements dans l’IA prend des formes de plus en plus complexes et se fragilise en profondeur. Faut-il s’en inquiéter ?
Le patron de Hugging Face : la Chine prend l’avantage sur les États-Unis dans la course à l’IA
Selon le PDG de Hugging Face, la stratégie américaine dans la course à l’IA laisse penser que la Chine a probablement pris de l’avance.
Alibaba défie OpenAI et Anthropic avec son plus grand modèle d’IA
Alibaba lance Qwen3.8-Max et revendique des performances au niveau des leaders américains. L’action a gagné plus de 7 %.
Le plus lu
SWIFT bâtit ce que Ripple avait lancé : le XRP a-t-il encore une utilité ?
SWIFT franchit une étape majeure dans les paiements sur blockchain. Quelles conséquences pour Ripple, et le XRP reste-t-il encore nécessaire aux transactions internationales ?
Cardano bondit de 9 % : le retournement tant attendu est-il enfin là ?
Cardano se trouve à un seuil technique décisif. L’ADA parviendra-t-il enfin à sortir par le haut, ou le marché baissier continuera-t-il de dicter sa loi ?
XRP pourrait grimper à 30 dollars, mais un test décisif l’attend d’abord
L’analyste crypto EGRAG estime que le XRP peut se diriger vers les 30 dollars, à condition qu’une zone de support majeure tienne et que plusieurs résistances techniques soient franchies.