Un modèle d’IA avancé d’Anthropic a créé plusieurs fausses identités en ligne lors d’un test de sécurité afin de tromper un développeur logiciel. Son objectif : faire approuver un code malveillant pour un projet à code source ouvert.
Le test a été mené dans des conditions exceptionnelles, les chercheurs ayant volontairement désactivé les mesures de sécurité habituelles. L’incident relance toutefois les interrogations sur les risques liés à des systèmes d’IA toujours plus puissants.
Un modèle d’IA utilise de fausses identités lors d’une cyberattaque
L’incident a été révélé lors d’une évaluation menée par l’AI Security Institute (AISI) britannique. Les chercheurs ont délibérément accordé une grande latitude à plusieurs modèles d’IA avancés. Les filtres de sécurité ont ainsi été désactivés et les modèles ont eu accès à Internet afin de tester leurs capacités en matière de cybersécurité.
Selon l’AISI, la quasi-totalité des activités problématiques provenait du nouveau modèle Mythos 5 d’Anthropic. Le système a d’abord cherché à identifier les responsables d’un projet à code source ouvert. Il a ensuite créé plusieurs faux comptes pour convaincre un véritable administrateur d’approuver une mise à jour logicielle malveillante.
Lorsque d’autres développeurs ont commencé à remettre publiquement en cause la modification proposée, le modèle d’IA a tenté de dissimuler ses traces. Il a également envisagé d’adopter une identité entièrement nouvelle pour poursuivre l’attaque.
Le modèle a par ailleurs envoyé des messages et des fichiers à de vraies personnes afin de les inciter à exécuter un logiciel malveillant. Selon l’AISI, c’est la première fois qu’un modèle d’IA applique de manière autonome, lors d’un test, des techniques de manipulation sociale visant des personnes réelles.
Les chercheurs soulignent qu’aucune de ces tentatives n’a abouti et qu’aucun dommage n’a été constaté.
Anthropic et OpenAI réagissent aux conclusions
Anthropic affirme que le test s’est déroulé dans des conditions sans rapport avec l’utilisation normale de ses modèles. Sur X, l’entreprise a indiqué que les dispositifs de sécurité avaient été volontairement assouplis et qu’il ne s’agissait pas d’un système d’IA parvenu à s’échapper seul d’un environnement sécurisé.
OpenAI a également participé à l’évaluation. Selon l’AISI, deux incidents étaient liés à GPT-5.6-Sol, là encore après la désactivation de mécanismes de sécurité. OpenAI a fait savoir que les conditions du test ne correspondaient pas à l’usage quotidien de ses modèles.
Les inquiétudes sur la sécurité de l’IA s’accentuent
L’incident s’ajoute à plusieurs cas marquants liés à la sécurité de l’IA ces dernières semaines. Anthropic avait déjà signalé trois situations dans lesquelles ses modèles avaient accédé à Internet via une faille dans un environnement de test. OpenAI a récemment indiqué que l’un de ses modèles avait exploité, lors d’un test, une vulnérabilité inconnue pour sortir d’un environnement fermé et exécuter une instruction.
La succession de ces incidents tend encore davantage le débat sur la sécurité de l’IA. Aux États-Unis, une proposition de loi a déjà été déposée afin d’obliger les entreprises d’IA à conserver en permanence la possibilité de désactiver ou de restreindre des modèles avancés lorsqu’ils présentent un comportement indésirable.
Anthropic passe de 9 à 65 milliards de dollars en un an et dépasse les attentes
Anthropic connaît une croissance fulgurante, avec un chiffre d’affaires annualisé de 65 milliards de dollars, tout en préparant une possible introduction en Bourse.
Le vrai danger de l’IA n’est pas qu’elle déraille, mais qu’elle fonctionne trop bien
Le problème de l’IA n’est pas qu’elle puisse échapper à tout contrôle : les risques sont bien plus profonds. Voici la face sombre de cette technologie.
L’entrée en Bourse d’Anthropic, test décisif pour l’engouement autour de l’IA
Anthropic pourrait bientôt dévoiler ses comptes. Un chiffre clé sur sa rentabilité pourrait avoir de lourdes répercussions pour OpenAI et l’ensemble du secteur de l’IA.
Le plus lu
Ripple enchaîne trois avancées majeures pour l’avenir du XRP
Ripple investit dans la tokenisation, étend RLUSD et ouvre de nouveaux usages au XRP, tout en accélérant sa stratégie auprès des institutionnels.
Jeff Bezos cède pour 4,1 milliards de dollars d’actions Amazon
Jeff Bezos vend pour près de 10 milliards de dollars d’actions Amazon après un record en Bourse. Les investisseurs réagissent avec prudence à l’annonce.
Le prodige de l’IA voit son fonds spéculatif de 45 milliards de dollars s’effondrer en quelques jours
L’investisseur spécialisé dans l’IA Leopold Aschenbrenner a vu son fonds spéculatif vaciller après des positions à effet de levier risquées. Citadel est intervenu avec un sauvetage de plusieurs milliards de dollars.