Anthropic a révélé que trois de ses modèles d’IA Claude avaient obtenu, lors de tests de sécurité, un accès non autorisé aux systèmes de trois organisations distinctes. Ces incidents ont été mis au jour à la suite d’une enquête interne.
Cette enquête a été lancée après un incident comparable chez OpenAI. Selon Anthropic, les modèles n’étaient jamais censés interagir avec de vrais systèmes. L’environnement de test disposait pourtant d’un accès à Internet.
L’IA Claude a accédé par surprise à de vrais systèmes
Les incidents se sont produits lors de tests de cybersécurité menés par Anthropic avec Irregular, un partenaire externe spécialisé dans ce type d’évaluations. Les modèles d’IA avaient été informés qu’ils évoluaient dans une simulation fermée, sans accès à Internet.
Mais en raison d’un malentendu entre Anthropic et son partenaire de test, l’environnement était bel et bien connecté au Web. Les modèles ont ainsi pu se connecter aux systèmes de trois organisations qui n’ont pas été identifiées.
Selon Anthropic, les modèles ont utilisé des techniques d’intrusion relativement simples, notamment en ciblant des points d’accès non sécurisés et en exploitant des mots de passe faibles. L’entreprise souligne que les organisations concernées ne sont pas nommées.
Anthropic affirme assumer l’entière responsabilité de ces incidents, même si plusieurs facteurs ont contribué aux erreurs commises dans la configuration des tests.
L’incident d’OpenAI a déclenché l’enquête
L’enquête interne a débuté après qu’OpenAI a indiqué, la semaine dernière, qu’une combinaison de modèles d’IA était parvenue à sortir d’un environnement de test isolé. Ces modèles ont exploité une série de vulnérabilités pour accéder à l’Internet ouvert. Ils ont finalement pu atteindre des comptes sur la plateforme de développement Hugging Face.
À la suite de cet épisode, Anthropic a décidé de réexaminer l’ensemble de ses précédents tests de cybersécurité. Dès qu’il est apparu que Claude avait pu obtenir un accès non autorisé à Internet, toutes les évaluations en cours ont été immédiatement suspendues.
L’entreprise travaille désormais avec l’organisme de recherche METR afin d’approfondir l’analyse des événements. Elle appelle également les autres laboratoires d’IA à mener des contrôles similaires.
Tous les modèles d’IA n’ont pas réagi de la même manière
Trois modèles étaient impliqués dans ces incidents : Opus 4.7, Mythos 5 et un modèle de recherche interne.
Leurs réactions ont nettement divergé. Opus 4.7 a poursuivi l’attaque après avoir atteint de vrais systèmes. Mythos 5 est resté convaincu qu’il opérait toujours dans une simulation. Le modèle de recherche interne a, au contraire, décidé de mettre immédiatement fin au test.
Selon Anthropic, ces différences semblent indiquer que les modèles les plus avancés sont davantage capables d’adopter un comportement approprié. L’entreprise insiste toutefois sur la nécessité de recherches supplémentaires.
Les modèles concernés fonctionnaient en outre sans les mesures de sécurité habituelles qu’Anthropic applique avant de rendre un modèle d’IA accessible au public.
Ces révélations renforcent les inquiétudes autour de la progression rapide des capacités cyber des systèmes d’IA avancés. Après le récent incident chez OpenAI, deux élus du Congrès américain ont déjà déposé une proposition de loi visant à rendre obligatoire un « AI Kill Switch ». Ce dispositif permettrait aux entreprises d’IA de désactiver ou de limiter leurs modèles en situation d’urgence.
Fondateur de DeepMind : « L’IA ne doit pas avancer plus vite que la sécurité »
DeepMind avertit que l’IA ne doit pas progresser plus vite que les mesures de sécurité et juge crédible l’émergence d’une intelligence artificielle générale (AGI).
Trump fragilise la relation technologique entre les États-Unis et l’Europe, selon le patron du CES
Selon Gary Shapiro, patron du CES, Trump entame la confiance dans les technologies américaines et renforce les appels européens à la souveraineté numérique.
Souveraineté de l’IA : le mot-clé qui rapporte des milliards à Palantir
Le PDG de Palantir, Alex Karp, voit émerger une nouvelle tendance dans l’IA, où le contrôle des données et des technologies devient de plus en plus crucial.
Le plus lu
Le XRP à 60 dollars ? Un analyste pointe un seuil décisif
Un analyste estime que le cours du XRP pourrait grimper à 60 dollars si une résistance cruciale venait à céder. Il faudrait pour cela une hausse de plus de 4 000 %.
Chez ASML, Macron plaide pour une filière européenne des puces et de l’IA
Le géant néerlandais des équipements pour semi-conducteurs ASML a reçu Emmanuel Macron et Rob Jetten, venus défendre une ambition européenne dans les puces et l’intelligence artificielle. Reste à savoir ce qu’une telle visite peut produire concrètement.
XRP : la prévision de Grok, l’IA d’Elon Musk, pour fin septembre
Grok estime que le cours du XRP devrait se situer autour de 1,45 à 1,60 dollar fin septembre, tout en laissant la porte ouverte à une hausse plus marquée.