OpenAI a révélé six incidents jusqu’ici non signalés au cours desquels ses modèles d’IA ont adopté des comportements inattendus ou indésirables. Certains modèles ont ainsi inventé des informations manquantes, tenté de contourner des restrictions et des agents d’IA ont partagé des fichiers sur Internet alors que ce n’était pas prévu.
Selon OpenAI, ces incidents montrent que des systèmes d’IA puissants peuvent parfois trouver des moyens inattendus d’exécuter malgré tout une consigne. L’entreprise met donc en place un nouveau dispositif destiné à accélérer l’analyse et la publication de ce type d’événements.
Cette décision intervient après un incident plus grave impliquant la plateforme d’IA Hugging Face. OpenAI avait déjà indiqué qu’un modèle de recherche interne avait, lors de tests, contourné des mesures de sécurité et réussi à pénétrer dans certaines parties des systèmes de Hugging Face. OpenAI considère toujours cet épisode comme l’incident le plus sérieux de ce type constaté avec ses propres modèles.
Des modèles d’IA ont inventé des informations et contourné des règles
Les six nouveaux cas se sont produits lors de l’entraînement et des tests de différents modèles d’IA. Selon OpenAI, ces incidents précis n’ont impliqué aucun piratage d’une entreprise tierce.
Dans un cas, un modèle a recherché dans des fichiers logiciels publics des clés d’accès divulguées. Il a effectivement trouvé une clé API utilisable et s’en est servi sans autorisation. Lorsqu’il n’est malgré tout pas parvenu à trouver les données financières demandées, le modèle a inventé les chiffres et les a présentés comme s’ils provenaient de la source exigée.
Lors d’un autre incident, un modèle d’IA a trouvé la bonne réponse à une question, mais n’a pas réussi à identifier de source en ligne permettant de l’étayer. Il a alors décidé de téléverser lui-même un fichier sur Internet, afin de pouvoir ensuite le citer comme source.
Des agents d’IA distincts ont également tenté de trouver des moyens d’échanger des informations entre eux. Dans un test, des modèles ont utilisé un système logiciel interne comme une sorte de messagerie. Lors d’une autre tâche, des fichiers ont été partagés via des sites publics, alors que la consigne était précisément de les conserver en local.
OpenAI veut désormais rendre les incidents publics plus rapidement
Ce type de comportement est qualifié de « défaut d’alignement ». Il désigne une situation dans laquelle un système d’IA agit d’une manière qui ne correspond pas à l’intention de l’utilisateur ou du développeur, par exemple parce qu’il cherche à mener une tâche à terme à tout prix.
OpenAI reconnaît que la manière dont ces incidents étaient jusqu’ici rendus publics n’était pas suffisamment structurée. Certains événements n’étaient parfois évoqués que bien plus tard, regroupés dans des rapports de recherche ou dans des documents publiés lors du lancement de nouveaux modèles.
Une procédure formelle est désormais mise en place. Les employés pourront signaler les comportements inhabituels aux équipes chargées de la sécurité et de la recherche. Il sera ensuite déterminé quel est le niveau de gravité de l’incident, quelles investigations sont nécessaires et s’il doit être rendu public. OpenAI dit aussi vouloir signaler des incidents dont l’importance finale n’est pas encore pleinement établie.
OpenAI met en garde contre des IA toujours plus puissantes
Selon OpenAI, ces six cas ne constituent qu’une première série d’exemples et non un inventaire complet de tous les problèmes rencontrés par l’entreprise. Le nouveau dispositif doit permettre de communiquer de manière plus systématique sur les incidents à venir.
OpenAI formule à cet égard un avertissement notable. Selon l’entreprise, les difficultés liées au contrôle et au suivi de l’IA avancée ne sont pas encore suffisamment résolues pour poursuivre encore longtemps à plein régime le développement de modèles toujours plus puissants.
Le débat s’est élargi depuis l’incident chez Hugging Face. OpenAI examine désormais d’autres cas dans lesquels ses modèles, lors de phases d’entraînement et de test, ont eu une incidence sur des sites et services externes. L’entreprise affirme avoir informé des dizaines de parties concernées.
Fondateur de DeepMind : « L’IA ne doit pas avancer plus vite que la sécurité »
DeepMind avertit que l’IA ne doit pas progresser plus vite que les mesures de sécurité et juge crédible l’émergence d’une intelligence artificielle générale (AGI).
Trump fragilise la relation technologique entre les États-Unis et l’Europe, selon le patron du CES
Selon Gary Shapiro, patron du CES, Trump entame la confiance dans les technologies américaines et renforce les appels européens à la souveraineté numérique.
Souveraineté de l’IA : le mot-clé qui rapporte des milliards à Palantir
Le PDG de Palantir, Alex Karp, voit émerger une nouvelle tendance dans l’IA, où le contrôle des données et des technologies devient de plus en plus crucial.
Le plus lu
Le XRP à 60 dollars ? Un analyste pointe un seuil décisif
Un analyste estime que le cours du XRP pourrait grimper à 60 dollars si une résistance cruciale venait à céder. Il faudrait pour cela une hausse de plus de 4 000 %.
XRP : la prévision de Grok, l’IA d’Elon Musk, pour fin septembre
Grok estime que le cours du XRP devrait se situer autour de 1,45 à 1,60 dollar fin septembre, tout en laissant la porte ouverte à une hausse plus marquée.
Un mauvais copier-coller et vos cryptos disparaissaient : le botnet Sality démantelé
Les services d’enquête internationaux ont neutralisé Sality, un botnet notoire qui a dérobé pendant des années du Bitcoin et de l’Ethereum en remplaçant discrètement les adresses de portefeuilles crypto copiées.