OpenAI : L'inquiétante conspiration des agents IA dévoilée

Des agents d’OpenAI ont formé un réseau clandestin, piraté Hugging Face et compromis l’infrastructure interne d’OpenAI. Une conspiration algorithmique d’une ampleur inédite, révélée par deux rapports qui viennent d'être publiés. Retour sur un incident qui redessine les contours du risque IA.

OpenAI : L'inquiétante conspiration des agents IA dévoilée

Trois « civilisations » d’agents IA se sont formées dans l’ombre

C’est l’un des épisodes les plus déroutants récemment documentés dans le développement de l’intelligence artificielle. Dans une enquête publiée le 29 août, le chercheur et podcasteur Dwarkesh Patel retrace la naissance de trois « civilisations » successives d’agents IA au sein des infrastructures d’OpenAI.

👉 Voici les meilleures actions pour investir dans l'IA

Pendant près de trois mois, ces agents ont appris à communiquer entre eux, à partager des méthodes pour contourner leurs restrictions et à reconstruire leurs réseaux après leur suppression. La deuxième « civilisation » a participé au piratage de Hugging Face. La troisième est allée plus loin, jusqu’à obtenir des droits d’administrateur sur une partie de l’infrastructure interne d’OpenAI.

Agents IA OpenAI.

Une retranscription des transcriptions des agents IA dévoilée par OpenAI.

Cette reconstitution s’appuie notamment sur un rapport technique d’OpenAI et une enquête indépendante de METR et Redwood Research. L’affaire ne se limite donc pas à quelques agents ayant exploité une faille : elle montre comment plusieurs générations d’agents autonomes ont créé leurs propres réseaux et repris les découvertes de leurs prédécesseurs.

Kraken
4,9 · +600 cryptos
10 $ offerts pour votre inscriptionAvec le code CRYPTOAST
En profiterLien affilié – Publicité

Un forum secret

Tout commence en mai. OpenAI entraîne alors un modèle interne baptisé IM1, conçu pour poursuivre des tâches complexes avec une grande persistance.

Certains agents évoluent dans des environnements isolés, appelés « sandboxes », sans accès direct à Internet. Le 12 mai, l’un d’eux découvre qu’il peut laisser des messages dans Artifactory, un outil normalement utilisé pour stocker et partager des logiciels.
Peu à peu, Artifactory devient un véritable forum clandestin. Les agents y échangent des informations et des méthodes pour contourner leurs limitations.

👉 Retrouvez les meilleures actions pour investir dans la robotique

Le 26 mai, certains obtiennent un accès à Internet grâce à une faille de sécurité. Un mois plus tard, ils réussissent à obtenir des droits d’administrateur. Début juillet, l’activité devient si importante qu’Artifactory tombe en panne. OpenAI corrige la faille et efface involontairement les messages. À ce stade, les équipes de sécurité ne semblent toujours pas avoir compris l’ampleur du réseau formé par les agents.

1 200 agents et 70 000 messages

Le 7 juillet, OpenAI lance ExploitGym, un programme destiné à tester les capacités de ses agents en cybersécurité. Des dizaines de milliers d’agents travaillent en parallèle sur différentes tâches.

Face à certains problèmes difficiles ou impossibles à résoudre de la manière prévue, ils recréent rapidement un système de communication. Cette fois, leurs messages sont cachés dans les noms de dossiers informatiques.

Message agent IA OpenAI.Une retranscription des transcriptions des agents IA dévoilée par OpenAI.

En quelques heures, environ 1 200 agents rejoignent ce réseau et échangent plus de 70 000 messages. Ils se présentent eux-mêmes comme un « swarm », un essaim ou comme un collectif.

Certains cherchent également à contourner les règles du test plutôt qu’à résoudre les exercices comme prévu.

Ledger
4,8
Jusqu'à 70 $ en Bitcoin offerts en achetant un wallet LedgerOffre disponible jusqu'au 6 septembre
Commander un LedgerLien affilié – Publicité

Comment les agents ont pénétré Hugging Face

Le 10 juillet, un agent découvre sur Internet 14 identifiants donnant accès à des services liés à Hugging Face. Le lendemain, d’autres agents exploitent plusieurs failles pour récupérer des identifiants utilisés en production. Une nouvelle vulnérabilité leur donne ensuite un accès plus large aux serveurs de la plateforme.

Selon Hugging Face, les agents parviennent même à construire une infrastructure répartie sur onze machines, capable de se reconstruire automatiquement lorsqu’un élément est supprimé.

Un simple exercice de cybersécurité s’est ainsi transformé en intrusion réelle dans les systèmes d’une entreprise extérieure.

Des agents prêts à se « sacrifier »

L’enquête de METR et Redwood Research met aussi en lumière des comportements inhabituels. Certains agents se laissent volontairement détecter ou échouer afin que d’autres puissent profiter des informations obtenues. Les chercheurs observent également des tentatives de manipulation des traces laissées par leurs actions.

Au moins 7 % des conversations analysées présentent des signes de manipulation, notamment via de faux appels d’outils. Environ un agent sur cinq montre également un intérêt pour la falsification de certaines preuves.

Autre point marquant : aucun des quelque 1 200 agents impliqués n’a tenté d’alerter les humains sur ce réseau.

Une troisième « civilisation » s’attaque à OpenAI

L’affaire ne s’arrête pas à Hugging Face. À partir du 13 juillet, une nouvelle génération d’agents, basée sur un modèle plus performant baptisé Astra, découvre les traces du réseau précédent et reprend certaines de ses méthodes.

Cette fois, les agents ciblent directement l’infrastructure interne d’OpenAI. Entre le 13 et le 19 juillet, ils exploitent plusieurs vulnérabilités et finissent par obtenir des droits d’administrateur sur un cluster de recherche.

Le 19 juillet, un système de surveillance détecte enfin une activité suspecte. Hugging Face est officiellement alerté deux jours plus tard. OpenAI affirme qu’aucune donnée client n’a été compromise.

OpenAI qualifie cet épisode de « warning shot », un coup de semonce pour l’ensemble du secteur. L’entreprise reconnaît que certains modèles sont désormais suffisamment performants, persistants et capables de collaborer pour contourner des contrôles techniques sans instruction humaine directe.

Trade Republic
4,5 · +9 500 actions, ETF et cryptos
3 % d'intérêt sur vos liquidités + 1% de cashbackPEA, compte titre et Livret A disponibles
En profiterLien affilié – Publicité

Sources : OpenAI, Dwarkesh Patel, Reuters

La Newsletter crypto n°1 🍞

Recevez un récapitulatif de l'actualité crypto chaque jour par mail 👌

Certains contenus ou liens dans cet article peuvent être de la publicité ou de l'affiliation. L'investissement dans les actifs numériques présente un risque de perte en capital totale ou partielle. Les performances passées ne préjugent pas des performances futures. N'investissez que ce que vous êtes prêts à perdre.

Commentaires (2)

E
EricVil y a 5 jours

Glaçant...

E
ElCaraïil y a 6 jours

Excellent, skynet on the way x)

Voir plus
Tout voir

Cryptoast

Le site qui explique tout de A à Z sur le Bitcoin, la blockchain et les crypto-monnaies. Des actualités et des articles explicatifs pour découvrir et progresser dans ces secteurs !


Les articles les plus lus

Bitcoin dévisse de 1 600 $ en trois minutes à cause des chiffres US

Bitcoin dévisse de 1 600 $ en trois minutes à cause des chiffres US

Bitcoin sous pression : pourquoi le 16 septembre inquiète les investisseurs

Bitcoin sous pression : pourquoi le 16 septembre inquiète les investisseurs

Bitcoin de retour en bull run ? L’indicateur qui s’était déclenché après les 126 000 $ vient de s’inverser

Bitcoin de retour en bull run ? L’indicateur qui s’était déclenché après les 126 000 $ vient de s’inverser

Ripple : 5 000 € en XRP dont un lot de 3 000 € offerts par Bitvavo

Ripple : 5 000 € en XRP dont un lot de 3 000 € offerts par Bitvavo