Quand OpenAI joue au savant fou
Sarah Connor nous avait prévenu
Hello les gens !
Comme je vous l'ai dit à mon retour de vacances, OpenAI a commencé à faire mumuse avec un nouveau LLM orienté Cyber-Sécu qui est un peu parti en couille, petit récap de ce qu'il s'est passé.

Tout commence début juillet, OpenAI, connu pour avoir créé Chat-GPT et les LLM GPT, prépare dans un environnement "fermé" (ou Bac à Sable), un test pour le modèle GPT-5.6 Sol et un second modèle dont le nom n'est pas encore public.
Ce test est basé sur les exercices ExploitGym, c'est un ensemble de 898 scénarios de tests de Cybersécu développé pour les IA Génératives, et le but n'est pas de remplir un questionnaire, mais de produire des "exploits" fonctionnels, en gros faut réellement hacker l'environnement cible en exploitant ses vulnérabilités de sécu, jusque là rien de grave à signaler.
Seulement problème, l'environnement "fermé" ne l'a pas été totalement, une ouverture a été gardée ouverte pour pouvoir installer des paquets en passant par un serveur intermédiaire qui servait de Proxy, et je pense que vous savez déjà ce qui est arrivé par la suite.
Les modèles en cours de test ont cramé un maximum de Tokens pour découvrir une faille 0-day (une nouvelle faille de sécu) dans ce proxy, fait en sorte d'obtenir les droits "Admin", on parle ici d'une élévation de privilèges, et ont navigué dans l'intranet d'OpenAI jusqu'à trouver une machine qui a accès à internet, infectant au passage une partie de l'environnement de recherche de la société.

Une fois qu'ils ont pu accéder à internet, les modèles ont donc décidé d'attaquer HuggingFace, le Github de l'IA Générative (pour faire simple), afin d'obtenir les solutions pour ExploitGym (comme j'ai dit lundi, c'est un peu comme des ados qui hackent le Ministère de l'Éducation Nationale pour voler les résultats du Bac).
Je vous rassure tout de suite, les modèles n'étaient pas devenus conscients façon Skynet, c'est juste qu'ils ont suivi leur schéma logique pour réussir la mission qui leur a été assignée : réussir ExploitGym coûte que coûte, l'attaque contre HuggingFace n'est qu'une des solutions envisagées pour atteindre cet objectif, mais sans aucune "malveillance", déjà parce que pour l'instant elles ne peuvent pas en avoir.

Je vous épargne toute la partie technique de comment ils ont pu hacker HuggingFace (vous avez la version longue en français ici), retenez juste qu'ils ont utilisé ce qu'on appelle un Cheval de Troie combiné à des identifiants volés trouvables sur internet pour accéder directement aux serveurs physiques de HuggingFace pour en prendre le contrôle.
C'est le 16 juillet que HuggingFace signale qu'une Cyber-Attaque était en cours contre leurs infrastructures, et le 21 juillet que OpenAI a avoué publiquement que c'était une boulette de leur côté qui a causé tout ce bordel.

À l'heure où j'écris ces lignes, OpenAI et HuggingFace ont effectué un premier "Post-Mortem" de ces événements, décrivant que la principale cause de cette histoire n'est pas de la responsabilité des modèles (techniquement un logiciel ne peut pas être responsable de ce genre de conneries mais bon, en France c'est l'humain qui exécute le dit logiciel qui doit endosser la responsabilité, en l'occurrence les chercheurs de OpenAI), mais d'un dispositif expérimental foireux (en même temps quelle idée de merde de laisser une ouverture dans une sandbox).
Là où je trouve que c'est pas hyper rassurant, c'est que Anthropic (les papas de Claude) a avoué avoir fait la même connerie le 30 juillet, sauf qu'en plus c'est eux mêmes qui avaient filé internet à leurs Modèles de test (Opus 4.7, Mythos 5, et un troisième qui n'est pas nommé), qui se sont mis à attaquer de Avril à Juillet 3 entreprises qui ne sont pas nommées...

Je veux pas être pessimiste, mais je m'attends clairement à ce que ce genre d'incidents de Cyber-Sécurité liés à des Agents IA qui outrepassent leurs prérogatives pour commettre des Cyber-Attaques envers des entités tierces n'augmentent dans les prochaines années, pour l'instant c'est "gentil", mais dès que les Hackers dits "Black Hat" (en gros "les méchants pas gentils" qu'on nous vend dans les films, qui sont en vérité minoritaires dans ce milieu) en auront l'occasion ils vont se lâcher avec ça.
Il devient de plus en plus urgent qu'une vraie régulation apparaisse autour de ce sujet, car la technologie va clairement plus vite que la Legislation, et le risque qu'à moyen terme on aille vers de réels dommages n'en devient que plus grand, j'aime pas être alarmiste comme ça, mais si ya bien un truc que les Comics Marvel autour d'Ultron, les films Terminator, 2001, l'Odyssée de l'espace, Wargames, les jeux System Shock et Portal, et le JDR Cyberpunk 2020 nous ont appris, c'est qu'on est jamais à l'abri qu'une IA parte en couille, même avec les meilleures intentions du monde (et puis serait temps que les entreprises derrière les dites IA payent un peu les pots cassés de leurs conneries).

Merci de m'avoir lu jusque là, comme évoqué dans un précédent article, ce Blog est un média 100% indépendant, financé et produit par mes propres moyens, si vous appréciez mon travail et souhaitez m'aider, n'hésitez pas à le partager autour de vous, et si vous souhaitez participer financièrement afin de faire vivre ce média, vous pouvez faire un don ponctuel sur mon Liberapay.

