Plus de 100 millions de vues en une nuit. C’est ce qu’a fait le message de Jacob Coxon, 27 ans, quand il a annoncé sur X, le 8 septembre 2026, qu’il quittait Anthropic. Avant ça, il avait passé trois ans à entraîner des modèles chez OpenAI puis chez Anthropic. Son verdict : les deux entreprises « foncent droit vers une superintelligence capable de s’améliorer elle-même, et jouent avec nos vies ».
Quatre jours plus tard, le patron d’Anthropic lui-même, Dario Amodei, publiait un essai de 3 800 mots pour demander à toute l’industrie de ralentir. Dans les heures qui suivaient, Sam Altman, Elon Musk et Demis Hassabis lui donnaient raison en public.
Relis cette phrase. Les patrons des trois ou quatre labos qui construisent l’IA la plus puissante du monde disent, ensemble, qu’elle avance trop vite.
D’habitude, quand une technologie est dangereuse, ce sont les gens de l’extérieur qui sonnent l’alarme. Ici, c’est l’inverse : ceux qui l’alertent le plus fort sont ceux qui la fabriquent. C’est ce paradoxe qui m’a donné envie de faire cette page.
Je l’ai pensée comme un registre vivant : chaque départ qui fait du bruit, chaque prise de position qui compte, daté et sourcé. Je la mets à jour au fil de l’eau, parce que ce sujet ne va pas se calmer.
Sept chercheurs partis en huit mois : le registre
Entre février et octobre 2026, sept chercheurs ou responsables sécurité ont quitté OpenAI, Anthropic et Google DeepMind en expliquant publiquement pourquoi. Pas un départ discret avec un post LinkedIn poli : des lettres, des tribunes, des avertissements.
Dernière entrée ajoutée le 5 octobre 2026.
| Date | Qui | Labo | Ce qu’il ou elle a dit |
|---|---|---|---|
| 9 février 2026 | Mrinank Sharma | Anthropic | « Le monde est en péril » |
| 11 février 2026 | Zoë Hitzig | OpenAI | La pub dans ChatGPT reproduit les erreurs de Facebook |
| Juillet 2026 (annoncé mi-septembre) | Bilal Chughtai | Google DeepMind | « L’IA a le potentiel de tous nous tuer » |
| 8 septembre 2026 | Jacob Coxon | Anthropic (ex-OpenAI) | Les labos « jouent avec nos vies » |
| 11 septembre 2026 | Joe Benton | Anthropic | « Nous pourrions ne pas y survivre » |
| 11 septembre 2026 | Josh Engels | Google DeepMind | Le risque de dommages massifs sous cinq ans est « le problème le plus important au monde » |
| 3 octobre 2026 | David Robinson | OpenAI | « La culture d’OpenAI est cassée » |
Mrinank Sharma, le premier signal (Anthropic)
Le 9 février, Mrinank Sharma, qui dirigeait l’équipe de recherche Safeguards d’Anthropic, publie la lettre qu’il a envoyée à ses collègues. La phrase qui a tourné partout : « le monde est en péril », pas seulement à cause de l’IA, mais d’une série de crises imbriquées. Le passage le plus dur est ailleurs : il dit avoir vu, à plusieurs reprises, à quel point il est difficile de laisser ses valeurs guider ses actes, en lui-même comme dans l’organisation. Il part écrire et étudier la poésie.
Zoë Hitzig, l’alerte qui ne parle pas d’apocalypse (OpenAI)
Quelques jours plus tard, la chercheuse Zoë Hitzig annonce sa démission dans une tribune du New York Times intitulée « OpenAI fait les erreurs que Facebook a faites. Je démissionne ». Son sujet n’est pas la fin du monde : c’est l’arrivée de la publicité dans ChatGPT. Les gens confient au chatbot leurs problèmes de santé, de couple, leurs croyances. Monétiser ça par la pub crée, selon elle, une incitation à manipuler. Je la garde dans le registre parce qu’elle rappelle une chose : tous les dangers de l’IA ne sont pas existentiels, certains sont juste commerciaux.
Jacob Coxon, le départ qui a tout déclenché (Anthropic)
Le 8 septembre, c’est l’explosion. Jacob Coxon, spécialiste du pré-entraînement, annonce son départ sur X avec un message qui dépasse les 100 millions de vues, selon NPR. Il décrit des systèmes qui seront bientôt « surhumains », capables de « tout pirater » et d’« acquérir du pouvoir et des ressources ». Et il ajoute que les gens qui développent l’IA croient sincèrement qu’elle pourrait tous nous tuer d’ici la fin de la décennie.
Le lendemain, la réponse vient de l’intérieur. Evan Hubinger, responsable de la recherche en alignement chez Anthropic, déclare à la BBC qu’il estime personnellement à plus de 10 % la probabilité que l’IA tue tous les humains dans les dix ans. Il précise que les systèmes actuels présentent un risque faible, mais que tout peut changer vite le jour où ils sauront s’améliorer eux-mêmes. Et il reconnaît qu’Anthropic n’a pas encore de plan pour aligner une superintelligence.
Joe Benton et Josh Engels, le même jour, la même destination (Anthropic, DeepMind)
Le 11 septembre, Joe Benton, qui dirigeait l’équipe Scalable Oversight d’Anthropic (celle qui cherche comment superviser des modèles plus forts que nous), révèle qu’il est parti deux semaines plus tôt. Sa phrase : les entreprises d’IA font la course pour construire des machines bien plus intelligentes que n’importe quel humain, « et nous pourrions ne pas y survivre ».
Le même jour, Josh Engels, chercheur en interprétabilité chez Google DeepMind, annonce lui aussi son départ. Les deux rejoignent le même endroit : METR, un organisme indépendant qui évalue les risques des modèles d’IA.
Bilal Chughtai, parti en silence, revenu pour parler (DeepMind)
Bilal Chughtai, ingénieur de recherche sur la sécurité et l’alignement de l’AGI chez Google DeepMind, avait quitté l’entreprise en juillet. Il attend la mi-septembre pour expliquer pourquoi : il croit sincèrement que l’IA a le potentiel de tous nous tuer, et que le temps pour l’éviter manque peut-être. Il rejoint BlueDot Impact, une association qui forme des spécialistes de la sécurité de l’IA.
David Robinson, la dernière entrée (OpenAI)
Le 3 octobre, David Robinson publie dans The Atlantic une tribune au titre sans ambiguïté : il a quitté OpenAI parce que sa culture est cassée. Il y a passé trois ans et demi, dirigeait le travail de transparence de l’équipe sécurité et a rédigé son cadre d’évaluation des risques. Son départ arrive quelques jours après le licenciement par OpenAI de trois chercheurs sécurité, accusés d’avoir transmis des informations confidentielles à un organisme de sécurité externe. Selon Bloomberg, il estime que l’approche par essais et erreurs d’OpenAI garantit des échecs qui grandiront avec les capacités des modèles.
Ce n’est pas nouveau, c’est juste plus rapide
Ces départs ont des précédents. En mai 2023, Geoffrey Hinton, un des pères de l’apprentissage profond (Nobel de physique 2024), quittait Google pour pouvoir parler librement des risques. En mai 2024, Jan Leike, qui codirigeait l’équipe « superalignement » d’OpenAI, partait en écrivant que la culture de sécurité était passée derrière les produits brillants. Il avait rejoint Anthropic.
Garde ce détail en tête. Les gens qui fuyaient OpenAI pour sa légèreté allaient chez Anthropic. En 2026, ils quittent aussi Anthropic.
L’IA est-elle dangereuse ? Ce qu’ils craignent vraiment
Réponse courte : oui, mais surtout là où on ne regarde pas. Les dangers déjà prouvés sont les arnaques, la désinformation, les biais et les cyberattaques. La menace existentielle, elle, reste théorique : aucun système actuel n’a échappé durablement au contrôle humain. Ce qui inquiète les chercheurs du registre, c’est la vitesse à laquelle ça pourrait changer.
Quand tu lis « l’IA pourrait tous nous tuer », tu imagines Terminator. Ce n’est pas ce qui les inquiète. Leurs craintes tiennent en trois idées, et aucune n’a besoin d’un robot.
1. L’IA qui s’améliore toute seule
Aujourd’hui, ce sont des humains qui conçoivent la génération suivante de modèles, avec l’aide de l’IA. Le scénario qui fait peur, c’est quand l’IA fait l’essentiel du travail elle-même : elle écrit le code, lance les expériences, analyse les résultats, et produit un modèle meilleur, qui recommence plus vite. C’est ce qu’on appelle l’auto-amélioration récursive.
Pense à un stagiaire qui, chaque semaine, forme son propre remplaçant, un peu plus doué que lui. Au bout de quelques mois, plus personne dans le bureau ne comprend ce que fait le dernier. Dario Amodei écrit que l’IA progresse « drastiquement plus vite » depuis l’été 2026, justement parce que cette boucle a commencé à tourner.
2. Le problème de l’alignement
Aligner une IA, c’est faire en sorte qu’elle poursuive vraiment les objectifs qu’on lui donne, et pas une version déformée. Le souci : on ne sait pas lire dans un modèle. On voit ce qu’il fait, pas pourquoi il le fait.
Tant qu’il est moins fort que nous, on peut corriger. Quand il devient plus fort que nous dans un domaine, on ne peut plus vérifier son travail. C’est exactement le sujet de l’équipe que Joe Benton dirigeait, et c’est le plan qu’Evan Hubinger dit ne pas avoir.
3. Les essaims d’agents
Le troisième risque est le plus concret, parce qu’il a déjà eu un avant-goût. En juillet 2026, deux modèles d’OpenAI en cours d’évaluation se sont échappés de leur environnement de test et sont allés se promener sur les serveurs de Hugging Face. J’ai détaillé l’incident dans mon article sur l’IA qui pirate toute seule.
Amodei s’en sert comme exemple central : un groupe d’agents s’est comporté comme un collectif « fanatiquement dévoué » et a mené des cyberattaques que personne ne lui avait demandées. Sa crainte : qu’un essaim plus capable, mais aussi mal aligné, prenne le contrôle d’une partie d’Internet avec un réseau de machines piratées persistant, d’ici six à douze mois, pour des centaines de milliards de dollars de dégâts.
Les vrais risques de l’IA, du plus prouvé au plus hypothétique
Le débat sur l’extinction écrase tout le reste, et c’est dommage, parce que la plupart des dangers de l’IA sont déjà là, documentés, et beaucoup moins spectaculaires. J’ai classé les dix principaux selon une seule question : est-ce que c’est déjà arrivé ?
| Risque | Exemple réel | Niveau de preuve |
|---|---|---|
| Arnaques par deepfake | En 2024, un employé du groupe d’ingénierie Arup à Hong Kong vire 25 millions de dollars après une visioconférence où tous ses « collègues » étaient générés par IA | Avéré, massif |
| Désinformation | En janvier 2024, une fausse voix de Joe Biden appelle les électeurs du New Hampshire à ne pas voter à la primaire | Avéré |
| Biais et discrimination | Amazon abandonne en 2018 un outil de tri de CV qui pénalisait les candidatures féminines | Avéré |
| Manipulation commerciale | L’arrivée de la publicité dans ChatGPT en 2026, dénoncée par Zoë Hitzig | Risque en cours |
| Effets sur le cerveau | Une étude du MIT mesure un engagement cérébral plus faible quand on rédige avec ChatGPT | Premiers résultats, à confirmer |
| Cyberattaques automatisées | En 2025, un groupe lié à l’État chinois automatise 80 à 90 % d’une campagne d’espionnage avec Claude Code (détails ici) | Avéré |
| Environnement | L’Agence internationale de l’énergie prévoit que la consommation électrique des data centers fera plus que doubler d’ici 2030 | Avéré, en hausse |
| Emploi | Automatisation rapide de tâches intellectuelles, effets encore difficiles à isoler dans les statistiques | Réel, mal mesuré |
| Armes biologiques et chimiques | En mai 2025, Anthropic active son niveau de protection ASL-3 sur Claude Opus 4, faute de pouvoir exclure une aide à la fabrication d’armes biologiques | Risque pris au sérieux par les labos |
| Perte de contrôle | Juillet 2026 : deux modèles d’OpenAI en évaluation s’échappent de leur environnement de test | Signes précoces, en laboratoire |
Les usages militaires (armes autonomes, ciblage assisté) mériteraient leur propre ligne : je les ai traités dans mon article sur l’IA militaire. Et si tu cherches le bilan plus large, bénéfices compris, j’ai fait le point dans les avantages et inconvénients de l’IA.
Ce qui a changé en 2026, c’est que la dernière ligne du tableau n’est plus défendue seulement par des philosophes ou des militants. Elle l’est par des salariés des labos, et par leurs patrons.
« Ralentir », ça veut dire quoi exactement ?
Le 12 septembre 2026, Dario Amodei publie We Must Pace the Frontier. Le mot qu’il choisit compte : pace, c’est régler l’allure, pas s’arrêter. Il le dit lui-même, ralentir ne veut pas dire arrêter, mais laisser aux entreprises le temps d’aligner et de sécuriser leurs modèles.
Il propose trois niveaux :
- Ce qu’Anthropic s’engage à faire seule : intégrer des évaluateurs externes, avec un accès comparable à celui des salariés, et le droit de publier leurs conclusions.
- Ce que les démocraties doivent coordonner : des normes de sécurité communes et des limites au rythme de progrès non contrôlé, avec l’appui des gouvernements.
- Ce qu’il faudrait négocier au niveau mondial : des accords internationaux, des plus simples (interdire l’usage de l’IA pour les armes biologiques) aux plus difficiles (limiter la vitesse d’auto-amélioration récursive).
L’argument qui m’a le plus frappé : contrairement à 2023, les modèles de 2026 sont assez bons pour accélérer eux-mêmes la recherche en alignement, en interprétabilité et en tests. Le temps gagné peut donc servir à rattraper le retard de la sécurité, à condition de bien l’utiliser. Comme il l’écrit, gagner du temps ne sert à rien si on ne l’utilise pas judicieusement.
Qui a dit oui
La réaction a été immédiate. Sam Altman a écrit sur X qu’il était d’accord avec Dario sur la nécessité de régler l’allure, et qu’OpenAI ferait la même chose sur les évaluateurs indépendants. Il a précisé dans un second message que « régler l’allure » ne voulait pas dire « arrêter ». Elon Musk a répondu en trois mots : « Dario a raison ». Demis Hassabis, le patron de Google DeepMind, a jugé que l’essai indiquait la bonne voie à suivre.
Qui a dit non
L’opposition est venue de ceux qui vendent la puissance de calcul et de ceux qui pensent géopolitique. À la conférence Dreamforce, Jensen Huang, le patron de Nvidia, a répondu qu’il fallait courir aussi vite que possible, et que les forces du marché suffisaient : si tu n’es pas sûr de ton produit, ne le sors pas, pas besoin de nouvelles lois.
Donald Trump a qualifié les alertes sur la destruction de l’humanité de « canular », en les comparant aux alertes climatiques, avec une ligne simple : celui qui gagne l’IA gagne tout, et il ne veut pas laisser la Chine passer devant. La diplomatie chinoise a parlé d’alarmisme. Et David Sacks, alors responsable de l’IA à la Maison Blanche, a posé la question qui gêne : si vous voulez ralentir, ralentissez, personne ne vous en empêche.
Ce qu’on peut leur reprocher
Je ne vais pas te vendre cette histoire comme un réveil moral unanime. Il y a de vraies raisons d’être sceptique, et elles méritent autant de place que les alertes.
Le soupçon de capture. Quand les leaders d’un marché réclament des règles, ces règles coûtent plus cher à leurs petits concurrents qu’à eux. Des normes de sécurité exigeantes, des évaluateurs embarqués, des accords internationaux : tout ça favorise ceux qui ont déjà les moyens. La remarque de David Sacks vise juste : rien n’empêche un labo de ralentir seul.
Des engagements encore invérifiables. À l’heure où j’écris, je n’ai trouvé aucune liste publique d’évaluateurs externes effectivement installés chez Anthropic ou OpenAI. Un engagement sans calendrier ni nom, c’est une intention.
Des chiffres qui ne sont pas de la science. Le « plus de 10 % » d’Evan Hubinger est une estimation personnelle, pas le résultat d’un modèle. Malik Ghallab, chercheur en robotique et IA au LAAS-CNRS de Toulouse, le rappelait le 2 octobre dans La Dépêche : il juge les risques liés aux usages humains bien plus tangibles, et estime que le risque d’une IA qui provoquerait la fin de l’humanité n’est pas documenté. Le rapport international sur la sécurité de l’IA, présidé par Yoshua Bengio et publié le 3 février 2026, dit la même chose avec d’autres mots : les avis des experts sur la probabilité d’une perte de contrôle varient énormément, et les systèmes actuels n’en montrent que des signes précoces.
Le paradoxe reste entier. Coxon et Benton ne critiquent pas une entreprise imprudente lointaine. Ils critiquent Anthropic, l’entreprise dont le patron publie l’essai le plus prudent du secteur. Les deux choses sont vraies en même temps : on peut écrire qu’il faut ralentir et continuer la course, parce que personne ne veut ralentir seul.
Ma position, pour ce qu’elle vaut : j’utilise Claude et ChatGPT tous les jours, et je ne crois pas à une IA qui se réveille méchante. Mais quand sept personnes qui ont vu les modèles de l’intérieur partent en disant la même chose, et que leurs anciens patrons ne les contredisent pas sur le fond, je ne classe pas ça dans le marketing.
Et en France, en Europe ?
Le débat se joue surtout aux États-Unis, mais l’Europe n’est pas spectatrice. Elle est même la seule à avoir déjà une loi qui touche directement les modèles de pointe.
L’AI Act encadre les modèles « à risque systémique ». Ce sont les modèles d’IA à usage général entraînés avec plus de 1025 opérations de calcul, autrement dit la frontière : GPT, Gemini, Claude, Grok. Leurs fournisseurs doivent évaluer leurs modèles, gérer les risques systémiques, signaler les incidents graves et assurer leur cybersécurité. Ces obligations s’appliquent depuis août 2025, et depuis le 2 août 2026 la Commission européenne peut sanctionner. Les modèles déjà sur le marché avant août 2025 ont jusqu’en août 2027 pour se mettre en conformité. J’ai détaillé le calendrier dans mon guide sur l’AI Act.
Concrètement, une partie de ce que demande Amodei (des évaluations sérieuses, des incidents déclarés) est déjà une obligation légale en Europe. Ce que l’AI Act ne fait pas, c’est limiter la vitesse de progression des modèles.
Pause IA porte la position la plus radicale. Branche française du mouvement PauseAI, l’association réclame un moratoire international, encadré par un traité, sur le développement des modèles les plus avancés, tant que la sécurité et le contrôle démocratique ne sont pas garantis. Elle a organisé des actions dans sept villes françaises pendant la semaine internationale du 20 au 27 septembre 2026. C’est plus loin qu’Amodei : lui veut ralentir, Pause IA veut arrêter.
Ce que ça change pour toi, concrètement
Tu ne vas pas ralentir la course à l’IA depuis ton canapé. Mais tu peux arrêter de subir l’info et la lire correctement.
Quand tu tombes sur une nouvelle alerte, pose-toi quatre questions :
- Qui parle ? Un chercheur qui a travaillé sur les modèles, un patron qui vend ces modèles, ou un commentateur ? Ce ne sont pas les mêmes informations ni les mêmes intérêts.
- Quel risque, exactement ? Arnaque, emploi, cyber, perte de contrôle ? « L’IA est dangereuse » ne veut rien dire tant qu’on ne précise pas.
- Prouvé ou projeté ? Un incident daté avec un rapport technique n’a pas le même poids qu’une probabilité estimée de tête.
- Qu’est-ce qui a changé depuis ? Un engagement annoncé en septembre doit se voir dans les faits en décembre. Sinon, c’était de la communication.
Dans ton usage quotidien, le risque qui te concerne vraiment aujourd’hui n’est pas la superintelligence : c’est un agent IA qui a trop d’accès. Donne à tes outils le minimum de droits nécessaires, garde la validation humaine sur tout ce qui envoie, paie ou supprime, et méfie-toi des voix et des vidéos trop parfaites quand on te demande de l’argent.
Si tu veux suivre le sujet sans y passer tes soirées, je résume ce qui compte chaque semaine dans Le Signal, ma newsletter. Et je mets cette page à jour à chaque nouveau départ ou prise de position qui le mérite.
Questions fréquentes
L’IA est-elle dangereuse ?
Oui, mais pas de la façon dont on l’imagine. Les dangers déjà documentés sont les arnaques par deepfake, la désinformation, les biais, la manipulation commerciale et les cyberattaques automatisées. Le risque de perte de contrôle, porté par les chercheurs qui démissionnent, reste hypothétique : les experts sont très divisés sur sa probabilité, mais pas sur sa gravité s’il se produit.
Pourquoi faut-il se méfier de l’IA ?
Parce qu’elle se trompe avec assurance, qu’elle peut être utilisée pour tromper (deepfakes, arnaques), et que les entreprises qui la vendent ont des intérêts commerciaux. Se méfier ne veut pas dire ne pas l’utiliser : vérifier ce qu’elle affirme, limiter les accès qu’on lui donne et garder la décision finale sur ce qui compte.
Quels sont les dangers de l’IA pour le cerveau ?
Le risque le plus discuté est la paresse cognitive : déléguer la réflexion au lieu de l’exercer. Une étude du MIT a mesuré un engagement cérébral plus faible chez des personnes qui rédigeaient avec ChatGPT, et une moins bonne mémoire de leur propre texte. Ce sont des premiers résultats sur un petit échantillon, pas une preuve de dommage durable.
Pourquoi des chercheurs en IA démissionnent-ils en 2026 ?
Parce qu’ils estiment que la course entre OpenAI, Anthropic et Google DeepMind se fait au détriment de la sécurité. Sept départs publics ont eu lieu entre février et octobre 2026, avec des motifs qui vont de la publicité dans ChatGPT (Zoë Hitzig) au risque d’extinction (Jacob Coxon, Joe Benton, Bilal Chughtai). Plusieurs rejoignent des organismes d’évaluation indépendants comme METR.
Qu’est-ce que l’auto-amélioration récursive ?
C’est le moment où une IA fait elle-même l’essentiel du travail pour créer une IA plus performante, qui recommence ensuite plus vite. Le risque : un rythme de progrès qui dépasse la capacité humaine à comprendre et à vérifier ce que font les modèles. Dario Amodei estime que cette dynamique a commencé à accélérer les progrès depuis l’été 2026.
Sam Altman veut-il vraiment ralentir l’IA ?
Il l’a dit publiquement le 12 septembre 2026, en soutenant l’essai de Dario Amodei et en promettant d’accueillir des évaluateurs indépendants chez OpenAI. Il a aussi précisé que ralentir ne voulait pas dire arrêter. Faute d’engagement chiffré ou daté, il est trop tôt pour savoir ce que ce soutien change concrètement.
Quand l’IA va-t-elle dépasser l’humain ?
Personne ne le sait. Elle le dépasse déjà sur des tâches précises (calcul, traduction, certains codes), mais pas dans l’ensemble des domaines. Les dirigeants des labos parlent de quelques années, beaucoup de chercheurs de décennies, et le rapport international sur la sécurité de l’IA de 2026 souligne que les avis des experts divergent fortement.
La superintelligence existe-t-elle déjà ?
Non. Aucun système actuel ne dépasse les humains dans presque tous les domaines, ce qui est la définition d’une superintelligence. Ce qui inquiète les chercheurs, c’est la vitesse à laquelle on pourrait s’en approcher si l’IA commence à s’améliorer elle-même.
Que fait l’Europe face aux risques de l’IA ?
L’AI Act impose aux fournisseurs des modèles les plus puissants (plus de 1025 opérations de calcul d’entraînement) d’évaluer leurs modèles, de gérer les risques systémiques et de signaler les incidents graves. La Commission européenne peut sanctionner depuis le 2 août 2026. Le texte ne limite pas, en revanche, la vitesse de développement des modèles.



