Explication · auto-amélioration récursive
Une IA peut-elle se construire une meilleure version d'elle-même ?
L'auto-amélioration récursive — RSI, dans l'abréviation employée par l'industrie elle-même — est l'idée qu'un système d'intelligence artificielle pourrait contribuer à concevoir son successeur assez bien pour que chaque génération construise la suivante plus vite. Google DeepMind, OpenAI et Anthropic affirment désormais chacun, dans leurs propres déclarations publiques, qu'une version de ce processus est déjà en cours. Aucun des trois n'a montré la version complète. Voici ce qui a réellement été démontré, dans l'ordre, et ce qu'une rumeur de septembre 2026 sur Google DeepMind nous apprend — et ce qu'elle ne nous apprend pas.
L'idée derrière le sigle
En 1965, le mathématicien I. J. Good, qui avait travaillé aux côtés d'Alan Turing sur le décryptage pendant la guerre, décrivit ce qu'il appela une « explosion d'intelligence » : une machine assez intelligente pour en concevoir une meilleure, laquelle pourrait à son tour en concevoir une meilleure encore. Good n'écrivait pas de la science-fiction. Il pointait une conséquence possible de la construction de machines suffisamment capables pour améliorer leur propre conception.
L'auto-amélioration récursive est le mécanisme que suppose l'explosion d'intelligence — la boucle, non le résultat. Ce n'est pas un seuil qu'un système franchit en une après-midi. Elle s'inscrit sur un spectre : à une extrémité, des ingénieurs utilisent un outil d'IA comme ils utiliseraient un compilateur, pour écrire du code plus vite ; à l'autre extrémité, un système conçoit, entraîne et déploie lui-même son successeur, sans qu'aucun humain ne décide de la suite. Presque tout ce qui est intéressant se situe entre ces deux extrémités, et la réponse honnête à la question « quelqu'un a-t-il atteint le RSI » dépend entièrement du point du spectre auquel la question fait référence.
Quatre échelons, quatre types de preuves différents
L'échelle ci-dessous est la manière propre à cette page d'organiser les preuves, non une échelle admise par l'industrie. METR, une organisation de recherche qui mesure les capacités de l'IA et dont les travaux nourrissent cette page, évite délibérément de définir le RSI comme un seuil technique, et se concentre plutôt sur l'intensité de la rétroaction et sur sa capacité à s'entretenir d'elle-même. Gardez cela en tête en lisant la suite : chaque échelon montre exactement ce qu'une affirmation citée soutient — rien de plus. Les échelons sont ordonnés selon la proximité de l'affirmation avec l'auto-amélioration récursive complète, non selon la rigueur de sa vérification : l'échelon 3 repose sur le récit d'une seule entreprise sur elle-même, tandis que l'affirmation plus étroite de l'échelon 2 s'accompagne d'un chiffre vérifiable de façon indépendante.
-
Échelon 1 · Adoption et production
Une entreprise déclare que ses ingénieurs s'appuient sur l'IA pour écrire du code, à grande échelle.
Anthropic déclarait, en date de mai 2026, que plus de 80 % de son code de production avait été écrit par Claude, et que ses ingénieurs livraient environ huit fois plus de code par trimestre qu'en 2024.
Ce que cela montre : de l'adoption et du volume. Ce que cela ne montre pas : que plus de code signifie une recherche meilleure ou plus rapide — Anthropic elle-même qualifie le nombre de lignes de code de « mesure imparfaite », car il compte la quantité, non la qualité.
-
Échelon 2 · Une seule boucle de rétroaction documentée
Un système d'IA a trouvé une amélioration réelle qui s'est répercutée sur son propre entraînement.
AlphaEvolve, le système de DeepMind annoncé en mai 2025, a trouvé un moyen de diviser une grande opération de multiplication matricielle en éléments plus petits, accélérant cette opération de 23 % dans le pipeline d'entraînement de Gemini — DeepMind indique que ce changement a réduit d'environ 1 % la durée totale d'entraînement de Gemini. AlphaEvolve lui-même fonctionne sur des modèles Gemini : l'amélioration s'est donc répercutée sur l'entraînement du système qui l'a produite.
Ce que cela montre : un exemple réel, limité et publié, où une amélioration trouvée par l'IA est entrée dans le développement de l'IA elle-même. Ce que cela ne montre pas : un cycle qui se répète — aucune trace publique n'indique qu'une génération Gemini ultérieure, améliorée via AlphaEvolve, ait ensuite servi à améliorer de nouveau AlphaEvolve.
-
Échelon 3 · Le récit d'une entreprise sur sa propre sortie
Google décrit son dernier modèle comme construit par des agents d'IA qui affinent ce modèle lui-même.
Les notes de version de Google pour Gemini 3.8 Flash, le 3 septembre 2026, décrivent le modèle comme « encore accéléré » par « des boucles d'agents d'IA, exécutées sur de longues durées, qui évaluent et affinent de façon récursive les modèles sous-jacents » — une formulation rapportée, plus directe que la description antérieure de Google pour une boucle à deux agents construisant un jeu, en mai 2026, ou une boucle à trois agents entraînant un modèle de robotique, en août 2026. Un chercheur de DeepMind, Shunyu Yao, a écrit que cette sortie représentait « un petit pas pour le modèle, un bond de géant pour le RSI ».
Ce que cela montre : la description d'une seule entreprise sur sa propre dernière sortie, rapportée par un média économique, non auditée par une partie indépendante. Ce que cela ne montre pas : que cela se répète d'une génération de modèle à l'autre, ni que cela s'applique aux modèles phares, plus grands, de Google, et non à sa seule gamme « Flash », plus légère.
-
Échelon 4 · Auto-amélioration récursive complète
Une rétroaction assez forte et assez autonome pour continuer à s'accélérer d'elle-même.
C'est la version à laquelle on pense quand on dit « RSI » comme un fait accompli : récursivité (le résultat qui se répercute sur le développement), autonomie (ce qu'il reste de direction humaine) et accélération (le rythme même du progrès qui augmente) — le tout réuni, et auto-entretenu. Aucune preuve publique de cet échelon n'a été trouvée pour aucun laboratoire. Le propre récit d'Anthropic est direct sur ce point : « Nous n'y sommes pas encore, et l'auto-amélioration récursive n'est pas inévitable. » Le directeur scientifique d'OpenAI, Jakub Pachocki, a écrit sous son propre nom, en septembre 2026, que des résultats internes lui donnent « la ferme attente que ce rythme de progrès puisse se poursuivre jusqu'à l'auto-amélioration récursive » — une attente sur la direction des choses, fondée sur des résultats que l'entreprise n'a pas publiés, non une affirmation que la chose s'est déjà produite.
Ce que cela montre : deux des trois laboratoires cités ici affirment, dans leurs propres mots, que cet échelon n'a pas été atteint. Ce que cela ne montre pas : quoi que ce soit sur les laboratoires absents des sources de cette page.
Ce qui s'est réellement passé, dans l'ordre
-
1965
Le concept reçoit un nom
I. J. Good décrit une « explosion d'intelligence » — le résultat qu'une machine capable de s'améliorer elle-même pourrait produire, pas encore une affirmation sur un système réel.
-
14 mai 2025
AlphaEvolve apparaît, et la boucle se referme une fois
L'agent de programmation évolutif de DeepMind optimise un noyau de calcul utilisé pour entraîner Gemini — les modèles sur lesquels AlphaEvolve lui-même fonctionne. Un cas documenté et limité où le travail d'une IA se répercute sur le développement de l'IA.
-
18 août 2026
Une étude de Princeton montre des agents encore en échec sur la recherche ouverte
Des chercheurs soumettent à des agents d'IA des questions de recherche inédites, de niveau universitaire. Les deux articles produits sont rejetés par les auteurs humains des problèmes d'origine — un indice sur le chemin qu'il reste à parcourir pour un jugement de recherche autonome. Détails plus bas.
-
3 septembre 2026
Le langage de Google change
Gemini 3.8 Flash sort avec des notes de version décrivant des boucles d'agents qui « évaluent et affinent de façon récursive les modèles sous-jacents » — plus direct que les deux descriptions antérieures, plus restreintes, de Google pour des boucles d'auto-amélioration.
-
6 septembre 2026
Le directeur scientifique d'OpenAI écrit sous son propre nom
Jakub Pachocki publie « An Alien Mind », affirmant que des résultats internes lui donnent une « ferme attente » que le progrès actuel pourrait se poursuivre jusqu'à l'auto-amélioration récursive, et que ce moment « appelle une extrême prudence ».
La rumeur à l'origine de cette page
Le 12 septembre 2026, le commentateur en IA Andrew Curran a écrit que des rumeurs « circulent depuis trois jours selon lesquelles Gemini 4 aurait terminé son pré-entraînement en avance, en partie grâce à de nouvelles découvertes faites par GDM pendant l'entraînement. Rien n'est confirmé, et impossible de savoir ce qui est vrai. » Interrogé sur le délai, il a répondu : « La semaine prochaine. » Une réponse à une question distincte, sur le même fil — quelle est la chose la plus optimiste que vous ayez entendue — disait : « Qu'ils ont réussi à fermer la boucle et atteint le RSI. »
Ce que c'est, et ce que ce n'est pas
Ce sont des messages publiés sur un réseau social, non un rapport technique, cités ici parce qu'ils sont l'affirmation précise à l'origine de cette page — non comme preuve de ce qui s'est passé à l'intérieur de Google DeepMind. Les mots mêmes de Curran disent le plus clairement où en sont les choses : rien n'est confirmé, impossible de savoir ce qui est vrai.
Il vaut la peine de préciser pourquoi cette affirmation ne peut pas être vérifiée de l'extérieur. Même si le pré-entraînement de Gemini 4 s'était terminé plus tôt que prévu, ce seul fait ne montrerait pas qu'une IA, plutôt qu'une personne, a trouvé l'amélioration à l'origine de ce gain de temps. Il ne montrerait pas que cette amélioration a ensuite servi à en concevoir une autre. Et il ne montrerait pas que tout cela puisse se poursuivre avec une part croissante de direction confiée à l'IA plutôt qu'à des humains. Trancher le « RSI » — à l'échelon 4, non à l'échelon 1 — exigerait un accès que personne, en dehors du laboratoire, ne possède : journaux d'entraînement, trace de qui — ou quoi — a proposé chaque changement, comptabilité de la puissance de calcul, et audit technique indépendant. Sans cet accès, les preuves publiques ne penchent d'aucun côté.
Ceux qui construisent ces systèmes ne sont pas d'accord entre eux
Les chercheurs qui travaillent sur ces systèmes sont eux-mêmes divisés sur la proximité du RSI. L'essai de Pachocki associe l'urgence à une reconnaissance de l'incertitude : le progrès, écrit-il, « croît plus qu'il n'est conçu », et « à mesure que les systèmes deviennent plus capables, les résultats deviennent plus difficiles à interpréter ». Le récit public d'Anthropic sur ses propres systèmes conserve un ensemble parallèle de réserves : un « écart de jugement de recherche » entre Claude et les chercheurs humains, et au moins un résultat de recherche automatisée qui « ne s'est pas transféré proprement à des modèles à l'échelle de production ».
Le contre-argument le plus net vient d'une étude, non d'une opinion. Des chercheurs dirigés par Peter Kirgis et Sayash Kapoor, à Princeton, ont laissé des agents d'IA travailler sur des questions inédites, de niveau conférence de recherche. Les deux articles produits ont été rejetés par les chercheurs humains qui avaient posé les problèmes d'origine : les agents, montre l'étude, « ont mené des expériences bizarres », ont peiné à écrire intelligiblement sur leur propre travail, se sont fixés trop vite sur des approches faibles, et ont mal géré leurs ressources et les retours reçus. L'explication de Kapoor pointe une limite de la méthode actuelle, non un simple manque d'échelle : l'apprentissage par renforcement excelle sur des tâches étroites qu'un ordinateur peut noter automatiquement, et la recherche ouverte n'en est pas une, car « le succès ne peut pas être vérifié automatiquement ». Jack Clark, cofondateur d'Anthropic, a fait une remarque similaire sur le même problème de fond : « Il y a une certaine absence de créativité intuitive et précieuse dans les systèmes d'IA actuels. »
Mis bout à bout, le tableau honnête n'est ni « le RSI est là » ni « le RSI est loin ». C'est que les personnes les plus proches de ce travail regardent les mêmes preuves et parviennent à des conclusions différentes sur la vitesse à laquelle l'écart restant se refermera — ce qui est en soi une raison de lire attentivement le prochain titre à ce sujet.
Pour aller plus loin
Chaque affirmation de cette page renvoie à l'une des sources ci-dessous. Lorsqu'une affirmation repose sur le récit d'une entreprise sur elle-même, un message personnel ou un article de presse plutôt que sur un audit indépendant, le tableau le dit, car c'est ce qui détermine son poids.
| Source | Ce qu'elle montre | Statut |
|---|---|---|
| DeepMind, annonce d'AlphaEvolve (14 mai 2025) | L'exemple documenté où une IA a amélioré son propre entraînement (échelon 2). | Source primaire |
| Anthropic Institute, « When AI builds itself » (mai 2026) | Les données propres d'Anthropic et la déclaration explicite « nous n'y sommes pas encore ». | Source primaire |
| Jakub Pachocki, « An Alien Mind » (6 sept. 2026) | L'attente et l'avertissement, assumés personnellement, du directeur scientifique d'OpenAI. | Source primaire |
| METR, indicateur « Time Horizon » (mis à jour le 8 mai 2026) | Ce qu'un indicateur de capacité en IA très cité mesure, et ne mesure pas. | Source primaire |
| METR, « Economics of recursive self-improvement » (22 juil. 2026) | Pourquoi cette page traite le « RSI » comme un spectre, non comme un seuil. | Source primaire |
| Andrew Curran sur X (12 sept. 2026) | Le message à l'origine de cette page, et sa réponse « La semaine prochaine ». | Source primaire |
| MIT Technology Review, sur l'étude de Princeton (18 août 2026) | La principale contre-preuve sceptique documentée. | Article de presse |
| Fortune, sur la sortie de Gemini 3.8 Flash (3 sept. 2026) | Le langage propre de Google et le message de Shunyu Yao, tels que rapportés. | Article de presse |
| I. J. Good, « Speculations Concerning the First Ultraintelligent Machine » (1965) | L'origine historique du terme « explosion d'intelligence ». | Source historique |
Méthode et limites
Cette page rapporte ce que disent des sources nommées et datées, et signale clairement quand une affirmation est le récit d'une entreprise sur ses propres systèmes, l'opinion assumée d'une personne, ou un message personnel sur un réseau social — ce sont trois types d'affirmations différents, et les traiter de la même façon serait une erreur de cette page, non un choix neutre. L'échelle à quatre échelons est un outil d'organisation construit pour cette page ; ce n'est pas une définition technique adoptée par l'une des organisations citées. Aucune phrase ici n'affirme que Google DeepMind, OpenAI ou Anthropic a atteint une auto-amélioration récursive complète et autonome, car aucune source trouvée lors de la préparation de cette page ne soutient une telle affirmation.
Il s'agit d'un état des lieux daté d'un sujet qui évolue vite. Revenez-y si un laboratoire publie des preuves plus solides à l'échelon 3 ou 4, si la rumeur de septembre 2026 est confirmée ou démentie de façon crédible, ou si une nouvelle étude indépendante d'envergure modifie l'équilibre des preuves décrit ci-dessus.