Le 6 octobre, OpenAI a mis en ligne 722 manuscrits mathématiques. Sans conférence de presse, sans fanfare. Un dépôt GitHub, point. Générés par un modèle secret, vérifiés pour un cinquième seulement. La communauté n'a pas mis longtemps à réagir : l'Association for Human Mathematics appelle ses membres à couper les ponts avec OpenAI, et Nature parle de « slopocalypse ». Bienvenue dans le nouveau monde de la science.
722 fichiers, zéro avertissement
Le 6 octobre 2026 à 21h47, un dépôt nommé openai/math apparaît sur GitHub. Dedans : 722 manuscrits mathématiques, environ 799 mégaoctets de PDF, de sources LaTeX et de preuves Lean. En moins de 48 heures, il récolte 9 500 étoiles et un millier de forks.
Personne n'a été prévenu. Pas de communiqué retentissant. Pas de conférence. Juste un dossier balancé en ligne, comme on vide un carton de vieux papiers sur le trottoir.
Le souci, c'est ce qu'il y a dedans. OpenAI revendique des avancées sur la quasi-hypothèse de Riemann, la conjecture des jeux uniques, la conjecture de Hodge, le problème du facteur de groupe libre. Des problèmes que des générations de mathématiciens ont attaqués pendant des décennies, parfois un siècle. Et là, ils débarquent en lot, comme des figurines Panini.
Le grand jeu des trois chiffres
Avant d'aller plus loin, il faut remettre les compteurs à zéro. La confusion est le meilleur allié de ce genre d'annonce.
OpenAI dit avoir soumis environ 4 000 problèmes à son modèle. Il en sort 722 manuscrits, regroupés en 372 « familles de résultats ». Ces trois chiffres ne mesurent pas la même chose. Diviser 722 par 4 000 ne donne ni un taux de réussite, ni un taux de résolution. Ce sont des unités différentes : des problèmes posés, des documents écrits, des regroupements thématiques.
Traduit autrement : quand on vous dit « 4 000 problèmes », on ne vous dit pas combien ont été résolus. Quand on vous dit « 722 manuscrits », on ne vous dit pas combien sont corrects. Le dépôt contient ce qu'OpenAI a jugé bon de publier, pas tout ce que la machine a produit. L'analyse de XenoSpectrum le rappelle noir sur blanc : ce sont des unités différentes.
Indicateur | Valeur |
Manuscrits publiés | 722 |
Familles de résultats | 372 |
Problèmes soumis au modèle | environ 4 000 |
Preuves Lean complètes | 162 (22 %) |
Preuves Lean partielles | 73 |
Manuscrits non formalisés | 487 |
Coût annoncé par résultat | environ 3 h de raisonnement « ChatGPT Pro » |
Modèle utilisé | non divulgué, non publié |
Licence | Apache-2.0 |
Le chiffre qui compte : 162
Il y a un chiffre qui compte vraiment, et il est enterré au milieu du README. Sur 722 manuscrits, 162 disposent d'une preuve formelle complète en Lean. Soit environ 22 %. Les deux tiers restants, 487 documents, ne reposent que sur le jugement interne d'OpenAI.
Lean, c'est l'assistant de preuve qui vérifie chaque étape logique par machine. Une preuve Lean qui compile, c'est une chaîne de raisonnement sans trou. Pas de triche possible. Pas de « on suppose que ».
Le README le reconnaît avec une candeur rare pour un laboratoire de cette taille : certains résultats non formalisés « pourraient comporter des problèmes », et OpenAI s'efforcera « de corriger rapidement tout problème de ce type ».
Traduisons. OpenAI admet noir sur blanc que les deux tiers de sa production sont potentiellement faux, et que ce n'est pas grave, ils corrigeront plus tard. Dans n'importe quelle revue de mathématiques, cette phrase vaudrait un refus immédiat.
Et encore. Une preuve Lean garantit l'absence d'erreur logique dans la chaîne codée. Elle ne garantit pas que le théorème formalisé corresponde à l'énoncé qu'on croit avoir démontré. C'est le piège classique : formaliser une version trop étroite du problème, et prouver autre chose que ce qui était annoncé.
Ce que le modèle revendique
Le catalogue est impressionnant sur le papier. La quasi-hypothèse de Riemann, avec un seuil de partie réelle repoussé. La conjecture des jeux uniques, centrale en complexité algorithmique. La conjecture de Hodge rationnelle pour les variétés abéliennes à multiplication complexe. Le problème du facteur de groupe libre. Des résultats partiels sur Birch et Swinnerton-Dyer et sur Goldfeld. Sans oublier l'exposant d'irrationalité de π et les conjectures de Mahler.
À ce stade, un détail doit être dit clairement : aucun de ces grands résultats n'a été confirmé par des mathématiciens indépendants. Zéro. Le Clay Mathematics Institute, gardien des problèmes du millénaire, n'a d'ailleurs toujours pas validé la revendication Navier-Stokes du mois dernier.
OpenAI précise aussi que deux familles échappent à la procédure standard, et que certains manuscrits ont été « édités par des humains pour les rendre lisibles ». Autrement dit, l'étiquette « entièrement généré par IA » mérite des guillemets.
Reste le coût. OpenAI annonce une moyenne d'environ trois heures de raisonnement « ChatGPT Pro » par résultat publié. C'est une mesure de calcul converti, pas une durée réelle : personne n'a résolu la conjecture de Hodge en trois heures d'horloge. Mais comparez à la revendication Navier-Stokes de septembre, environ 10 000 agents et 88 heures de calcul. Le coût marginal par résultat a dégringolé. C'est sans doute la donnée la plus stratégique du lot, et celle dont OpenAI parle le moins.
Et puis il y a le problème que tout scientifique reconnaîtra au premier coup d'œil : on ne peut pas reproduire les résultats. Le modèle est interne, non publié, impossible à interroger. En science, une affirmation vaut ce que vaut sa reproductibilité. Ici, elle vaut zéro. On vous livre le produit fini, jamais la machine qui l'a fabriqué. Imaginez un laboratoire qui publie 722 articles et refuse de montrer son protocole.
La révolte des matheux
La réponse de la communauté n'a pas traîné. L'Association for Human Mathematics a publié un communiqué sans détour : « Publier plus de 700 fichiers d'un coup n'est pas une démonstration d'érudition, mais une démonstration de puissance. » L'association demande aux mathématiciens de cesser de travailler avec OpenAI.
Le chercheur Alvaro Lozano-Robledo, de l'université du Connecticut, s'est dit stupéfait du nombre de papiers publiés d'un coup. Et le mot qui circule, repris par Nature, c'est « slopocalypse ». De l'anglais « slop », le contenu généré en masse et sans soin. L'apocalypse du remplissage.
Ce n'est pas une querelle de chapelle. En amont, 25 médaillés Fields avaient déjà signé une lettre ouverte contre la façon dont les labos d'IA traitent les problèmes non résolus comme des benchmarks. Terence Tao, lui, a mis en garde contre la loi de Goodhart : dès qu'une mesure devient un objectif, elle cesse d'être une bonne mesure. Ça vaut pour les benchmarks mathématiques comme pour le reste.
Le même jour que l'annonce Navier-Stokes, Jacob Tsimerman, médaillé Fields 2026, a lancé le Mathematical AI Safety Institute, dédié à la sécurité de l'IA vue sous l'angle des mathématiques. Le signe que la discipline, elle, ne compte pas se laisser faire.
La machine à accélérer
Pour comprendre la colère, il faut regarder la courbe. En août 2026, OpenAI révèle un modèle interne, Astra, crédité d'une dizaine de résultats. En septembre, l'entreprise annonce plus de 100 problèmes résolus, dont la revendication Navier-Stokes, environ 10 000 agents, 88 heures de calcul, plusieurs millions de dollars.
Le 6 octobre : 722 manuscrits d'un coup. Dix, cent, sept cents. Une multiplication par dix chaque mois. C'est précisément ce rythme que la communauté conteste. Pas la qualité de tel ou tel résultat, mais l'absence de cadre autour de leur diffusion.
Il y a une ironie que peu de reprises relèvent. OpenAI a créé le 21 septembre un groupe consultatif sur les mathématiques et l'IA, hébergé à Princeton, avec neuf membres dont Terence Tao. Sauf que ce groupe n'a aucun pouvoir pour ralentir quoi que ce soit. Il conseille sur les modalités de publication, pas sur l'opportunité de publier. TechCrunch et d'autres l'ont relevé. Le communiqué de l'AHM s'appuie précisément là-dessus : en ignorant la prémisse de son propre groupe consultatif, OpenAI a montré, selon l'association, « un mépris total pour les normes de la recherche scientifique ».
Pour situer le geste, un mot de contexte. Google DeepMind est la référence historique du domaine, avec AlphaProof et ses résultats formels en Lean. La différence de méthode est flagrante : DeepMind a travaillé sur des résultats formellement vérifiés, en collaboration étroite avec la communauté. OpenAI, lui, balance 722 fichiers dont deux tiers ne sont vérifiés par personne. Même échelle de puissance, deux philosophies opposées.
Verdict
Faut être juste. Publier un corpus en licence Apache-2.0, avec des preuves Lean vérifiables, c'est plus que ce que font la plupart des labos. Les 162 manuscrits formalisés sont réellement vérifiables par machine, et c'est un progrès pour la transparence. Le geste n'est pas nul.
Mais le cœur du problème reste entier. Le modèle est secret, inaccessible, impossible à interroger. Les deux tiers des résultats sont invérifiés. Et le rythme de publication, 722 d'un coup, transforme la science en production industrielle de preuves que personne n'aura le temps de lire.
C'est exactement ça, le slopocalypse. Pas une IA qui bat l'humain aux échecs. Une IA qui submerge l'humain sous un déluge de résultats plausibles, vérifiables pour certains, dont le seul but est de marquer des points sur un tableau de bord interne.
Et ça ne s'arrêtera pas aux maths. La biologie, la physique, la chimie ont le même profil : des disciplines où une machine peut produire des résultats vérifiables sans que personne les ait compris. Ce qui se joue ici n'est pas un conflit entre matheux et ingénieurs. C'est la définition même de ce qu'on appellera, demain, une découverte.
Le problème n'est pas qu'une machine ait trouvé une preuve. C'est que plus personne n'ait eu le temps de la lire.
Sources
- Dépôt officiel openai/math — README, catalogue CONTENTS.md, preuves Lean
- Nature, « OpenAI posts 700 maths preprints online: mathematicians are up in arms », 7 octobre 2026
- Communiqué de l'Association for Human Mathematics
- Terence Tao, annonce du groupe consultatif AGM-AI
- TechCrunch, « OpenAI forms math advisory group »
- XenoSpectrum, distinction 722/372/4000 et formalisation Lean
- MindStudio, courbe d'accélération des sorties
- StartupFortune, la troisième sortie en neuf semaines
- CellCog, détail du run Navier-Stokes
Auteur
Krugz
Développeur fullstack
Développeur fullstack qui tente, tant bien que mal, de suivre l'actualité de l'IA au milieu d'une marée d'informations imbuvables et des milliers d'outils et de modèles qui sortent chaque jour.







