OpenAI a rendu publique une vaste collection de résultats mathématiques produits par un modèle de pointe interne qui n'est pas encore accessible. Le dépôt ouvert contient 722 manuscrits répartis en 372 familles de résultats liés et couvre plusieurs domaines des mathématiques. Selon l'entreprise, cette démarche fait suite à la saturation de ses évaluations mathématiques existantes, ce qui l'a conduite à tester ses modèles sur des problèmes de recherche ouverts.
Le dépôt ne contient pas seulement des manuscrits. Il comprend des fichiers sources, un catalogue de formalisations en Lean, dix résumés abrégés du raisonnement du modèle et des informations sur la méthode de production. OpenAI indique avoir soumis environ 4 000 problèmes au système et affirme que la grande majorité des résultats retenus ont été obtenus selon une procédure commune. En moyenne, chaque résultat publié aurait nécessité l'équivalent d'environ trois heures de calcul en mode de raisonnement ChatGPT Pro. Certaines recherches ont toutefois suivi des procédures différentes.
L'ampleur de la publication ne signifie pas que l'ensemble des résultats est définitivement validé. Le dépôt d'OpenAI précise lui-même que les manuscrits se trouvent à différents stades de vérification, que tous ne disposent pas d'une formalisation Lean et que certains résultats non formalisés peuvent comporter des erreurs. La preuve formelle peut vérifier une démonstration dans un système donné, mais la nouveauté, la portée et la correction globale de centaines de travaux nécessitent encore l'examen de spécialistes.
L'Advisory Group on Mathematics and Artificial Intelligence, indépendant d'OpenAI, a qualifié la publication d'événement important tout en précisant que son rôle de conseil ne constituait ni une validation des résultats ni une approbation du processus d'OpenAI. Le groupe considère la mise à disposition publique comme le début, et non l'achèvement, du travail d'évaluation et de compréhension par la communauté mathématique.
L'enjeu principal est méthodologique. L'évaluation des modèles avancés commence à dépasser les benchmarks pour entrer dans la production de connaissances scientifiques candidates. Dans ce contexte, la vérification, la révision et l'évaluation de la portée des résultats peuvent devenir aussi importantes que leur génération. À ce stade, on peut conclure que le modèle interne a produit un volume exceptionnel de travaux mathématiques candidats, dont une partie est formalisée et une autre reste à valider.