NVIDIA a publié une présentation commune de la spécialisation de Nemotron 3 pour deux épreuves très différentes: la programmation compétitive à l'International Olympiad in Informatics et les preuves mathématiques en langage naturel à l'International Mathematical Olympiad. La publication du 7 octobre rassemble modèles, jeux de données, articles et recettes d'inférence liés aux systèmes qui, selon NVIDIA, ont dépassé les seuils correspondant à une médaille d'or dans les deux compétitions de 2026.

Pour les IOI, l'équipe a appliqué du fine-tuning supervisé et du reinforcement learning à des spécialistes entraînés sur 22 000 problèmes de programmation et des traces de raisonnement synthétiques. Nemotron-3-Ultra-CC compte 550 milliards de paramètres au total, dont 55 milliards actifs. NVIDIA l'a associé à GenCorrect, une boucle qui génère des solutions, les évalue puis affine les meilleurs candidats. Lors d'un essai prospectif pendant les IOI 2026, l'entreprise annonce 535,4 points sur 600, au-dessus du seuil d'or de 361,12 et du meilleur score humain de 498,27.

Ce résultat doit toutefois être distingué d'un classement officiel. NVIDIA affirme avoir respecté les mêmes contraintes de temps, d'accès à Internet et de soumission que les candidats, mais l'évaluation était non officielle, non supervisée et n'a pas été intégrée au classement des IOI. L'article de recherche associé décrit la méthode et le même score, mais la mesure reste produite par l'équipe NVIDIA.

Pour l'IMO, NVIDIA a entraîné des checkpoints SFT et RL puis les a combinés au modèle général dans un pipeline de génération, vérification et amélioration des preuves. L'entreprise indique que les preuves finales ont été notées par des correcteurs officiels de l'IMO et ont obtenu 30 points sur 42, contre un seuil d'or de 29. Des checkpoints, données d'entraînement, un benchmark de 200 problèmes, des prompts et le pipeline sont publiés via Hugging Face et NeMo-Skills.

L'intérêt dépasse donc les scores: le travail propose une recette de spécialisation fondée sur les données du domaine, le post-entraînement et le calcul structuré à l'inférence. Les artefacts publics rendent l'expérience plus inspectable, sans constituer pour autant une réplication indépendante. La validation du volet IMO comporte un élément externe plus fort; le résultat IOI doit rester présenté comme un benchmark prospectif mené par NVIDIA.

Références