L’Institute of Foundation Models publie Uno, une approche d’inférence qui associe un modèle autorégressif à des poids de diffusion légers afin de produire plusieurs jetons en parallèle, tout en conservant la distribution définie par le modèle autorégressif. L’article a été soumis le 3 septembre 2026 et le dépôt sous licence Apache-2.0 fournit le code d’inférence, d’entraînement et d’évaluation ainsi que des poids publics.
Le principe consiste à séparer ce qui détermine la qualité du modèle de ce qui sert à accélérer la génération. Les poids autorégressifs restent inchangés. Des adaptateurs de diffusion sont ensuite entraînés pour proposer plusieurs jetons simultanément. L’échantillonneur Ψ-Spec vérifie ces propositions par rapport à la distribution autorégressive et ne conserve que le plus long préfixe valide.
Ce que signifie réellement « sans perte »
Ici, « lossless » a un sens probabiliste précis. Ψ-Spec s’appuie sur un mécanisme de rejet afin que les jetons acceptés suivent la même distribution cible que le modèle autorégressif. Cela ne signifie pas que deux exécutions produiront nécessairement une chaîne de texte identique, ni qu’aucune différence numérique d’implémentation n’est possible. Le point important est que l’accélération n’introduit pas volontairement un compromis de qualité en modifiant la distribution du modèle de référence.
Uno se distingue ainsi de deux approches courantes. Le décodage spéculatif repose généralement sur un modèle brouillon distinct dont les propositions sont validées par le modèle cible. Les modèles de langage à diffusion permettent, eux, une génération parallèle, mais restent souvent confrontés à un compromis entre vitesse et qualité. Uno ajoute une capacité de diffusion autour du modèle autorégressif tout en laissant à ce dernier le dernier mot lors de la validation.
Le résultat sous charge compte davantage que le pic à 3×
L’article annonce jusqu’à 3× d’accélération dans certaines configurations, mais le résultat le plus intéressant pour la production concerne la concurrence entre requêtes. Les auteurs mesurent à la fois une requête unique et la plus grande taille de lot tenant sur un GPU NVIDIA H200. Pour leur modèle Uno entraîné de bout en bout, le modèle de référence accepte un lot maximal de 64 requêtes et Uno est alors annoncé environ 1,5× plus rapide. Avec une seule requête, l’accélération est d’environ 2,2×.
Pour la variante construite à partir de Qwen3, les auteurs annoncent plus de 5 700 jetons par seconde au plus grand lot pris en charge et environ 1,6× le débit du modèle de base. Dans leurs essais, Uno dépasse également EAGLE-3 et DFlash dans les configurations comparées.
Ce point est particulièrement pertinent pour les systèmes agentiques. Une seule tâche peut déclencher plusieurs appels au modèle, des tentatives supplémentaires et des branches qui utilisent différents outils. Une mesure limitée à une requête peut donc exagérer l’intérêt d’une optimisation. Un gain qui subsiste lorsque le GPU est déjà fortement sollicité a davantage de valeur pour le coût de service et la génération de trajectoires d’entraînement.
Un artefact public suffisamment complet pour être testé
Le dépôt contient un moteur d’inférence fondé sur Nano-vLLM, les variantes linéaire et arborescente de Ψ-Spec, le code d’entraînement des adaptateurs de diffusion, les chargeurs et évaluateurs de benchmarks, ainsi que des recettes pour Uno Qwen3 8B, Uno 8B et Uno 1B. Des poids publics sont disponibles et la procédure de reproduction de l’entraînement, de l’inférence et des évaluations est documentée.
Cette ouverture est importante car les chiffres de performance restent, pour l’instant, principalement ceux des auteurs. L’article rapporte 5 255 jetons par seconde pour le modèle Uno 8B dans une comparaison de débit système sur H200, ainsi qu’un score de 68,4 sur SWE-bench Verified. Il annonce aussi de meilleurs résultats que les modèles à diffusion comparés sur plusieurs tâches agentiques, de code et de raisonnement à long contexte. Ces chiffres doivent rester considérés comme des résultats produits dans l’environnement des auteurs tant qu’ils n’ont pas été reproduits indépendamment.
L’idée d’architecture est plus durable que le chiffre de vitesse
L’analyse d’Aipolix retient surtout la séparation entre l’autorité qui définit la qualité et le mécanisme chargé d’aller plus vite. Dans Uno, les poids autorégressifs définissent toujours la distribution cible. Les adaptateurs de diffusion constituent une couche d’optimisation et le mécanisme de vérification empêche cette couche de modifier silencieusement le comportement de référence.
Ce principe dépasse le cas d’Uno. Les systèmes d’IA en production ont besoin de composants que l’on puisse remplacer ou régler sans changer implicitement le contrat comportemental du système. Uno en fournit une illustration au niveau de l’inférence : proposer rapidement plusieurs jetons, mais confier leur acceptation à un vérificateur lié à la distribution faisant autorité.
Pour une équipe qui exploite des agents à fort volume, la bonne question est donc de savoir si les gains se maintiennent avec son modèle, son matériel, ses longueurs de contexte et son niveau de concurrence. Le code ouvert permet de le vérifier. Une évaluation utile doit comparer la latence de bout en bout, le débit global, la mémoire GPU, le taux d’acceptation, la distribution des sorties et le coût des trajectoires générées à la méthode actuellement utilisée.
Ce qui est établi et ce qui reste à confirmer
L’article, le code, le pipeline d’entraînement, les outils d’évaluation et les poids publics sont disponibles. La licence Apache-2.0 rend l’implémentation inspectable et exécutable. Le caractère « sans perte » repose en outre sur un mécanisme de vérification explicite, et non sur une simple affirmation de qualité équivalente.
En revanche, l’ensemble de l’enveloppe de performance n’a pas encore été confirmé de façon indépendante. Le pic à 3×, les chiffres obtenus sur H200 et les comparaisons de benchmarks proviennent des expériences des auteurs. Les noyaux matériels, la politique de mise en lot, le modèle choisi et les paramètres de l’échantillonneur peuvent modifier fortement les résultats. Uno constitue donc une nouvelle approche crédible et reproductible pour accélérer l’inférence, mais pas la preuve que chaque déploiement autorégressif obtiendra le même gain.