Des chercheurs de Tencent Hunyuan ont publié une prépublication consacrée à une question d'architecture concrète pour l'IA multimodale : à quelle échelle un modèle pourrait-il apprendre la vision directement à partir des pixels sans dépendre d'un encodeur visuel préentraîné séparé ? L'étude compare des modèles de langage multimodaux avec encodeur à des systèmes sans encodeur. Selon les auteurs, l'approche sans encodeur est moins efficace en calcul sur l'objectif multimodal aux échelles effectivement testées, mais elle progresse plus vite lorsque le budget de calcul d'entraînement augmente. Des lois d'échelle ajustées projettent un possible rattrapage autour de 10^22 FLOPs.

Cette projection constitue à la fois le résultat le plus marquant et la principale limite du travail. Les chercheurs n'ont pas observé directement ce croisement. Ils extrapolent une tendance ajustée au-delà de la plage mesurée. Il faut donc considérer ce niveau de calcul comme une hypothèse sur le comportement à plus grande échelle, et non comme un seuil démontré. Le document est en outre une prépublication, et ses conclusions restent liées aux familles de modèles, aux données, aux choix d'optimisation et aux évaluations de l'expérience.

Une autre façon de poser la question d'architecture

De nombreux grands modèles multimodaux utilisent un encodeur visuel préentraîné pour transformer une image en représentations exploitables par le modèle de langage. Cette organisation apporte un socle visuel déjà structuré et peut améliorer l'efficacité de l'entraînement, puisque le modèle de langage n'a pas à apprendre toute la chaîne de représentation visuelle à partir des pixels bruts.

Une architecture sans encodeur retire cette composante spécialisée. Le décodeur doit apprendre des représentations visuelles utiles en même temps que le langage et le raisonnement multimodal. Dans les expériences menées par l'équipe Tencent Hunyuan, les courbes de l'objectif textuel sont annoncées comme proches entre les deux approches. Sur l'objectif multimodal, les modèles sans encodeur restent en retrait aux petites échelles testées, mais leurs courbes ajustées progressent plus rapidement.

La décision d'ingénierie change donc de nature. Il ne s'agit plus seulement de savoir si l'apprentissage multimodal sans encodeur fonctionne, mais de déterminer si la simplicité d'une architecture unifiée peut finir par compenser son coût d'entraînement supérieur.

Le décodeur développe une spécialisation visuelle

Les auteurs examinent également l'évolution interne du décodeur sans encodeur. Ils indiquent que les interactions bidirectionnelles entre jetons visuels deviennent plus utiles lorsque le calcul augmente, que le traitement visuel se déplace vers des couches plus précoces et que le routage des experts pour les jetons visuels devient plus concentré.

Ces observations sont compatibles avec l'idée que le décodeur développe progressivement des calculs spécialisés pour la vision. Pour les concepteurs de systèmes multimodaux et de modèles à mélange d'experts, la conséquence est importante : supprimer l'encodeur visuel ne supprime pas nécessairement la spécialisation visuelle. Celle-ci peut se déplacer à l'intérieur du modèle partagé et modifier la manière d'allouer capacité, routage et calcul.

L'unification de l'architecture ne doit donc pas être confondue avec l'absence de traitement spécialisé. Le bénéfice potentiel réside plutôt dans une architecture externe plus simple et dans des représentations apprises plus conjointement.

Pourquoi 10^22 FLOPs ne constitue pas un seuil établi

Le croisement projeté autour de 10^22 FLOPs se situe au-delà de la plage mesurée. Aux échelles réellement testées, les modèles sans encodeur restent moins efficaces en calcul sur l'objectif multimodal et obtiennent des scores aval inférieurs. Une loi d'échelle peut également changer avec la composition des données, la recette d'entraînement, la famille de modèles ou les tâches d'évaluation.

Pour une équipe qui doit choisir aujourd'hui une architecture ou un budget d'entraînement, les mesures disponibles continuent donc de favoriser l'encodeur visuel préentraîné lorsque l'efficacité du calcul est prioritaire. La projection est surtout utile pour définir les prochaines expériences, pas pour justifier immédiatement une migration.

L'analyse d'Aipolix est que ce travail transforme le choix d'une architecture multimodale sans encodeur en problème d'allocation du calcul. Si des expériences plus grandes observent effectivement le croisement prévu, les décodeurs multimodaux unifiés pourraient devenir plus intéressants aux très grandes échelles. Si le croisement se déplace fortement avec d'autres recettes, les encodeurs spécialisés pourraient conserver leur avantage bien plus longtemps.

Les prochaines preuves à rechercher

La confirmation la plus solide serait un entraînement contrôlé à plus grande échelle qui franchisse réellement le point projeté tout en conservant des données, une optimisation et des évaluations comparables. Une réplication sur d'autres familles de modèles permettrait aussi de déterminer si le comportement observé est général ou propre à cette configuration.

En attendant, l'article fournit un signal architectural utile plutôt qu'une règle établie. Il suggère que la dépendance actuelle aux encodeurs visuels peut en partie refléter l'économie du calcul disponible, tout en montrant que les systèmes sans encodeur n'ont pas encore effacé leur désavantage d'efficacité dans les mesures réalisées.

Sources

https://arxiv.org/abs/2609.35457
https://huggingface.co/papers/2609.35457