Cohere Labs a publié des travaux visant à faire raisonner les modèles dans la même langue que celle utilisée par l'utilisateur, plutôt que de les voir revenir presque systématiquement à l'anglais pour leurs étapes intermédiaires. L'étude présente Tiny Aya L2-Thinker, un modèle de recherche de 3,35 milliards de paramètres, et avance qu'une composition soigneuse des données de fine-tuning supervisé permet de transférer ce comportement à de nombreuses langues sans disposer d'un vaste corpus de raisonnement pour chacune.
La méthode combine trois catégories de données. Les exemples de raisonnement en anglais apportent une base générale de résolution de problèmes. Une quantité beaucoup plus réduite de données de raisonnement multilingues apprend au modèle à exprimer ses étapes dans d'autres langues. Enfin, des questions-réponses multilingues sans traces de raisonnement facilitent la généralisation, y compris vers des langues pour lesquelles aucun exemple spécifique de raisonnement n'a été fourni.
Les chercheurs ont évalué le système sur six benchmarks et 60 langues, couvrant les mathématiques, le raisonnement culturel et de sens commun, le suivi d'instructions et la génération ouverte. Cohere affirme que Tiny Aya L2-Thinker raisonne dans la langue de la requête dans plus de 93% des cas tout en conservant, sur la plupart des tests, une précision proche de celle d'un modèle comparable qui raisonne en anglais. Une limite apparaît toutefois sur PolyMath, un benchmark de mathématiques de compétition plus difficile, où la baisse de précision est plus marquée.
L'étude examine également des techniques appliquées uniquement au moment de l'inférence. D'après les auteurs, demander à Qwen3.5-4B de raisonner dans la langue cible change peu son comportement, tandis que préremplir le début du raisonnement améliore le respect de la langue au prix d'une baisse de précision. Tiny Aya L2-Thinker produirait aussi des raisonnements plus courts et moins répétitifs dans plusieurs comparaisons.
Ces travaux sont importants car les performances multilingues sont souvent jugées uniquement sur la langue de la réponse finale. Un modèle peut répondre en français tout en effectuant son raisonnement intermédiaire en anglais. Cohere a publié les poids du modèle et les données utilisées, ce qui facilite l'inspection et la reproduction future. Aucune réplication indépendante crédible du chiffre de 93% n'a toutefois été trouvée pendant cette vérification; les performances restent donc des résultats rapportés par l'équipe de recherche.