A Cohere Labs publicou uma investigação sobre como fazer com que modelos de raciocínio desenvolvam os seus passos intermédios na mesma língua utilizada pelo utilizador, em vez de recorrerem quase sempre ao inglês. O trabalho apresenta Tiny Aya L2-Thinker, um modelo de investigação com 3,35 mil milhões de parâmetros, e propõe que uma composição cuidadosa dos dados de fine-tuning supervisionado permite transferir este comportamento para muitas línguas sem exigir grandes conjuntos de raciocínio para cada uma.
A estratégia combina três tipos de dados. Exemplos de raciocínio em inglês fornecem a base geral de resolução de problemas. Uma quantidade muito menor de raciocínio multilingue ensina o modelo a desenvolver esses passos noutras línguas. Por fim, dados multilingues de perguntas e respostas sem traços de raciocínio ajudam a generalizar o comportamento, incluindo para línguas que não receberam exemplos específicos de raciocínio durante o treino.
Os investigadores avaliaram o modelo em seis benchmarks e 60 línguas, abrangendo matemática, raciocínio cultural e de senso comum, seguimento de instruções e geração aberta. A Cohere afirma que Tiny Aya L2-Thinker raciocina na língua do pedido em mais de 93% dos casos, mantendo uma precisão semelhante à de um modelo comparável que raciocina em inglês na maioria das avaliações. Existe, contudo, uma exceção relevante: no PolyMath, um benchmark de matemática de competição mais exigente, a perda de precisão é mais visível.
O estudo compara ainda métodos aplicados apenas durante a inferência. Segundo os autores, pedir ao Qwen3.5-4B que raciocine na língua do utilizador altera pouco o comportamento, enquanto forçar o início do raciocínio nessa língua melhora a conformidade mas reduz a precisão. O Tiny Aya L2-Thinker também apresenta, segundo a equipa, raciocínios mais curtos e menos repetitivos em várias comparações.
A investigação é relevante porque a qualidade multilingue costuma ser medida apenas pela língua da resposta final. Um sistema pode responder corretamente em português, francês ou persa e continuar a desenvolver internamente o raciocínio em inglês. A Cohere publicou os pesos do modelo e os dados multilingues, facilitando a inspeção e futura reprodução. Ainda assim, nesta execução não foi encontrada uma replicação independente credível do resultado de 93%, pelo que os números de desempenho devem continuar atribuídos à equipa de investigação.