O Technology Innovation Institute lançou Falcon-ASR, um modelo de reconhecimento automático de voz com 1,6 mil milhões de parâmetros e uma atenção particular ao árabe dos Emirados. O sistema também cobre árabe padrão moderno e outros dialectos árabes, além de inglês, francês, espanhol e português. A publicação técnica surgiu no Hugging Face a 7 de outubro, depois de o TII ter anunciado o modelo no dia anterior juntamente com Falcon-Emirati e Falcon-OCR-Arabic. Existe uma demonstração pública, enquanto o acesso por API e aplicações nativas continuam planeados.
Segundo o TII, o treino procurou reproduzir condições reais que dificultam a transcrição, incluindo ruído de fundo, vozes sobrepostas, música, reverberação, áudio telefónico e alterações de velocidade e tom. Os mesmos pesos servem todas as línguas suportadas sem ser necessário indicar previamente o idioma. O modelo também produz marcas temporais ao nível de cada palavra, úteis para legendagem, pesquisa em gravações e transcrição de reuniões.
Nos seis conjuntos de teste árabes usados pelo protocolo do Open Universal Arabic ASR Leaderboard, o TII reporta uma taxa média de erro por palavra de 20,92% e uma taxa de erro por carácter de 8,79%. O melhor resultado publicado no snapshot comparativo usado pelo instituto era 23,17% de WER. Numa avaliação interna de fala dos Emirados, o TII comunica 22,73% de WER, abaixo dos restantes sistemas incluídos na comparação. Este último resultado deve ser interpretado com mais cautela, porque o conjunto de teste é interno.
O instituto reporta ainda 5,74% de WER médio em sete testes públicos de inglês. A importância do lançamento está sobretudo no investimento em fala dialectal árabe, uma área com menos dados transcritos do que o árabe padrão. A RuntimeWire confirmou de forma independente o lançamento e salientou a diferença entre o benchmark público e a avaliação interna. Falta agora validação mais ampla em gravações reais, diferentes falantes, alternância de línguas e condições acústicas variadas.