Technology Innovation Institute a lancé Falcon-ASR, un modèle de reconnaissance automatique de la parole de 1,6 milliard de paramètres conçu notamment pour l'arabe émirati. Il couvre également l'arabe standard moderne et d'autres dialectes arabes, ainsi que l'anglais, le français, l'espagnol et le portugais. La publication technique est parue sur Hugging Face le 7 octobre, après une annonce de TII la veille aux côtés de Falcon-Emirati et Falcon-OCR-Arabic. Une démonstration publique est disponible, tandis que l'accès par API et les applications natives restent annoncés pour plus tard.
TII indique avoir entraîné le système avec des conditions destinées à refléter l'audio réel: bruit de fond, voix qui se chevauchent, musique, réverbération, qualité téléphonique et variations de vitesse ou de hauteur. Les mêmes poids prennent en charge toutes les langues sans demander de sélectionner la langue à l'avance. Falcon-ASR fournit aussi des horodatages au niveau des mots, ce qui peut faciliter le sous-titrage et la recherche dans les enregistrements.
Sur six jeux de tests arabes utilisés par le protocole Open Universal Arabic ASR Leaderboard, TII annonce un taux moyen d'erreur sur les mots de 20,92% et un taux d'erreur sur les caractères de 8,79%. Le meilleur résultat publié dans l'instantané de référence utilisé par l'institut était de 23,17% de WER. Sur une évaluation interne de parole émiratie, TII rapporte 22,73% de WER, devant les autres systèmes comparés. Ce dernier chiffre doit toutefois rester clairement attribué à l'institut puisque le test est interne.
TII rapporte également un WER moyen de 5,74% sur sept jeux de tests publics en anglais. L'intérêt principal du modèle réside dans son orientation vers la parole arabe dialectale, moins bien dotée en données transcrites que l'arabe standard. RuntimeWire a confirmé indépendamment le lancement tout en soulignant la frontière entre les tests publics et l'évaluation interne. Des essais externes plus larges restent nécessaires pour mesurer la robustesse sur des locuteurs, dialectes et conditions d'enregistrement variés.