Technology Innovation Institute (TII) a présenté Falcon-OCR-Arabic, un modèle OCR de 270 millions de paramètres spécialement adapté aux documents en arabe. L'équipe n'a pas remplacé Falcon OCR par une architecture plus volumineuse : elle conserve son approche early-fusion et modifie surtout l'entraînement, avec une première phase de fine-tuning supervisé sur des documents arabes réels et synthétiques, suivie d'une phase de reinforcement learning sur un ensemble sélectionné d'exemples de haute qualité.

Cette spécialisation vise des difficultés propres à l'OCR arabe. La forme des lettres varie selon leur position dans le mot, de petits points distinguent plusieurs caractères, les signes diacritiques sont optionnels et les documents réels mélangent souvent mise en page de droite à gauche, texte latin et chiffres occidentaux ou arabes orientaux. TII indique avoir couvert des cas concrets comme les reçus, factures, formulaires administratifs et livres. Le reinforcement learning cible notamment les erreurs de points, les diacritiques inventés, les lignes omises et les répétitions dans les tableaux.

D'après les résultats publiés par TII, Falcon-OCR-Arabic atteint 81,87 % de précision textuelle sur un benchmark arabe composé de 11 974 échantillons réels répartis en 15 catégories. Gemini 3.5 Flash arrive devant avec 84,34 %. TII revendique également le meilleur score Table TEDS de la comparaison, à 59,95 %, ainsi que la première place sur les documents officiels, formulaires administratifs, reçus et factures. Ces résultats sont remarquables pour un modèle de 270M paramètres, mais ils proviennent de l'équipe qui a développé le modèle et ne constituent donc pas une validation indépendante.

La nouvelle adaptation s'appuie sur Falcon OCR, déjà disponible publiquement sur Hugging Face. Son model card décrit une architecture vision-language early-fusion de 270M paramètres dans laquelle les patches d'image et les tokens de texte sont traités dans un Transformer commun. Les poids du modèle de base sont publics et distribués sous licence Apache-2.0. Selon l'annonce, Falcon-OCR-Arabic conserve cette architecture et mise sur un entraînement spécialisé plutôt que sur l'ajout d'un encodeur visuel séparé ou de modules OCR spécifiques.

Pour les pipelines documentaires en arabe, l'intérêt potentiel réside dans le rapport entre spécialisation et faible taille. Si les performances annoncées sont reproduites par des évaluations externes, un modèle compact capable de bien traiter formulaires, reçus et tableaux pourrait réduire les coûts d'inférence et faciliter les déploiements locaux ou privés. Le projet montre aussi comment un post-training centré sur les erreurs propres à une écriture peut permettre à un petit modèle de se rapprocher de systèmes multimodaux beaucoup plus grands.

La principale limite reste l'absence de confirmation indépendante. Le lancement, la taille, l'architecture et la disponibilité publique de Falcon OCR sont étayés par les ressources de TII et Hugging Face, mais les nouveaux scores sur l'arabe restent des résultats annoncés par le fournisseur. Des reproductions externes, un accès vérifiable au benchmark et des tests sur des scans dégradés ou des documents de production seront nécessaires avant de conclure à une supériorité établie.

Références