O Technology Innovation Institute (TII) apresentou o Falcon-OCR-Arabic, um modelo OCR de 270 milhões de parâmetros adaptado especificamente a documentos em árabe. Em vez de criar uma arquitetura maior, a equipa manteve o desenho early-fusion do Falcon OCR e alterou sobretudo o processo de treino: primeiro com fine-tuning supervisionado sobre documentos árabes reais e sintéticos e depois com reinforcement learning sobre um conjunto selecionado de exemplos de maior qualidade.
A adaptação procura responder a dificuldades muito específicas do reconhecimento de texto árabe. As letras mudam de forma consoante a posição na palavra, pequenas diferenças nos pontos podem alterar completamente um carácter, os diacríticos são opcionais e muitos documentos combinam texto da direita para a esquerda com elementos em alfabeto latino e diferentes sistemas de numeração. A TII afirma ter incluído no treino categorias práticas como recibos, faturas, formulários administrativos e livros. A fase de reinforcement learning foi usada para reduzir erros como pontos mal colocados, diacríticos inventados, linhas ignoradas ou repetições em tabelas.
Segundo os resultados publicados pela própria TII, o Falcon-OCR-Arabic atingiu 81,87% de precisão textual num benchmark árabe com 11.974 amostras reais distribuídas por 15 categorias, ficando atrás do Gemini 3.5 Flash, com 84,34%. A equipa reporta ainda o melhor resultado de Table TEDS da comparação, 59,95%, e o primeiro lugar em documentos oficiais, formulários administrativos, recibos e faturas. Os números são relevantes para um modelo de apenas 270M parâmetros, mas foram produzidos pela organização que lançou o modelo e, por isso, não constituem validação independente.
O lançamento baseia-se no Falcon OCR já disponível publicamente no Hugging Face. O respetivo model card descreve uma arquitetura vision-language early-fusion de 270M parâmetros em que patches de imagem e tokens de texto são processados pelo mesmo Transformer. O modelo base tem pesos públicos e licença Apache-2.0. O anúncio do Falcon-OCR-Arabic indica que a adaptação preserva essa arquitetura e se concentra no treino específico para árabe, em vez de acrescentar um encoder visual separado ou módulos OCR dedicados.
Para equipas que processam documentos em árabe, o ponto mais interessante é a combinação entre especialização e dimensão reduzida. Se os resultados forem reproduzidos por terceiros, um modelo compacto com bom desempenho em formulários, recibos e tabelas poderá reduzir custos de inferência e facilitar cenários de execução local ou privada. O trabalho também sugere que post-training direcionado para erros específicos de uma escrita e de tipos concretos de documento pode permitir a modelos pequenos competir com sistemas multimodais muito maiores.
A principal reserva é a falta de confirmação externa. A existência do lançamento, a dimensão e a arquitetura do Falcon OCR e os seus ativos públicos são verificáveis nas fontes da TII e no Hugging Face, mas os novos resultados do benchmark árabe continuam a ser afirmações da própria equipa. Testes independentes, acesso reproduzível ao benchmark e avaliações sobre scans degradados e documentos reais serão necessários antes de considerar demonstrada a alegada vantagem competitiva.