Technology Innovation Institute (TII) مدل Falcon-OCR-Arabic را معرفی کرده است؛ یک مدل OCR با 270M پارامتر که به‌طور مشخص برای خواندن اسناد عربی سازگار شده است. تیم سازنده به‌جای بزرگ‌تر کردن معماری، طراحی early-fusion مدل Falcon OCR را حفظ کرده و فرایند آموزش را تغییر داده است: ابتدا fine-tuning نظارت‌شده روی مجموعه‌ای از اسناد واقعی و مصنوعی عربی و سپس reinforcement learning روی نمونه‌های باکیفیت‌تر و گزینش‌شده.

این تخصصی‌سازی به مشکلات مشخص OCR در زبان عربی می‌پردازد. شکل بسیاری از حروف با توجه به جایگاهشان در کلمه تغییر می‌کند، تفاوت چند نقطه می‌تواند یک حرف را به حرف دیگری تبدیل کند، اعراب ممکن است وجود داشته باشد یا حذف شود و اسناد واقعی اغلب متن راست‌به‌چپ را با حروف لاتین و اعداد غربی یا عربی شرقی ترکیب می‌کنند. TII می‌گوید داده‌های آموزشی شامل موارد کاربردی مانند رسید، فاکتور، فرم‌های اداری و کتاب بوده است. مرحله reinforcement learning نیز برای کاهش خطاهایی مانند نقطه اشتباه، اعراب ساختگی، حذف خط یا تکرار ردیف‌های جدول به کار رفته است.

بر اساس نتایجی که خود TII منتشر کرده، Falcon-OCR-Arabic در یک بنچمارک عربی شامل 11,974 نمونه واقعی در 15 دسته به دقت متنی 81.87 درصد رسیده است. در همان مقایسه Gemini 3.5 Flash با 84.34 درصد بالاتر قرار گرفته است. TII همچنین برای Falcon-OCR-Arabic امتیاز Table TEDS برابر 59.95 درصد را گزارش می‌کند که بالاترین مقدار در آن مقایسه است و می‌گوید مدل در اسناد رسمی، فرم‌های اداری، رسیدها و فاکتورها رتبه اول را گرفته است. این اعداد برای یک مدل 270M پارامتری قابل توجه‌اند، اما توسط همان تیم سازنده تولید شده‌اند و نباید معادل تأیید مستقل در نظر گرفته شوند.

این نسخه بر پایه Falcon OCR ساخته شده که model card عمومی آن در Hugging Face معماری vision-language از نوع early-fusion با 270M پارامتر را توضیح می‌دهد. در این طراحی، patchهای تصویر و tokenهای متن در یک Transformer مشترک پردازش می‌شوند. وزن‌های مدل پایه به‌صورت عمومی در دسترس است و model card مجوز Apache-2.0 را نشان می‌دهد. طبق اعلام TII، نسخه عربی همین معماری را حفظ می‌کند و به‌جای افزودن vision encoder جداگانه یا ماژول‌های اختصاصی OCR، روی آموزش هدفمند تمرکز دارد.

برای سامانه‌هایی که اسناد عربی را پردازش می‌کنند، اهمیت اصلی می‌تواند در ترکیب تخصصی‌بودن و اندازه کوچک مدل باشد. اگر نتایج اعلام‌شده در ارزیابی‌های مستقل تکرار شوند، مدلی جمع‌وجور با عملکرد مناسب روی فرم، رسید و جدول می‌تواند هزینه inference را کاهش دهد و برای استقرار محلی یا خصوصی جذاب باشد. این کار همچنین نشان می‌دهد post-training متمرکز بر خطاهای خاص یک خط نوشتاری ممکن است فاصله مدل‌های کوچک با مدل‌های چندوجهی بسیار بزرگ‌تر را کاهش دهد.

محدودیت اصلی فعلاً نبود ارزیابی مستقل است. اصل انتشار، اندازه و معماری Falcon OCR و دارایی‌های عمومی آن از منابع TII و Hugging Face قابل بررسی‌اند، اما بنچمارک عربی جدید و مقایسه عملکرد همچنان ادعاهای منتشرشده توسط تیم سازنده هستند. برای نتیجه‌گیری قوی‌تر درباره برتری مدل، بازتولید توسط طرف‌های مستقل، دسترسی قابل‌بررسی به بنچمارک و آزمایش روی اسکن‌های ضعیف و اسناد واقعی محیط‌های عملیاتی ضروری است.

منابع