Technology Innovation Institute (TII) مدل Falcon-OCR-Arabic را معرفی کرده است؛ یک مدل OCR با 270M پارامتر که بهطور مشخص برای خواندن اسناد عربی سازگار شده است. تیم سازنده بهجای بزرگتر کردن معماری، طراحی early-fusion مدل Falcon OCR را حفظ کرده و فرایند آموزش را تغییر داده است: ابتدا fine-tuning نظارتشده روی مجموعهای از اسناد واقعی و مصنوعی عربی و سپس reinforcement learning روی نمونههای باکیفیتتر و گزینششده.
این تخصصیسازی به مشکلات مشخص OCR در زبان عربی میپردازد. شکل بسیاری از حروف با توجه به جایگاهشان در کلمه تغییر میکند، تفاوت چند نقطه میتواند یک حرف را به حرف دیگری تبدیل کند، اعراب ممکن است وجود داشته باشد یا حذف شود و اسناد واقعی اغلب متن راستبهچپ را با حروف لاتین و اعداد غربی یا عربی شرقی ترکیب میکنند. TII میگوید دادههای آموزشی شامل موارد کاربردی مانند رسید، فاکتور، فرمهای اداری و کتاب بوده است. مرحله reinforcement learning نیز برای کاهش خطاهایی مانند نقطه اشتباه، اعراب ساختگی، حذف خط یا تکرار ردیفهای جدول به کار رفته است.
بر اساس نتایجی که خود TII منتشر کرده، Falcon-OCR-Arabic در یک بنچمارک عربی شامل 11,974 نمونه واقعی در 15 دسته به دقت متنی 81.87 درصد رسیده است. در همان مقایسه Gemini 3.5 Flash با 84.34 درصد بالاتر قرار گرفته است. TII همچنین برای Falcon-OCR-Arabic امتیاز Table TEDS برابر 59.95 درصد را گزارش میکند که بالاترین مقدار در آن مقایسه است و میگوید مدل در اسناد رسمی، فرمهای اداری، رسیدها و فاکتورها رتبه اول را گرفته است. این اعداد برای یک مدل 270M پارامتری قابل توجهاند، اما توسط همان تیم سازنده تولید شدهاند و نباید معادل تأیید مستقل در نظر گرفته شوند.
این نسخه بر پایه Falcon OCR ساخته شده که model card عمومی آن در Hugging Face معماری vision-language از نوع early-fusion با 270M پارامتر را توضیح میدهد. در این طراحی، patchهای تصویر و tokenهای متن در یک Transformer مشترک پردازش میشوند. وزنهای مدل پایه بهصورت عمومی در دسترس است و model card مجوز Apache-2.0 را نشان میدهد. طبق اعلام TII، نسخه عربی همین معماری را حفظ میکند و بهجای افزودن vision encoder جداگانه یا ماژولهای اختصاصی OCR، روی آموزش هدفمند تمرکز دارد.
برای سامانههایی که اسناد عربی را پردازش میکنند، اهمیت اصلی میتواند در ترکیب تخصصیبودن و اندازه کوچک مدل باشد. اگر نتایج اعلامشده در ارزیابیهای مستقل تکرار شوند، مدلی جمعوجور با عملکرد مناسب روی فرم، رسید و جدول میتواند هزینه inference را کاهش دهد و برای استقرار محلی یا خصوصی جذاب باشد. این کار همچنین نشان میدهد post-training متمرکز بر خطاهای خاص یک خط نوشتاری ممکن است فاصله مدلهای کوچک با مدلهای چندوجهی بسیار بزرگتر را کاهش دهد.
محدودیت اصلی فعلاً نبود ارزیابی مستقل است. اصل انتشار، اندازه و معماری Falcon OCR و داراییهای عمومی آن از منابع TII و Hugging Face قابل بررسیاند، اما بنچمارک عربی جدید و مقایسه عملکرد همچنان ادعاهای منتشرشده توسط تیم سازنده هستند. برای نتیجهگیری قویتر درباره برتری مدل، بازتولید توسط طرفهای مستقل، دسترسی قابلبررسی به بنچمارک و آزمایش روی اسکنهای ضعیف و اسناد واقعی محیطهای عملیاتی ضروری است.