جینا در ۱۷ سپتامبر ۲۰۲۶ توضیحات فنی تازه‌ای درباره مدل Jina-OCR-v1 منتشر کرد. این مدل تصویر صفحه‌های اسناد را می‌خواند و می‌کوشد علاوه بر متن، ترتیب خواندن، جدول‌ها و فرمول‌ها را هم حفظ کند. وزن‌های مدل و کد لازم برای اجرای آن در Hugging Face در دسترس است. برای شرکتی که هزاران سند اسکن‌شده دارد، موضوع صرفاً تشخیص چند کلمه نیست؛ خروجی باید آن‌قدر درست و منظم باشد که بتوان آن را جست‌وجو، بررسی و در سامانه‌های دیگر استفاده کرد.

مقاله پژوهشی مدل پیش‌تر، در ۲ سپتامبر، در arXiv منتشر شده بود. ارقام سرعت و دقتی که همراه معرفی تازه آمده‌اند، نتیجه آزمون‌های پژوهشگران سازنده‌اند و نباید آن‌ها را تضمین عملکرد روی اسناد هر سازمان دانست. محدودیت مهم دیگر به مجوز مربوط است: وزن‌های منتشرشده تحت CC BY-NC 4.0 قرار دارند و برای استفاده تجاری باید مجوز جداگانه گرفت. در دسترس بودن فایل‌های مدل، به‌خودی‌خود اجازه استفاده تجاری نمی‌دهد.

مدلی که باید ساختار سند را هم بفهمد

این سامانه بر پایه معماری DeepSeek-OCR ساخته شده است. طبق توضیحات فنی سازندگان، بخش پردازش تصویر نمای کلی صفحه‌ای با ابعاد ۱۰۲۴ در ۱۰۲۴ پیکسل را به ۲۵۶ واحد تصویری فشرده می‌کند و در صورت نیاز، بخش‌های کوچک‌تری از تصویر را نیز بررسی می‌کند. بخش تولید متن نزدیک به سه میلیارد پارامتر دارد، اما برای ساخت هر واحد خروجی حدود ۵۷۰ میلیون پارامتر را به کار می‌گیرد. این اعداد مشخصات معماری‌اند؛ از آن‌ها به‌تنهایی نمی‌توان میزان حافظه لازم یا سرعت اجرای همه اسناد را نتیجه گرفت.

خروجی مدل بسته به دستور می‌تواند متن با ترتیب خواندن طبیعی، Markdown، جدول HTML یا فرمول LaTeX باشد. این تفاوت برای کاربردهای واقعی تعیین‌کننده است. اگر خانه‌های جدول به ترتیب اشتباه خوانده شوند، یک گزارش مالی ممکن است عدد درست را کنار عنوان نادرست قرار دهد. خطا در نماد یک فرمول هم می‌تواند معنای آن را عوض کند. به همین دلیل، آزمودن مدل فقط با نمره کلی تشخیص متن کافی نیست؛ جدول، فرمول و ترتیب بخش‌ها باید جداگانه ارزیابی شوند.

کارت مدل در Hugging Face شیوه اجرای آن با Transformers و vLLM را شرح می‌دهد و به یک سرویس میزبانی‌شده با رابط سازگار با OpenAI نیز اشاره می‌کند. نمونه اجرای Transformers از گزینه trust_remote_code=True استفاده می‌کند؛ یعنی بخشی از کد اختصاصی مخزن هنگام بارگذاری اجرا می‌شود. سازمانی که اطلاعات محرمانه پردازش می‌کند باید پیش از استفاده، این کد، وابستگی‌ها و نسخه انتخاب‌شده را بررسی و ثابت نگه دارد. وجود راهنمای اجرا به معنی تأیید امنیتی آن نیست.

دو برابر سریع‌تر، اما در کدام بخش؟

پژوهشگران از روش FastMTP استفاده کرده‌اند که چند واحد متن را از پیش پیشنهاد می‌کند و سپس خروجی را با مدل اصلی تطبیق می‌دهد. این روش در تنظیمات پژوهش، سه جایگاه بعدی را پیش‌بینی می‌کند. سازندگان می‌گویند نتیجه نهایی با خروجی روش معمولِ انتخاب قطعی کلمه بعدی یکسان می‌ماند. منظور از این یکسانی، تفاوت نداشتن دو روش تولید متن است؛ نه اینکه تشخیص متن سند بدون خطا باشد.

در آزمایش‌های اعلام‌شده، امتیاز مدل در OmniDocBench نسخه ۱٫۶ برابر ۹۱٫۱۴ و در olmOCR-Bench برابر ۸۳٫۴ بوده است. سرعت ثبت‌شده در شرایط مقایسه پژوهشگران ۲٫۵۷ صفحه در ثانیه است. آن‌ها همچنین می‌گویند FastMTP روی پردازنده گرافیکی NVIDIA L4 سرعت مرحله تولید متن را نسبت به روش معمول تقریباً دو برابر می‌کند. این دو عدد یک چیز را اندازه نمی‌گیرند: دو برابر شدن سرعت تولید متن لزوماً به معنی نصف شدن زمان پردازش کامل فایل نیست.

خواندن تصویر، تفکیک صفحه، بزرگ‌نمایی قسمت‌های ریز، تعداد صفحه‌های پردازش‌شده در هر نوبت و طول خروجی بر سرعت نهایی اثر می‌گذارند. روش آموزش تکمیلی مدل نیز از بررسی‌های قابل‌محاسبه برای درستی و ساختار جدول‌ها و فرمول‌ها استفاده می‌کند و به پاسخ‌های تا حدی درست هم امتیاز می‌دهد. داده‌های آموزشی ترکیبی از منابع عمومی پالایش‌شده و صفحه‌های مصنوعی هدفمند هستند. این طراحی قابل بررسی است، اما نتیجه آن برای دست‌خط، اسکن کم‌کیفیت یا فرم‌های خاص هر شرکت هنوز باید جداگانه سنجیده شود.

هزینه واقعی را با صفحه قابل‌استفاده بسنجید

از کنار هم گذاشتن جزئیات معماری و آزمون‌ها می‌توان به یک معیار عملی رسید: برای ارزیابی سامانه خواندن سند، شمار واحدهای متن تولیدشده در ثانیه به‌تنهایی معیار خوبی نیست. ممکن است مدلی متن طولانی‌تری برای همان صفحه تولید کند و با وجود سرعت ظاهری بالا، دیرتر به خروجی قابل‌استفاده برسد. تعداد صفحه در ثانیه مفیدتر است، اما هزینه اصلاح جدول‌های خراب یا بازخوانی صفحه‌های ناموفق را در نظر نمی‌گیرد.

پیشنهاد تحلیلی Aipolix این است که تیم فنی مجموعه‌ای نماینده از اسناد خود را با مجوز مناسب انتخاب کند و سه شاخص را هم‌زمان بسنجد: چند درصد صفحه‌ها به سطح کیفیت ازپیش‌تعیین‌شده می‌رسند، پردازش کامل همراه با تلاش مجدد چقدر طول می‌کشد و هزینه محاسباتی چقدر است. باید هزینه هر صفحه پذیرفته‌شده را محاسبه کرد، نه فقط هزینه هر صفحه‌ای که پردازش آن شروع شده است. برای جدول‌ها رابطه سطر و ستون، برای فرمول‌ها نمادها و برای متن ترتیب خواندن و بخش‌های جاافتاده اهمیت دارد.

این مسئله در سامانه‌های بازیابی اطلاعات جدی‌تر می‌شود. اگر یک عدد به خانه اشتباه جدول نسبت داده شود، آن اشتباه ممکن است وارد فهرست جست‌وجو شود و بعد در پاسخ هوش مصنوعی با ظاهری مستند تکرار شود. این پیامد، تحلیل فنی Aipolix از زنجیره استخراج و بازیابی است؛ سازندگان درباره کیفیت پاسخ‌های نهایی تمام سامانه‌های متصل تضمینی ارائه نکرده‌اند. نگهداری تصویر صفحه و ارتباط هر بخش استخراج‌شده با منبع اصلی، راه بررسی خطاهای احتمالی را باز می‌گذارد.

دانلود مدل با مجوز استفاده آزاد تجاری یکی نیست

کارت رسمی مدل برای وزن‌ها مجوز CC BY-NC 4.0 را درج کرده و برای استفاده تجاری درخواست تماس می‌کند. بنابراین نباید آن را مدلی با مجوز تجاری آزاد معرفی کرد. سازمان‌ها باید پیش از به‌کارگیری وزن‌ها در محصول پولی یا فرایند تجاری، شرایط مجوز مناسب را روشن کنند. دسترسی به رابط میزبانی‌شده نیز به‌خودی‌خود حق اجرای تجاری وزن‌های دانلودشده را ایجاد نمی‌کند؛ قرارداد سرویس و مجوز استقرار شخصی دو موضوع جدا هستند.

مدل برای انواع سند و زبان‌های مختلف معرفی شده، اما کارایی آن روی نسخه‌های اسکن‌شده هر سازمان باید با نمونه‌های واقعی و پاسخ مرجع بررسی شود. متن چاپی، یادداشت دست‌نویس، پانوشت ریز و جدول متراکم ممکن است خطاهای متفاوتی داشته باشند. Jina-OCR-v1 امکان آزمایش یک روش تازه برای سریع‌تر کردن پردازش سند را فراهم کرده است، اما تصمیم استقرار باید بر کیفیت تأییدشده خروجی، هزینه کامل، بازبینی امنیت کد و مجوز درست تکیه کند؛ نه صرفاً یک عدد جذاب در جدول ارزیابی.

منابع
- معرفی فنی مدل از سوی جینا و Elastic
- کارت مدل و مجوز در Hugging Face
- مقاله پژوهشی سازندگان در arXiv