جینا در ۱۷ سپتامبر ۲۰۲۶ توضیحات فنی تازهای درباره مدل Jina-OCR-v1 منتشر کرد. این مدل تصویر صفحههای اسناد را میخواند و میکوشد علاوه بر متن، ترتیب خواندن، جدولها و فرمولها را هم حفظ کند. وزنهای مدل و کد لازم برای اجرای آن در Hugging Face در دسترس است. برای شرکتی که هزاران سند اسکنشده دارد، موضوع صرفاً تشخیص چند کلمه نیست؛ خروجی باید آنقدر درست و منظم باشد که بتوان آن را جستوجو، بررسی و در سامانههای دیگر استفاده کرد.
مقاله پژوهشی مدل پیشتر، در ۲ سپتامبر، در arXiv منتشر شده بود. ارقام سرعت و دقتی که همراه معرفی تازه آمدهاند، نتیجه آزمونهای پژوهشگران سازندهاند و نباید آنها را تضمین عملکرد روی اسناد هر سازمان دانست. محدودیت مهم دیگر به مجوز مربوط است: وزنهای منتشرشده تحت CC BY-NC 4.0 قرار دارند و برای استفاده تجاری باید مجوز جداگانه گرفت. در دسترس بودن فایلهای مدل، بهخودیخود اجازه استفاده تجاری نمیدهد.
مدلی که باید ساختار سند را هم بفهمد
این سامانه بر پایه معماری DeepSeek-OCR ساخته شده است. طبق توضیحات فنی سازندگان، بخش پردازش تصویر نمای کلی صفحهای با ابعاد ۱۰۲۴ در ۱۰۲۴ پیکسل را به ۲۵۶ واحد تصویری فشرده میکند و در صورت نیاز، بخشهای کوچکتری از تصویر را نیز بررسی میکند. بخش تولید متن نزدیک به سه میلیارد پارامتر دارد، اما برای ساخت هر واحد خروجی حدود ۵۷۰ میلیون پارامتر را به کار میگیرد. این اعداد مشخصات معماریاند؛ از آنها بهتنهایی نمیتوان میزان حافظه لازم یا سرعت اجرای همه اسناد را نتیجه گرفت.
خروجی مدل بسته به دستور میتواند متن با ترتیب خواندن طبیعی، Markdown، جدول HTML یا فرمول LaTeX باشد. این تفاوت برای کاربردهای واقعی تعیینکننده است. اگر خانههای جدول به ترتیب اشتباه خوانده شوند، یک گزارش مالی ممکن است عدد درست را کنار عنوان نادرست قرار دهد. خطا در نماد یک فرمول هم میتواند معنای آن را عوض کند. به همین دلیل، آزمودن مدل فقط با نمره کلی تشخیص متن کافی نیست؛ جدول، فرمول و ترتیب بخشها باید جداگانه ارزیابی شوند.
کارت مدل در Hugging Face شیوه اجرای آن با Transformers و vLLM را شرح میدهد و به یک سرویس میزبانیشده با رابط سازگار با OpenAI نیز اشاره میکند. نمونه اجرای Transformers از گزینه trust_remote_code=True استفاده میکند؛ یعنی بخشی از کد اختصاصی مخزن هنگام بارگذاری اجرا میشود. سازمانی که اطلاعات محرمانه پردازش میکند باید پیش از استفاده، این کد، وابستگیها و نسخه انتخابشده را بررسی و ثابت نگه دارد. وجود راهنمای اجرا به معنی تأیید امنیتی آن نیست.
دو برابر سریعتر، اما در کدام بخش؟
پژوهشگران از روش FastMTP استفاده کردهاند که چند واحد متن را از پیش پیشنهاد میکند و سپس خروجی را با مدل اصلی تطبیق میدهد. این روش در تنظیمات پژوهش، سه جایگاه بعدی را پیشبینی میکند. سازندگان میگویند نتیجه نهایی با خروجی روش معمولِ انتخاب قطعی کلمه بعدی یکسان میماند. منظور از این یکسانی، تفاوت نداشتن دو روش تولید متن است؛ نه اینکه تشخیص متن سند بدون خطا باشد.
در آزمایشهای اعلامشده، امتیاز مدل در OmniDocBench نسخه ۱٫۶ برابر ۹۱٫۱۴ و در olmOCR-Bench برابر ۸۳٫۴ بوده است. سرعت ثبتشده در شرایط مقایسه پژوهشگران ۲٫۵۷ صفحه در ثانیه است. آنها همچنین میگویند FastMTP روی پردازنده گرافیکی NVIDIA L4 سرعت مرحله تولید متن را نسبت به روش معمول تقریباً دو برابر میکند. این دو عدد یک چیز را اندازه نمیگیرند: دو برابر شدن سرعت تولید متن لزوماً به معنی نصف شدن زمان پردازش کامل فایل نیست.
خواندن تصویر، تفکیک صفحه، بزرگنمایی قسمتهای ریز، تعداد صفحههای پردازششده در هر نوبت و طول خروجی بر سرعت نهایی اثر میگذارند. روش آموزش تکمیلی مدل نیز از بررسیهای قابلمحاسبه برای درستی و ساختار جدولها و فرمولها استفاده میکند و به پاسخهای تا حدی درست هم امتیاز میدهد. دادههای آموزشی ترکیبی از منابع عمومی پالایششده و صفحههای مصنوعی هدفمند هستند. این طراحی قابل بررسی است، اما نتیجه آن برای دستخط، اسکن کمکیفیت یا فرمهای خاص هر شرکت هنوز باید جداگانه سنجیده شود.
هزینه واقعی را با صفحه قابلاستفاده بسنجید
از کنار هم گذاشتن جزئیات معماری و آزمونها میتوان به یک معیار عملی رسید: برای ارزیابی سامانه خواندن سند، شمار واحدهای متن تولیدشده در ثانیه بهتنهایی معیار خوبی نیست. ممکن است مدلی متن طولانیتری برای همان صفحه تولید کند و با وجود سرعت ظاهری بالا، دیرتر به خروجی قابلاستفاده برسد. تعداد صفحه در ثانیه مفیدتر است، اما هزینه اصلاح جدولهای خراب یا بازخوانی صفحههای ناموفق را در نظر نمیگیرد.
پیشنهاد تحلیلی Aipolix این است که تیم فنی مجموعهای نماینده از اسناد خود را با مجوز مناسب انتخاب کند و سه شاخص را همزمان بسنجد: چند درصد صفحهها به سطح کیفیت ازپیشتعیینشده میرسند، پردازش کامل همراه با تلاش مجدد چقدر طول میکشد و هزینه محاسباتی چقدر است. باید هزینه هر صفحه پذیرفتهشده را محاسبه کرد، نه فقط هزینه هر صفحهای که پردازش آن شروع شده است. برای جدولها رابطه سطر و ستون، برای فرمولها نمادها و برای متن ترتیب خواندن و بخشهای جاافتاده اهمیت دارد.
این مسئله در سامانههای بازیابی اطلاعات جدیتر میشود. اگر یک عدد به خانه اشتباه جدول نسبت داده شود، آن اشتباه ممکن است وارد فهرست جستوجو شود و بعد در پاسخ هوش مصنوعی با ظاهری مستند تکرار شود. این پیامد، تحلیل فنی Aipolix از زنجیره استخراج و بازیابی است؛ سازندگان درباره کیفیت پاسخهای نهایی تمام سامانههای متصل تضمینی ارائه نکردهاند. نگهداری تصویر صفحه و ارتباط هر بخش استخراجشده با منبع اصلی، راه بررسی خطاهای احتمالی را باز میگذارد.
دانلود مدل با مجوز استفاده آزاد تجاری یکی نیست
کارت رسمی مدل برای وزنها مجوز CC BY-NC 4.0 را درج کرده و برای استفاده تجاری درخواست تماس میکند. بنابراین نباید آن را مدلی با مجوز تجاری آزاد معرفی کرد. سازمانها باید پیش از بهکارگیری وزنها در محصول پولی یا فرایند تجاری، شرایط مجوز مناسب را روشن کنند. دسترسی به رابط میزبانیشده نیز بهخودیخود حق اجرای تجاری وزنهای دانلودشده را ایجاد نمیکند؛ قرارداد سرویس و مجوز استقرار شخصی دو موضوع جدا هستند.
مدل برای انواع سند و زبانهای مختلف معرفی شده، اما کارایی آن روی نسخههای اسکنشده هر سازمان باید با نمونههای واقعی و پاسخ مرجع بررسی شود. متن چاپی، یادداشت دستنویس، پانوشت ریز و جدول متراکم ممکن است خطاهای متفاوتی داشته باشند. Jina-OCR-v1 امکان آزمایش یک روش تازه برای سریعتر کردن پردازش سند را فراهم کرده است، اما تصمیم استقرار باید بر کیفیت تأییدشده خروجی، هزینه کامل، بازبینی امنیت کد و مجوز درست تکیه کند؛ نه صرفاً یک عدد جذاب در جدول ارزیابی.