Perplexity دو مدل pplx-embed-v2-late-0.6b و pplx-embed-v2-late-9b را منتشر کرده است. برخلاف embeddingهای dense که کل ورودی را به یک بردار تبدیل می‌کنند، این مدل‌ها برای هر token یک بردار ۱۲۸بعدی نگه می‌دارند و با MaxSim بخش‌های مختلف query را با بخش‌های مختلف سند تطبیق می‌دهند.

مدل‌ها می‌توانند مستقیماً صفحات رندرشده PDF، اسلاید، screenshot، نمودار و جدول را جست‌وجو کنند و وابستگی به OCR را کاهش دهند. ویژگی مهم‌تر این است که هر دو مدل در یک فضای embedding مشترک کار می‌کنند؛ بنابراین می‌توان اسناد را با مدل ۹B index کرد و queryهای زنده را با مدل سبک‌تر ۰.۶B اجرا کرد.

Perplexity برای این حالت نامتقارن روی ViDoRe V3 امتیاز ۶۳.۵ درصد nDCG@10 را در برابر ۶۲.۳ درصد برای حالت کاملاً ۰.۶B گزارش کرده است. این نتایج توسط خود Perplexity اندازه‌گیری شده‌اند و هنوز نیاز به ارزیابی مستقل دارند. هر دو checkpoint روی Hugging Face منتشر شده‌اند.

منابع