Technology Innovation Institute مدل Falcon-ASR را عرضه کرده است؛ یک سامانه تشخیص خودکار گفتار با ۱.۶ میلیارد پارامتر که تمرکز ویژه‌ای بر عربی اماراتی دارد. این مدل عربی معیار مدرن و دیگر گونه‌های عربی را نیز پوشش می‌دهد و در کنار آن از انگلیسی، فرانسوی، اسپانیایی و پرتغالی پشتیبانی می‌کند. مطلب فنی در ۷ اکتبر روی Hugging Face منتشر شد، یک روز پس از آنکه TII این مدل را همراه Falcon-Emirati و Falcon-OCR-Arabic معرفی کرد. در حال حاضر دموی عمومی وجود دارد و API و برنامه‌های بومی برای آینده برنامه‌ریزی شده‌اند.

TII می‌گوید در آموزش مدل شرایطی مانند نویز پس‌زمینه، هم‌پوشانی صدای گویندگان، موسیقی، پژواک اتاق، کیفیت تماس تلفنی و تغییر سرعت و زیر و بمی صدا را لحاظ کرده است. همه زبان‌های پشتیبانی‌شده با همان وزن‌های مدل کار می‌کنند و نیازی به تعیین زبان از قبل نیست. Falcon-ASR همچنین برای هر کلمه timestamp تولید می‌کند که برای زیرنویس، جست‌وجو در فایل صوتی و پیاده‌سازی جلسه کاربرد دارد.

در شش مجموعه آزمون عربی بر اساس پروتکل Open Universal Arabic ASR Leaderboard، TII میانگین WER برابر ۲۰.۹۲ درصد و CER برابر ۸.۷۹ درصد گزارش کرده است. بهترین نتیجه منتشرشده در snapshot مورد استفاده TII، WER برابر ۲۳.۱۷ درصد بوده است. در آزمون داخلی گفتار اماراتی نیز TII عدد ۲۲.۷۳ درصد را گزارش می‌کند که از سامانه‌های مقایسه‌شده بهتر است. این نتیجه دوم باید با احتیاط بیشتری خوانده شود، زیرا benchmark داخلی خود TII است.

TII برای هفت آزمون عمومی انگلیسی نیز میانگین WER برابر ۵.۷۴ درصد اعلام کرده است. اهمیت مدل بیشتر در تمرکز آن بر گفتار محاوره‌ای و منطقه‌ای عربی است که نسبت به عربی معیار داده برچسب‌خورده کمتری دارد. RuntimeWire عرضه مدل را به‌طور مستقل گزارش کرده و تفاوت میان benchmark عمومی و آزمون داخلی را نیز برجسته کرده است. برای قضاوت درباره عملکرد واقعی هنوز به آزمایش مستقل روی گویندگان، لهجه‌ها و شرایط ضبط متنوع نیاز است.

منابع