Technology Innovation Institute مدل Falcon-ASR را عرضه کرده است؛ یک سامانه تشخیص خودکار گفتار با ۱.۶ میلیارد پارامتر که تمرکز ویژهای بر عربی اماراتی دارد. این مدل عربی معیار مدرن و دیگر گونههای عربی را نیز پوشش میدهد و در کنار آن از انگلیسی، فرانسوی، اسپانیایی و پرتغالی پشتیبانی میکند. مطلب فنی در ۷ اکتبر روی Hugging Face منتشر شد، یک روز پس از آنکه TII این مدل را همراه Falcon-Emirati و Falcon-OCR-Arabic معرفی کرد. در حال حاضر دموی عمومی وجود دارد و API و برنامههای بومی برای آینده برنامهریزی شدهاند.
TII میگوید در آموزش مدل شرایطی مانند نویز پسزمینه، همپوشانی صدای گویندگان، موسیقی، پژواک اتاق، کیفیت تماس تلفنی و تغییر سرعت و زیر و بمی صدا را لحاظ کرده است. همه زبانهای پشتیبانیشده با همان وزنهای مدل کار میکنند و نیازی به تعیین زبان از قبل نیست. Falcon-ASR همچنین برای هر کلمه timestamp تولید میکند که برای زیرنویس، جستوجو در فایل صوتی و پیادهسازی جلسه کاربرد دارد.
در شش مجموعه آزمون عربی بر اساس پروتکل Open Universal Arabic ASR Leaderboard، TII میانگین WER برابر ۲۰.۹۲ درصد و CER برابر ۸.۷۹ درصد گزارش کرده است. بهترین نتیجه منتشرشده در snapshot مورد استفاده TII، WER برابر ۲۳.۱۷ درصد بوده است. در آزمون داخلی گفتار اماراتی نیز TII عدد ۲۲.۷۳ درصد را گزارش میکند که از سامانههای مقایسهشده بهتر است. این نتیجه دوم باید با احتیاط بیشتری خوانده شود، زیرا benchmark داخلی خود TII است.
TII برای هفت آزمون عمومی انگلیسی نیز میانگین WER برابر ۵.۷۴ درصد اعلام کرده است. اهمیت مدل بیشتر در تمرکز آن بر گفتار محاورهای و منطقهای عربی است که نسبت به عربی معیار داده برچسبخورده کمتری دارد. RuntimeWire عرضه مدل را بهطور مستقل گزارش کرده و تفاوت میان benchmark عمومی و آزمون داخلی را نیز برجسته کرده است. برای قضاوت درباره عملکرد واقعی هنوز به آزمایش مستقل روی گویندگان، لهجهها و شرایط ضبط متنوع نیاز است.