Fermion Research مدل Phonon-1 را منتشر کرده است؛ یک مدل Automatic Speech Recognition انگلیسی که برای اجرای محلی روی لپتاپ و همچنین GPUهای NVIDIA در دیتاسنتر طراحی شده است. نسخه پیشفرض این مدل ۴۱۵ مگابایت حجم دارد، تحت مجوز Apache 2.0 منتشر شده و از طریق ابزارهای خط فرمان Fermion یا یک endpoint سازگار با API تبدیل گفتار به متن OpenAI قابل استفاده است.
اهمیت این release در تلاش برای پر کردن فاصله میان مدلهای بسیار کوچک محلی و سیستمهای بزرگتر transcription است که به storage و compute بیشتری نیاز دارند. Fermion میگوید Phonon-1 را بر پایه Qwen3-ASR-0.6B و با روش low-bit training آموزش داده، نه اینکه پس از پایان آموزش صرفاً quantization معمول را روی مدل اعمال کند. Model card رسمی در Hugging Face نیز مدل را برای speech-to-text انگلیسی، Apple Silicon و اجرای low-bit روی دستگاه معرفی میکند.
مدل ۴۱۵ مگابایتی با آموزش low-bit
Fermion توضیح میدهد که decoder مدل از ابتدا با میانگین ۲.۴ بیت برای هر weight آموزش داده شده است. طبق توضیح شرکت، artifact کامل به طور متوسط ۴.۶۵ بیت برای هر parameter دارد و decoder کمبیت با پنج state آموختهشده نمایش داده میشود. هدف این روش حفظ بخش بیشتری از دقت teacher model نسبت به تبدیل کمبیت پس از پایان training است.
نسخه اصلی Phonon-1 حجمی برابر با ۴۱۵ مگابایت دارد. Fermion همچنین Phonon-1 Micro با حجم ۲۸۵ مگابایت و یک نسخه بزرگتر با نام Big ارائه کرده است. نسخه اصلی برای developerها مهمتر است، چون شرکت آن را نقطه تعادل میان size، accuracy و latency معرفی میکند.
وزنها و command-line tooling تحت Apache 2.0 عرضه شدهاند. Fermion میگوید مدل پایه Qwen3-ASR-0.6B نیز Apache 2.0 است. این موضوع ارزیابی مدل برای workloadهای داخلی و تجاری را نسبت به licenseهای اختصاصی و محدودتر سادهتر میکند، هرچند هر سازمان باید بررسی حقوقی و compliance خود را انجام دهد.
benchmarkها دقیقاً چه میگویند
Fermion در ارزیابی منتشرشده برای نسخه ۴۱۵ مگابایتی WER برابر با ۲.۶۴۰ درصد روی LibriSpeech test-clean و ۵.۶۹۹ درصد روی test-other گزارش کرده است. نتایج TED-LIUM، SPGISpeech، VoxPopuli، GigaSpeech، Earnings-22 و AMI نیز منتشر شده و macro WER روی هشت benchmark برابر با ۷.۶۷ اعلام شده است.
این اعداد امیدوارکنندهاند، اما باید با دقت تفسیر شوند. Fermion صریحاً مشخص کرده که بخش عمده سلولهای مقایسه توسط تیم خودش و با full test sets، normalizer انگلیسی Whisper و greedy decoding اندازهگیری شدهاند. بعضی اعداد مدلهای رقیب از model card یا leaderboard آمدهاند، اما تعداد زیادی از آنها دوباره توسط Fermion سنجیده شدهاند.
شرکت همچنین میگوید در پنج benchmark دنیای واقعی نتوانسته مدل downloadable دیگری پیدا کند که هم کوچکتر و هم دقیقتر از Phonon-1 باشد. این یک claim از سوی vendor و وابسته به مجموعه مدلها و protocol انتخابشده است، نه یک نتیجه مستقل و قطعی. خود صفحه نیز نشان میدهد Parakeet-0.6B 4-bit از NVIDIA روی هر هشت benchmark جدول Fermion دقت بیشتری دارد، اما حجم download آن بزرگتر است.
اجرای محلی بخشی از release است
Phonon-1 فقط یک model card نیست. پکیج fermion-research در PyPI دستور `fermion transcribe` را برای فایلهای صوتی و `fermion serve` را برای راهاندازی endpoint سازگار با `/v1/audio/transcriptions` ارائه میکند. بنابراین applicationهایی که از الگوی client مشابه OpenAI برای transcription استفاده میکنند، میتوانند به جای بازنویسی integration، endpoint را به یک server محلی تغییر دهند.
Fermion میگوید همان weights از طریق MLX روی Apple Silicon و از طریق runtime شرکت روی GPUهای NVIDIA اجرا میشوند. شرکت median سرعت decoding برابر با 23.9 برابر realtime را روی نه corpus و یک MacBook Air پایه با M5 گزارش کرده است. در این نرخ، transcription یک ساعت صدا تقریباً دو و نیم دقیقه طول میکشد. Fermion همچنین برای live dictation latency در محدوده چند صد میلیثانیه گزارش میکند.
این اعداد سرعت نیز اندازهگیریهای خود Fermion هستند. throughput واقعی به طول صدا، batching، سختافزار، فشار حافظه، نسخه runtime و ویژگیهای input بستگی خواهد داشت.
چه جاهایی باید محتاط بود
محدودیت اصلی روشن است: Phonon-1 یک مدل ASR متمرکز بر زبان انگلیسی و audio با نرخ ۱۶ کیلوهرتز است. سازمانهای چندزبانه به مدل دیگری یا یک routing strategy نیاز دارند. تیمهایی که با جلسههای پرنویز، accentهای متفاوت، telephony، واژگان تخصصی یا audioهای domain-specific سروکار دارند نیز نباید نتیجه LibriSpeech یا macro benchmark را مستقیماً به workload خود تعمیم دهند.
برای مهمترین ادعاهای performance هنوز بازتولید مستقل گستردهای پیدا نمیشود. Hugging Face و PyPI availability مدل و tooling را تأیید میکنند، اما هر دو surface انتشار متعلق به خود Fermion هستند و evaluator مستقل محسوب نمیشوند.
برای developerها این موضوع release را بیاهمیت نمیکند؛ فقط next step درست را مشخص میکند. Phonon-1 به اندازه کافی concrete است که همین حالا benchmark شود. ارزیابی مفید باید WER، کیفیت punctuation، رفتار streaming، memory usage و end-to-end latency را روی recordingها و سختافزار واقعی سازمان مقایسه کند.
اگر نتایج در workload واقعی نیز حفظ شوند، ترکیب حجم ۴۱۵ مگابایت، license آزاد، اجرای local و API سازگار با OpenAI میتواند Phonon-1 را به یک speech layer عملی برای ابزارهای desktop، سیستمهای transcription خصوصی و applicationهای local-first AI تبدیل کند. benchmark جدول دلیل خوبی برای تست است، نه جایگزین تست.