Fermion Research مدل Phonon-1 را منتشر کرده است؛ یک مدل Automatic Speech Recognition انگلیسی که برای اجرای محلی روی لپ‌تاپ و همچنین GPUهای NVIDIA در دیتاسنتر طراحی شده است. نسخه پیش‌فرض این مدل ۴۱۵ مگابایت حجم دارد، تحت مجوز Apache 2.0 منتشر شده و از طریق ابزارهای خط فرمان Fermion یا یک endpoint سازگار با API تبدیل گفتار به متن OpenAI قابل استفاده است.

اهمیت این release در تلاش برای پر کردن فاصله میان مدل‌های بسیار کوچک محلی و سیستم‌های بزرگ‌تر transcription است که به storage و compute بیشتری نیاز دارند. Fermion می‌گوید Phonon-1 را بر پایه Qwen3-ASR-0.6B و با روش low-bit training آموزش داده، نه اینکه پس از پایان آموزش صرفاً quantization معمول را روی مدل اعمال کند. Model card رسمی در Hugging Face نیز مدل را برای speech-to-text انگلیسی، Apple Silicon و اجرای low-bit روی دستگاه معرفی می‌کند.

مدل ۴۱۵ مگابایتی با آموزش low-bit

Fermion توضیح می‌دهد که decoder مدل از ابتدا با میانگین ۲.۴ بیت برای هر weight آموزش داده شده است. طبق توضیح شرکت، artifact کامل به طور متوسط ۴.۶۵ بیت برای هر parameter دارد و decoder کم‌بیت با پنج state آموخته‌شده نمایش داده می‌شود. هدف این روش حفظ بخش بیشتری از دقت teacher model نسبت به تبدیل کم‌بیت پس از پایان training است.

نسخه اصلی Phonon-1 حجمی برابر با ۴۱۵ مگابایت دارد. Fermion همچنین Phonon-1 Micro با حجم ۲۸۵ مگابایت و یک نسخه بزرگ‌تر با نام Big ارائه کرده است. نسخه اصلی برای developerها مهم‌تر است، چون شرکت آن را نقطه تعادل میان size، accuracy و latency معرفی می‌کند.

وزن‌ها و command-line tooling تحت Apache 2.0 عرضه شده‌اند. Fermion می‌گوید مدل پایه Qwen3-ASR-0.6B نیز Apache 2.0 است. این موضوع ارزیابی مدل برای workloadهای داخلی و تجاری را نسبت به licenseهای اختصاصی و محدودتر ساده‌تر می‌کند، هرچند هر سازمان باید بررسی حقوقی و compliance خود را انجام دهد.

benchmarkها دقیقاً چه می‌گویند

Fermion در ارزیابی منتشرشده برای نسخه ۴۱۵ مگابایتی WER برابر با ۲.۶۴۰ درصد روی LibriSpeech test-clean و ۵.۶۹۹ درصد روی test-other گزارش کرده است. نتایج TED-LIUM، SPGISpeech، VoxPopuli، GigaSpeech، Earnings-22 و AMI نیز منتشر شده و macro WER روی هشت benchmark برابر با ۷.۶۷ اعلام شده است.

این اعداد امیدوارکننده‌اند، اما باید با دقت تفسیر شوند. Fermion صریحاً مشخص کرده که بخش عمده سلول‌های مقایسه توسط تیم خودش و با full test sets، normalizer انگلیسی Whisper و greedy decoding اندازه‌گیری شده‌اند. بعضی اعداد مدل‌های رقیب از model card یا leaderboard آمده‌اند، اما تعداد زیادی از آن‌ها دوباره توسط Fermion سنجیده شده‌اند.

شرکت همچنین می‌گوید در پنج benchmark دنیای واقعی نتوانسته مدل downloadable دیگری پیدا کند که هم کوچک‌تر و هم دقیق‌تر از Phonon-1 باشد. این یک claim از سوی vendor و وابسته به مجموعه مدل‌ها و protocol انتخاب‌شده است، نه یک نتیجه مستقل و قطعی. خود صفحه نیز نشان می‌دهد Parakeet-0.6B 4-bit از NVIDIA روی هر هشت benchmark جدول Fermion دقت بیشتری دارد، اما حجم download آن بزرگ‌تر است.

اجرای محلی بخشی از release است

Phonon-1 فقط یک model card نیست. پکیج fermion-research در PyPI دستور `fermion transcribe` را برای فایل‌های صوتی و `fermion serve` را برای راه‌اندازی endpoint سازگار با `/v1/audio/transcriptions` ارائه می‌کند. بنابراین applicationهایی که از الگوی client مشابه OpenAI برای transcription استفاده می‌کنند، می‌توانند به جای بازنویسی integration، endpoint را به یک server محلی تغییر دهند.

Fermion می‌گوید همان weights از طریق MLX روی Apple Silicon و از طریق runtime شرکت روی GPUهای NVIDIA اجرا می‌شوند. شرکت median سرعت decoding برابر با 23.9 برابر realtime را روی نه corpus و یک MacBook Air پایه با M5 گزارش کرده است. در این نرخ، transcription یک ساعت صدا تقریباً دو و نیم دقیقه طول می‌کشد. Fermion همچنین برای live dictation latency در محدوده چند صد میلی‌ثانیه گزارش می‌کند.

این اعداد سرعت نیز اندازه‌گیری‌های خود Fermion هستند. throughput واقعی به طول صدا، batching، سخت‌افزار، فشار حافظه، نسخه runtime و ویژگی‌های input بستگی خواهد داشت.

چه جاهایی باید محتاط بود

محدودیت اصلی روشن است: Phonon-1 یک مدل ASR متمرکز بر زبان انگلیسی و audio با نرخ ۱۶ کیلوهرتز است. سازمان‌های چندزبانه به مدل دیگری یا یک routing strategy نیاز دارند. تیم‌هایی که با جلسه‌های پرنویز، accentهای متفاوت، telephony، واژگان تخصصی یا audioهای domain-specific سروکار دارند نیز نباید نتیجه LibriSpeech یا macro benchmark را مستقیماً به workload خود تعمیم دهند.

برای مهم‌ترین ادعاهای performance هنوز بازتولید مستقل گسترده‌ای پیدا نمی‌شود. Hugging Face و PyPI availability مدل و tooling را تأیید می‌کنند، اما هر دو surface انتشار متعلق به خود Fermion هستند و evaluator مستقل محسوب نمی‌شوند.

برای developerها این موضوع release را بی‌اهمیت نمی‌کند؛ فقط next step درست را مشخص می‌کند. Phonon-1 به اندازه کافی concrete است که همین حالا benchmark شود. ارزیابی مفید باید WER، کیفیت punctuation، رفتار streaming، memory usage و end-to-end latency را روی recordingها و سخت‌افزار واقعی سازمان مقایسه کند.

اگر نتایج در workload واقعی نیز حفظ شوند، ترکیب حجم ۴۱۵ مگابایت، license آزاد، اجرای local و API سازگار با OpenAI می‌تواند Phonon-1 را به یک speech layer عملی برای ابزارهای desktop، سیستم‌های transcription خصوصی و applicationهای local-first AI تبدیل کند. benchmark جدول دلیل خوبی برای تست است، نه جایگزین تست.

Sources
- Introducing Phonon-1
- FermionResearch/Phonon-1
- fermion-research on PyPI