متن‌باز

FreeToken در roadmap جدید سراغ AMD، Apple Silicon و multi-GPU می‌رود

FreeToken با اجرای مدل‌های بسیار بزرگ Mixture-of-Experts روی سخت‌افزار مصرفی و workstation شناخته شد، اما چالش بعدی پروژه فقط جا دادن مدل‌های بزرگ‌تر در VRAM محدود نیست. تیم پروژه حالا roadmap سال ۲۰۲۶ را منتشر کرده که هدفش عبور از runtime فعلی متمرکز بر NVIDIA و تبدیل FreeToken به یک پلتفرم local AI با پشتیبانی سخت‌افزاری متنوع‌تر است.

در roadmap رسمی که ۲۳ اوت منتشر شده، پشتیبانی native از Apple Silicon با Metal، پشتیبانی GPUهای AMD از طریق ROCm و پشتیبانی DGX Spark با wheelهای aarch64، kernelهای sm_121 و unified-memory mode قرار گرفته است.

این roadmap همچنین image input برای خانواده‌های Qwen3.5، Qwen3.6، Qwen3.8 و Gemma-4، tensor parallelism روی چند GPU، پشتیبانی گسترده‌تر GGUF و speculative decoding شامل MTP، DFlash و Dspark را هدف گرفته است.

پشتیبانی رسمی فعلاً همچنان NVIDIA است

اهمیت roadmap دقیقاً از اینجا مشخص می‌شود که وضعیت فعلی هنوز محدودتر است.

FAQ رسمی maintainerها می‌گوید پشتیبانی فعلی برای x86_64 و GPUهای NVIDIA از نسل Ampere به بعد است؛ یعنی عملاً RTX 30 و نسل‌های جدیدتر، با driver r580+ و CUDA 13. Windows و Linux از طریق FreeToken Desktop پشتیبانی می‌شوند و نسخه Python روی Linux ارائه می‌شود.

راهنمای نصب هم همین contract را صریح می‌کند: Linux x86_64، GPU انویدیا و CUDA 13.

بنابراین AMD، macOS و DGX Spark هنوز قابلیت‌های منتشرشده رسمی نیستند. اینها roadmap هستند.

این تفاوت مهم است، چون خود roadmap هم صراحتاً work in progress معرفی شده و نباید آن را با announcement یک release آماده اشتباه گرفت.

community مسیر AMD را زودتر آزمایش کرده است

بخش جالب‌تر این است که هدف AMD فقط روی کاغذ نمانده است.

یکی از contributorها یک port برای Windows 11 و ROCm منتشر کرده که FreeToken را بدون toolchain انویدیا روی AMD RX 9070 XT اجرا می‌کند. طبق گزارش او، model loading، prefill، decode، SSE streaming و web UI روی fork کار کرده و Qwen2.5-3B در BF16 حدود ۵۷ token/s ثبت کرده است.

اما این پشتیبانی رسمی FreeToken نیست. همان گزارش می‌گوید MoE expert offload هنوز به‌طور کامل آزمایش نشده و چند مسیر GGUF و quantization ناقص بوده‌اند.

گزارش community دیگری روی RX 9060 XT یک قدم جلوتر رفته است. contributor می‌گوید packed-GGUF را برای مسیرهای dense و MoE end-to-end اجرا کرده و هم‌زمان چند مشکل low-level در host memory و device pointer را که باعث crash در RDNA4 offload decode می‌شدند شناسایی کرده است.

این گزارش‌ها نشان می‌دهند حداقل بخشی از معماری CUDA-centric FreeToken قابلیت انتقال به ROCm را دارد. اما هنوز ثابت نمی‌کنند پشتیبانی AMD production-ready یا نزدیک به release رسمی است.

چرا این roadmap مهم است

ایده اصلی FreeToken استفاده هم‌زمان از GPU memory، RAM، CPU و پهنای‌باند interconnect است، به‌جای اینکه VRAM یک مرز سخت برای اجرای مدل باشد.

اگر این معماری روی vendorهای مختلف GPU قابل استفاده شود، اهمیت آن بیشتر می‌شود.

امروز local AI به‌شدت fragmented است. NVIDIA قوی‌ترین software ecosystem را دارد، اما تعداد بیشتری از توسعه‌دهندگان می‌خواهند مدل‌ها را روی desktopهای AMD، سیستم‌های Apple Silicon و دستگاه‌های unified-memory اجرا کنند بدون اینکه برای هر سخت‌افزار serving stack جداگانه بسازند.

اگر FreeToken بتواند مدل serving یکسانی را روی CUDA، ROCm و Metal حفظ کند، جایگاهش تغییر می‌کند. دیگر فقط یک MoE runtime تخصصی برای RTX نیست و می‌تواند به یک portability layer برای مدل‌های بزرگ local تبدیل شود.

برنامه multi-GPU همین جهت را تقویت می‌کند. Tensor parallelism اجازه می‌دهد یک مدل بین چند GPU در یک workstation تقسیم شود و پشتیبانی DGX Spark نیز پروژه را به سمت سیستم‌های compact AI متصل‌شده می‌برد.

multimodal و speculative decoding دامنه پروژه را بزرگ‌تر می‌کنند

Roadmap فقط سخت‌افزار نیست.

پشتیبانی image input برای مدل‌های vision-language از خانواده Qwen و Gemma می‌تواند FreeToken را از agentهای text-only فراتر ببرد. پشتیبانی گسترده‌تر GGUF هم استفاده از ecosystem بزرگ checkpointهای community-quantized را ساده‌تر می‌کند.

Speculative decoding نیز برای agentهای تعاملی اهمیت دارد. روش‌هایی مثل MTP و DFlash تلاش می‌کنند latency مرحله decode را با پیش‌بینی چند token یا sequence draft کاهش دهند. این قابلیت می‌تواند مکمل تمرکز فعلی FreeToken روی memory movement و bandwidth باشد.

مجموع این موارد نشان می‌دهد maintainers در حال تلاش برای تبدیل FreeToken از یک research implementation به یک local serving platform گسترده‌تر هستند.

بعد از این باید چه چیزی را دنبال کرد

Roadmap آن‌قدر بلندپروازانه است که execution مهم‌تر از فهرست قابلیت‌هاست.

اولین milestone مهم، پشتیبانی رسمی AMD خواهد بود. Community forkها نشان داده‌اند RDNA4 قابل bring-up است، اما upstream integration، packaging، پوشش kernelها، reliability در MoE offload و performance قابل تکرار مسائل جداگانه‌ای هستند.

Apple Silicon شاید حتی مهم‌تر باشد. Metal backend native می‌تواند FreeToken را روی سیستم‌هایی با unified memory بالا باز کند که برای مدل‌های oversized جذاب‌اند.

Tensor parallelism روی چند GPU هم آزمون بزرگی است، چون FreeToken را از runtime تک‌GPU به‌همراه RAM به یک سیستم local distributed serving نزدیک می‌کند.

فعلاً خبر اصلی این نیست که FreeToken ناگهان همه سخت‌افزارها را پشتیبانی می‌کند. چنین چیزی هنوز درست نیست. نکته مهم این است که پروژه رسماً مسیر عبور از launch انحصاری NVIDIA را مشخص کرده و community هم شروع به اثبات بخش‌هایی از این مسیر روی AMD کرده است.

منابع
- FreeToken Roadmap (2026)
- FreeToken FAQ
- FreeToken installation requirements
- Community Windows/ROCm RDNA4 port
- Community RX 9060 XT GGUF and MoE bring-up

تاریخ انتشار: