FreeToken در roadmap جدید سراغ AMD، Apple Silicon و multi-GPU میرود
FreeToken با اجرای مدلهای بسیار بزرگ Mixture-of-Experts روی سختافزار مصرفی و workstation شناخته شد، اما چالش بعدی پروژه فقط جا دادن مدلهای بزرگتر در VRAM محدود نیست. تیم پروژه حالا roadmap سال ۲۰۲۶ را منتشر کرده که هدفش عبور از runtime فعلی متمرکز بر NVIDIA و تبدیل FreeToken به یک پلتفرم local AI با پشتیبانی سختافزاری متنوعتر است.
در roadmap رسمی که ۲۳ اوت منتشر شده، پشتیبانی native از Apple Silicon با Metal، پشتیبانی GPUهای AMD از طریق ROCm و پشتیبانی DGX Spark با wheelهای aarch64، kernelهای sm_121 و unified-memory mode قرار گرفته است.
این roadmap همچنین image input برای خانوادههای Qwen3.5، Qwen3.6، Qwen3.8 و Gemma-4، tensor parallelism روی چند GPU، پشتیبانی گستردهتر GGUF و speculative decoding شامل MTP، DFlash و Dspark را هدف گرفته است.
پشتیبانی رسمی فعلاً همچنان NVIDIA است
اهمیت roadmap دقیقاً از اینجا مشخص میشود که وضعیت فعلی هنوز محدودتر است.
FAQ رسمی maintainerها میگوید پشتیبانی فعلی برای x86_64 و GPUهای NVIDIA از نسل Ampere به بعد است؛ یعنی عملاً RTX 30 و نسلهای جدیدتر، با driver r580+ و CUDA 13. Windows و Linux از طریق FreeToken Desktop پشتیبانی میشوند و نسخه Python روی Linux ارائه میشود.
راهنمای نصب هم همین contract را صریح میکند: Linux x86_64، GPU انویدیا و CUDA 13.
بنابراین AMD، macOS و DGX Spark هنوز قابلیتهای منتشرشده رسمی نیستند. اینها roadmap هستند.
این تفاوت مهم است، چون خود roadmap هم صراحتاً work in progress معرفی شده و نباید آن را با announcement یک release آماده اشتباه گرفت.
community مسیر AMD را زودتر آزمایش کرده است
بخش جالبتر این است که هدف AMD فقط روی کاغذ نمانده است.
یکی از contributorها یک port برای Windows 11 و ROCm منتشر کرده که FreeToken را بدون toolchain انویدیا روی AMD RX 9070 XT اجرا میکند. طبق گزارش او، model loading، prefill، decode، SSE streaming و web UI روی fork کار کرده و Qwen2.5-3B در BF16 حدود ۵۷ token/s ثبت کرده است.
اما این پشتیبانی رسمی FreeToken نیست. همان گزارش میگوید MoE expert offload هنوز بهطور کامل آزمایش نشده و چند مسیر GGUF و quantization ناقص بودهاند.
گزارش community دیگری روی RX 9060 XT یک قدم جلوتر رفته است. contributor میگوید packed-GGUF را برای مسیرهای dense و MoE end-to-end اجرا کرده و همزمان چند مشکل low-level در host memory و device pointer را که باعث crash در RDNA4 offload decode میشدند شناسایی کرده است.
این گزارشها نشان میدهند حداقل بخشی از معماری CUDA-centric FreeToken قابلیت انتقال به ROCm را دارد. اما هنوز ثابت نمیکنند پشتیبانی AMD production-ready یا نزدیک به release رسمی است.
چرا این roadmap مهم است
ایده اصلی FreeToken استفاده همزمان از GPU memory، RAM، CPU و پهنایباند interconnect است، بهجای اینکه VRAM یک مرز سخت برای اجرای مدل باشد.
اگر این معماری روی vendorهای مختلف GPU قابل استفاده شود، اهمیت آن بیشتر میشود.
امروز local AI بهشدت fragmented است. NVIDIA قویترین software ecosystem را دارد، اما تعداد بیشتری از توسعهدهندگان میخواهند مدلها را روی desktopهای AMD، سیستمهای Apple Silicon و دستگاههای unified-memory اجرا کنند بدون اینکه برای هر سختافزار serving stack جداگانه بسازند.
اگر FreeToken بتواند مدل serving یکسانی را روی CUDA، ROCm و Metal حفظ کند، جایگاهش تغییر میکند. دیگر فقط یک MoE runtime تخصصی برای RTX نیست و میتواند به یک portability layer برای مدلهای بزرگ local تبدیل شود.
برنامه multi-GPU همین جهت را تقویت میکند. Tensor parallelism اجازه میدهد یک مدل بین چند GPU در یک workstation تقسیم شود و پشتیبانی DGX Spark نیز پروژه را به سمت سیستمهای compact AI متصلشده میبرد.
multimodal و speculative decoding دامنه پروژه را بزرگتر میکنند
Roadmap فقط سختافزار نیست.
پشتیبانی image input برای مدلهای vision-language از خانواده Qwen و Gemma میتواند FreeToken را از agentهای text-only فراتر ببرد. پشتیبانی گستردهتر GGUF هم استفاده از ecosystem بزرگ checkpointهای community-quantized را سادهتر میکند.
Speculative decoding نیز برای agentهای تعاملی اهمیت دارد. روشهایی مثل MTP و DFlash تلاش میکنند latency مرحله decode را با پیشبینی چند token یا sequence draft کاهش دهند. این قابلیت میتواند مکمل تمرکز فعلی FreeToken روی memory movement و bandwidth باشد.
مجموع این موارد نشان میدهد maintainers در حال تلاش برای تبدیل FreeToken از یک research implementation به یک local serving platform گستردهتر هستند.
بعد از این باید چه چیزی را دنبال کرد
Roadmap آنقدر بلندپروازانه است که execution مهمتر از فهرست قابلیتهاست.
اولین milestone مهم، پشتیبانی رسمی AMD خواهد بود. Community forkها نشان دادهاند RDNA4 قابل bring-up است، اما upstream integration، packaging، پوشش kernelها، reliability در MoE offload و performance قابل تکرار مسائل جداگانهای هستند.
Apple Silicon شاید حتی مهمتر باشد. Metal backend native میتواند FreeToken را روی سیستمهایی با unified memory بالا باز کند که برای مدلهای oversized جذاباند.
Tensor parallelism روی چند GPU هم آزمون بزرگی است، چون FreeToken را از runtime تکGPU بههمراه RAM به یک سیستم local distributed serving نزدیک میکند.
فعلاً خبر اصلی این نیست که FreeToken ناگهان همه سختافزارها را پشتیبانی میکند. چنین چیزی هنوز درست نیست. نکته مهم این است که پروژه رسماً مسیر عبور از launch انحصاری NVIDIA را مشخص کرده و community هم شروع به اثبات بخشهایی از این مسیر روی AMD کرده است.
منابع
- FreeToken Roadmap (2026)
- FreeToken FAQ
- FreeToken installation requirements
- Community Windows/ROCm RDNA4 port
- Community RX 9060 XT GGUF and MoE bring-up
تاریخ انتشار: