Open source
FreeToken exécute des modèles MoE géants sur des GPU grand public
FreeToken combine exécution CPU-GPU adaptative et cache sémantique pour servir des modèles MoE de 35B à 753B sur du matériel local.
FreeToken combine exécution CPU-GPU adaptative et cache sémantique pour servir des modèles MoE de 35B à 753B sur du matériel local.