Together AI annonce une extension de sa capacité d'inférence grâce à un cluster dédié de GPU NVIDIA B300 hébergé sur IBM Cloud et relié par NVIDIA Spectrum-X Ethernet. Together AI exploitera la couche d'inférence, IBM fournira l'infrastructure cloud et NVIDIA les accélérateurs ainsi que la technologie réseau.

Cette annonce prolonge un accord présenté par IBM en août. IBM avait alors décrit un engagement pluriannuel de 240 millions de dollars avec Together AI pour déployer un cluster à grande échelle basé sur des systèmes NVIDIA HGX B300 et Spectrum-X, avec une disponibilité attendue au premier trimestre 2027.

L'architecture illustre la spécialisation croissante de l'infrastructure d'inférence. Servir des modèles à grande échelle impose un débit élevé, une faible latence, une fiabilité prévisible et un réseau capable d'alimenter efficacement les accélérateurs. Together AI apporte la plateforme de service des modèles, au-dessus de l'infrastructure IBM et du matériel NVIDIA.

Together AI affirme traiter des centaines de milliers de milliards de tokens par mois pour plus d'un million de développeurs. Ces chiffres n'ont pas été vérifiés indépendamment pendant cette analyse. L'annonce antérieure d'IBM confirme toutefois les principaux éléments commerciaux et techniques du projet. Les performances, les coûts réels et le calendrier devront être jugés lorsque le cluster sera effectivement opérationnel.

Références