A Together AI anunciou uma expansão da sua capacidade de inferência com um cluster dedicado de GPUs NVIDIA B300 na IBM Cloud, ligado através de NVIDIA Spectrum-X Ethernet. A Together AI ficará responsável pela camada de inferência, a IBM pela infraestrutura de cloud e a NVIDIA pelo hardware de aceleração e rede.

A atualização dá continuidade a um acordo anunciado pela IBM em agosto. Nessa altura, a IBM descreveu um contrato plurianual de 240 milhões de dólares com a Together AI para um cluster de grande escala baseado em sistemas NVIDIA HGX B300 e Spectrum-X, com disponibilidade prevista para o primeiro trimestre de 2027.

A configuração mostra como a infraestrutura de inferência se está a tornar uma área especializada. Servir modelos em grande escala exige débito elevado de tokens, baixa latência, fiabilidade e redes capazes de alimentar continuamente os aceleradores. A Together AI fornece a plataforma de execução de modelos sobre a infraestrutura da IBM e o hardware da NVIDIA.

A Together AI afirma processar centenas de biliões de tokens por mês para mais de um milhão de programadores, números que não foram validados de forma independente nesta execução. O anúncio anterior da IBM confirma, porém, os principais elementos comerciais e técnicos do projeto. A questão decisiva será a execução: custos reais, desempenho e disponibilidade só poderão ser avaliados quando o cluster estiver efetivamente em produção.

Referências