Together AI اعلام کرده ظرفیت inference خود را با یک کلاستر اختصاصی از GPUهای NVIDIA B300 روی IBM Cloud افزایش می‌دهد. ارتباط این کلاستر با NVIDIA Spectrum-X Ethernet انجام می‌شود. Together AI لایه اجرای مدل‌ها را مدیریت می‌کند، IBM زیرساخت ابری را فراهم می‌کند و NVIDIA شتاب‌دهنده‌ها و فناوری شبکه را تأمین می‌کند.

این خبر ادامه توافقی است که IBM در ماه اوت اعلام کرده بود. IBM آن زمان از یک قرارداد چندساله ۲۴۰ میلیون دلاری با Together AI برای استقرار یک کلاستر بزرگ مبتنی بر NVIDIA HGX B300 و Spectrum-X خبر داد و زمان مورد انتظار برای دسترسی را سه‌ماهه اول ۲۰۲۷ اعلام کرد.

این معماری نشان می‌دهد inference به یک حوزه زیرساختی تخصصی تبدیل شده است. اجرای مدل‌ها در مقیاس بالا به نرخ تولید توکن زیاد، تأخیر کم، پایداری و شبکه‌ای نیاز دارد که بتواند شتاب‌دهنده‌ها را به‌طور مؤثر تغذیه کند. Together AI پلتفرم سرو مدل را روی زیرساخت IBM و سخت‌افزار NVIDIA قرار می‌دهد.

Together AI می‌گوید ماهانه صدها تریلیون توکن برای بیش از یک میلیون توسعه‌دهنده پردازش می‌کند، اما این ارقام در این بررسی به‌طور مستقل تأیید نشدند. در مقابل، اعلامیه قبلی IBM عناصر اصلی قرارداد و برنامه استقرار را تأیید می‌کند. عملکرد واقعی، هزینه و زمان‌بندی نهایی زمانی روشن می‌شود که کلاستر وارد بهره‌برداری عملی شود.

منابع