زیرساخت و تراشه

OpenAI تراشه Jalapeño را با نخستین benchmarkهای عمومی وارد رقابت inference کرد

OpenAI نخستین نتایج اندازه‌گیری‌شده‌ی Jalapeño، اولین شتاب‌دهنده‌ی inference اختصاصی خود، را منتشر کرده و به این ترتیب یک اعلام سخت‌افزاری ماه ژوئن را به یک داستان زیرساختی ملموس‌تر تبدیل کرده است. شرکت می‌گوید این تراشه می‌تواند به ازای هر واحد توان، کار inference بیشتری انجام دهد و هم‌زمان latency پاسخ را کاهش دهد؛ ترکیبی که برای agentهای تعاملی اهمیت مستقیم دارد، زیرا تأخیر در وظایف چندمرحله‌ای روی هم جمع می‌شود. این شواهد تازه ثابت نمی‌کنند که Jalapeño در محیط production از تمام گزینه‌های تجاری بهتر خواهد بود، اما برای نخستین بار تصویری عمومی از برنامه‌ی OpenAI برای تغییر اقتصاد اجرای مدل‌های frontier ارائه می‌کنند.

طبق گزارش benchmark خود OpenAI، Jalapeño با InferenceX، benchmark عمومی SemiAnalysis، روی GPT-OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T آزمایش شده است. OpenAI گزارش می‌کند که این تراشه نسبت به سیستم‌های Nvidia Blackwell استفاده‌شده در مقایسه، ترکیب بهتری از throughput به ازای هر کیلووات و latency ارائه کرده است. نتایج منتشرشده بسته به workload و operating point، حدود ۱٫۵ تا ۱٫۹ برابر performance اوج به ازای هر وات و ۱٫۷ تا ۳٫۶ برابر latency انتها‌به‌انتهای کمتر را نشان می‌دهند.

چرا بهره‌وری inference برای agentها مهم است

بیشتر توجه زیرساخت AI به training جلب می‌شود، اما inference هزینه‌ی تکرارشونده‌ی اجرای واقعی یک مدل است. هر درخواست کاربر، tool call، retry، مرحله‌ی reflection و تبادل میان sub-agentها ظرفیت سروینگ مصرف می‌کند. در workflowهای agentic طولانی، latency فقط مسئله‌ی رابط کاربری نیست. چند صد میلی‌ثانیه تأخیر که در ده‌ها یا صدها فراخوانی متوالی مدل تکرار شود، می‌تواند زمان تکمیل یک وظیفه را به‌طور معناداری افزایش دهد.

به همین دلیل هدف طراحی Jalapeño مهم است. OpenAI می‌گوید سیستم را برای throughput و latency پایین به‌طور هم‌زمان بهینه کرده، نه اینکه یکی را فدای دیگری کند. شرکت performance به ازای واحد توان را metric زیرساختی مفیدتری می‌داند، چون دسترسی به برق به‌طور فزاینده‌ای محدودیتی عملی برای میزان ظرفیت inference قابل استقرار در یک data center است.

گزارش TechCrunch زمینه‌ی مفیدی از Richard Ho، مدیر سخت‌افزار OpenAI، اضافه می‌کند که نتایج را پیشرفتی قابل‌توجه نسبت به state of the art توصیف کرده است. مهم‌تر اینکه TechCrunch محدودیت زمانی مقایسه را یادآور می‌شود: benchmark، Jalapeño را با سیستم‌های Blackwell موجود مقایسه می‌کند، در حالی که تا زمان deployment گسترده‌تر OpenAI ممکن است سخت‌افزار رقیب جدیدتری وارد بازار شده باشد. بنابراین benchmark مهم است، اما رتبه‌بندی دائمی محسوب نمی‌شود.

benchmark از یک نمودار صرفاً تبلیغاتی قوی‌تر است، اما محدودیت دارد

نتایج جدید از یک آزمایش داخلی و اختصاصی وزن بیشتری دارند، چون OpenAI از InferenceX و مدل‌های عمومی استفاده کرده است، نه فقط workload داخلی نامشخص. SemiAnalysis که InferenceX را اجرا می‌کند می‌گوید تراشه را بررسی و سیستم را benchmark کرده است. این موضوع نسبت به یک claim بازاریابی ساده، مرجع مستقل مفیدتری ایجاد می‌کند.

با این حال محدودیت‌های مهم باقی می‌مانند. Jalapeño برای خریداران مستقل به‌صورت تجاری قابل اجاره، نصب یا آزمایش نیست. سخت‌افزار مقایسه‌شده Nvidia GB200 و GB300 از نسل Blackwell است، نه پلتفرم جدیدتر Vera Rubin که baseline رقابتی آینده را شکل خواهد داد. SemiAnalysis صریحاً می‌گوید Rubin مقایسه‌ی آینده‌نگرانه‌ی مناسب‌تری است.

OpenAI همچنین می‌گوید در آزمایش‌های داخلی روی مدل‌های frontier خود مزیت بیشتری دیده، اما این نتایج از شواهد عمومی قابل ارزیابی مستقل نیستند. بنابراین باید آن‌ها را claim منتسب به شرکت دانست، نه نتیجه‌ی اثبات‌شده‌ی cross-vendor.

تراشه‌ی اختصاصی اهرم زیرساختی OpenAI را تغییر می‌دهد

Jalapeño یک ASIC برای inference است، نه شتاب‌دهنده‌ی عمومی training. این تفاوت مهم است. OpenAI در کل compute stack خود جای Nvidia را نمی‌گیرد و همچنان برای training مدل و workloadهای دیگر به acceleratorهای خارجی وابستگی زیادی دارد. در عوض Jalapeño به OpenAI گزینه‌ای اختصاصی برای یکی از بزرگ‌ترین هزینه‌های تکرارشونده‌اش می‌دهد: سروینگ مدل‌های آموزش‌دیده در مقیاس بالا.

ارزش استراتژیک از co-design می‌آید. OpenAI می‌تواند software مدل، runtime، networking و silicon را حول الگوهای ترافیکی خودش بهینه کند، به‌جای اینکه کاملاً به یک accelerator عمومی برای مشتریان متعدد وابسته باشد. شرکت می‌گوید تراشه‌ی نسل اول توان اسمی ۷۰۰ وات دارد و در workloadهای آزمایش‌شده مصرف پایدار آن حداکثر ۵۵۰ وات بوده است. طراحی آن نیز برای کار در سیستم‌های بزرگ انجام شده، نه به‌عنوان accelerator منفرد.

پوشش The Verge گزارش می‌کند که OpenAI برای پایان ۲۰۲۶ deployment محدود و برای ۲۰۲۷ scale گسترده‌تر را برنامه‌ریزی کرده است. این زمان‌بندی مهم است، چون اثر اقتصادی واقعی به حجم deployment، utilization و بلوغ software وابسته است، نه صرفاً رتبه‌ی benchmark.

این موضوع برای اقتصاد پلتفرم AI چه معنایی دارد

برای سازمان‌هایی که OpenAI را از طریق API یا محصول مصرف می‌کنند، Jalapeño به شکل یک SKU تراشه ظاهر نخواهد شد. پرسش مهم این است که آیا سخت‌افزار inference اختصاصی در نهایت به هزینه‌ی سروینگ کمتر، پاسخ سریع‌تر، ظرفیت بیشتر هنگام جهش تقاضا یا قیمت‌گذاری تهاجمی‌تر منجر می‌شود. هیچ‌کدام از این پیامدها صرفاً با benchmark تضمین نمی‌شوند.

برای بازار گسترده‌تر، این تحول یک تغییر ساختاری را تقویت می‌کند. بزرگ‌ترین labهای AI اکنون inference demand قابل‌پیش‌بینی کافی دارند تا custom silicon را توجیه کنند. Google TPU دارد، cloud providerها برنامه‌های accelerator خود را دارند و OpenAI اکنون نتایج اندازه‌گیری‌شده‌ی تراشه‌ای را نشان می‌دهد که حول workloadهای سروینگ خودش طراحی شده است. vendorهای GPU عمومی همچنان از scale عظیم و چرخه‌های محصول سریع بهره می‌برند، اما خریداران hyperscale AI انگیزه‌ی بیشتری برای بهینه‌سازی بخش‌هایی از stack در داخل پیدا کرده‌اند.

این موضوع همچنین نحوه‌ی تفسیر performance سرویس مدل توسط architectها را تغییر می‌دهد. نام مدل به‌تنهایی توضیح کاملی از capability سیستم نیست. runtime software، batching، memory system، networking، power envelope و معماری accelerator می‌توانند روی سرعت اجرای agent و هزینه‌ی عملیاتی آن اثر مستقیم بگذارند.

بعد از این باید چه چیزی را دنبال کرد

شواهد مهم بعدی باید از deployment بیایند، نه یک نمودار benchmark دیگر. OpenAI باید نشان دهد Jalapeño در clusterهای بزرگ، ترافیک production واقعی، معماری‌های مدل در حال تغییر و utilization پایدار می‌تواند مزیت performance را حفظ کند. reliability، yield، رفتار networking، tooling نرم‌افزاری و total cost of ownership به اندازه‌ی benchmark اوج اهمیت خواهند داشت.

همچنین مقایسه‌ی Jalapeño با نسل بعدی سخت‌افزار inference رقیب روی workload و service-level target یکسان مهم خواهد بود. Blackwell مرجع فعلی معتبری است، اما تصمیم‌های زیرساختی ۲۰۲۷ در برابر سیستم‌های جدیدتر گرفته خواهند شد.

در حال حاضر اهمیت خبر محدودتر و قابل‌دفاع‌تر است: OpenAI برنامه‌ی inference اختصاصی خود را از وعده‌ی بهره‌وری به نتایج عمومی و اندازه‌گیری‌شده روی benchmark شخص ثالث رسانده است. اگر این مزایا در deployment واقعی حفظ شوند، Jalapeño می‌تواند کنترل بیشتری روی latency، ظرفیت و اقتصاد انرژی سرویس‌های agentic به OpenAI بدهد. این benchmark رقابت سخت‌افزاری را تمام نمی‌کند، اما نشان می‌دهد OpenAI در حال تبدیل شدن به اپراتور AI infrastructure عمودی‌تر است، نه فقط خریدار acceleratorهای شرکت‌های دیگر.

Sources
- Jalapeño’s first results show industry-leading speed and efficiency in AI inference
- OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show
- OpenAI says its Jalapeño chip can power faster AI responses than the competition
- OpenAI Jalapeño: Better Than Nvidia Blackwell

تاریخ انتشار: