OpenAI تراشه Jalapeño را با نخستین benchmarkهای عمومی وارد رقابت inference کرد
OpenAI نخستین نتایج اندازهگیریشدهی Jalapeño، اولین شتابدهندهی inference اختصاصی خود، را منتشر کرده و به این ترتیب یک اعلام سختافزاری ماه ژوئن را به یک داستان زیرساختی ملموستر تبدیل کرده است. شرکت میگوید این تراشه میتواند به ازای هر واحد توان، کار inference بیشتری انجام دهد و همزمان latency پاسخ را کاهش دهد؛ ترکیبی که برای agentهای تعاملی اهمیت مستقیم دارد، زیرا تأخیر در وظایف چندمرحلهای روی هم جمع میشود. این شواهد تازه ثابت نمیکنند که Jalapeño در محیط production از تمام گزینههای تجاری بهتر خواهد بود، اما برای نخستین بار تصویری عمومی از برنامهی OpenAI برای تغییر اقتصاد اجرای مدلهای frontier ارائه میکنند.
طبق گزارش benchmark خود OpenAI، Jalapeño با InferenceX، benchmark عمومی SemiAnalysis، روی GPT-OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T آزمایش شده است. OpenAI گزارش میکند که این تراشه نسبت به سیستمهای Nvidia Blackwell استفادهشده در مقایسه، ترکیب بهتری از throughput به ازای هر کیلووات و latency ارائه کرده است. نتایج منتشرشده بسته به workload و operating point، حدود ۱٫۵ تا ۱٫۹ برابر performance اوج به ازای هر وات و ۱٫۷ تا ۳٫۶ برابر latency انتهابهانتهای کمتر را نشان میدهند.
چرا بهرهوری inference برای agentها مهم است
بیشتر توجه زیرساخت AI به training جلب میشود، اما inference هزینهی تکرارشوندهی اجرای واقعی یک مدل است. هر درخواست کاربر، tool call، retry، مرحلهی reflection و تبادل میان sub-agentها ظرفیت سروینگ مصرف میکند. در workflowهای agentic طولانی، latency فقط مسئلهی رابط کاربری نیست. چند صد میلیثانیه تأخیر که در دهها یا صدها فراخوانی متوالی مدل تکرار شود، میتواند زمان تکمیل یک وظیفه را بهطور معناداری افزایش دهد.
به همین دلیل هدف طراحی Jalapeño مهم است. OpenAI میگوید سیستم را برای throughput و latency پایین بهطور همزمان بهینه کرده، نه اینکه یکی را فدای دیگری کند. شرکت performance به ازای واحد توان را metric زیرساختی مفیدتری میداند، چون دسترسی به برق بهطور فزایندهای محدودیتی عملی برای میزان ظرفیت inference قابل استقرار در یک data center است.
گزارش TechCrunch زمینهی مفیدی از Richard Ho، مدیر سختافزار OpenAI، اضافه میکند که نتایج را پیشرفتی قابلتوجه نسبت به state of the art توصیف کرده است. مهمتر اینکه TechCrunch محدودیت زمانی مقایسه را یادآور میشود: benchmark، Jalapeño را با سیستمهای Blackwell موجود مقایسه میکند، در حالی که تا زمان deployment گستردهتر OpenAI ممکن است سختافزار رقیب جدیدتری وارد بازار شده باشد. بنابراین benchmark مهم است، اما رتبهبندی دائمی محسوب نمیشود.
benchmark از یک نمودار صرفاً تبلیغاتی قویتر است، اما محدودیت دارد
نتایج جدید از یک آزمایش داخلی و اختصاصی وزن بیشتری دارند، چون OpenAI از InferenceX و مدلهای عمومی استفاده کرده است، نه فقط workload داخلی نامشخص. SemiAnalysis که InferenceX را اجرا میکند میگوید تراشه را بررسی و سیستم را benchmark کرده است. این موضوع نسبت به یک claim بازاریابی ساده، مرجع مستقل مفیدتری ایجاد میکند.
با این حال محدودیتهای مهم باقی میمانند. Jalapeño برای خریداران مستقل بهصورت تجاری قابل اجاره، نصب یا آزمایش نیست. سختافزار مقایسهشده Nvidia GB200 و GB300 از نسل Blackwell است، نه پلتفرم جدیدتر Vera Rubin که baseline رقابتی آینده را شکل خواهد داد. SemiAnalysis صریحاً میگوید Rubin مقایسهی آیندهنگرانهی مناسبتری است.
OpenAI همچنین میگوید در آزمایشهای داخلی روی مدلهای frontier خود مزیت بیشتری دیده، اما این نتایج از شواهد عمومی قابل ارزیابی مستقل نیستند. بنابراین باید آنها را claim منتسب به شرکت دانست، نه نتیجهی اثباتشدهی cross-vendor.
تراشهی اختصاصی اهرم زیرساختی OpenAI را تغییر میدهد
Jalapeño یک ASIC برای inference است، نه شتابدهندهی عمومی training. این تفاوت مهم است. OpenAI در کل compute stack خود جای Nvidia را نمیگیرد و همچنان برای training مدل و workloadهای دیگر به acceleratorهای خارجی وابستگی زیادی دارد. در عوض Jalapeño به OpenAI گزینهای اختصاصی برای یکی از بزرگترین هزینههای تکرارشوندهاش میدهد: سروینگ مدلهای آموزشدیده در مقیاس بالا.
ارزش استراتژیک از co-design میآید. OpenAI میتواند software مدل، runtime، networking و silicon را حول الگوهای ترافیکی خودش بهینه کند، بهجای اینکه کاملاً به یک accelerator عمومی برای مشتریان متعدد وابسته باشد. شرکت میگوید تراشهی نسل اول توان اسمی ۷۰۰ وات دارد و در workloadهای آزمایششده مصرف پایدار آن حداکثر ۵۵۰ وات بوده است. طراحی آن نیز برای کار در سیستمهای بزرگ انجام شده، نه بهعنوان accelerator منفرد.
پوشش The Verge گزارش میکند که OpenAI برای پایان ۲۰۲۶ deployment محدود و برای ۲۰۲۷ scale گستردهتر را برنامهریزی کرده است. این زمانبندی مهم است، چون اثر اقتصادی واقعی به حجم deployment، utilization و بلوغ software وابسته است، نه صرفاً رتبهی benchmark.
این موضوع برای اقتصاد پلتفرم AI چه معنایی دارد
برای سازمانهایی که OpenAI را از طریق API یا محصول مصرف میکنند، Jalapeño به شکل یک SKU تراشه ظاهر نخواهد شد. پرسش مهم این است که آیا سختافزار inference اختصاصی در نهایت به هزینهی سروینگ کمتر، پاسخ سریعتر، ظرفیت بیشتر هنگام جهش تقاضا یا قیمتگذاری تهاجمیتر منجر میشود. هیچکدام از این پیامدها صرفاً با benchmark تضمین نمیشوند.
برای بازار گستردهتر، این تحول یک تغییر ساختاری را تقویت میکند. بزرگترین labهای AI اکنون inference demand قابلپیشبینی کافی دارند تا custom silicon را توجیه کنند. Google TPU دارد، cloud providerها برنامههای accelerator خود را دارند و OpenAI اکنون نتایج اندازهگیریشدهی تراشهای را نشان میدهد که حول workloadهای سروینگ خودش طراحی شده است. vendorهای GPU عمومی همچنان از scale عظیم و چرخههای محصول سریع بهره میبرند، اما خریداران hyperscale AI انگیزهی بیشتری برای بهینهسازی بخشهایی از stack در داخل پیدا کردهاند.
این موضوع همچنین نحوهی تفسیر performance سرویس مدل توسط architectها را تغییر میدهد. نام مدل بهتنهایی توضیح کاملی از capability سیستم نیست. runtime software، batching، memory system، networking، power envelope و معماری accelerator میتوانند روی سرعت اجرای agent و هزینهی عملیاتی آن اثر مستقیم بگذارند.
بعد از این باید چه چیزی را دنبال کرد
شواهد مهم بعدی باید از deployment بیایند، نه یک نمودار benchmark دیگر. OpenAI باید نشان دهد Jalapeño در clusterهای بزرگ، ترافیک production واقعی، معماریهای مدل در حال تغییر و utilization پایدار میتواند مزیت performance را حفظ کند. reliability، yield، رفتار networking، tooling نرمافزاری و total cost of ownership به اندازهی benchmark اوج اهمیت خواهند داشت.
همچنین مقایسهی Jalapeño با نسل بعدی سختافزار inference رقیب روی workload و service-level target یکسان مهم خواهد بود. Blackwell مرجع فعلی معتبری است، اما تصمیمهای زیرساختی ۲۰۲۷ در برابر سیستمهای جدیدتر گرفته خواهند شد.
در حال حاضر اهمیت خبر محدودتر و قابلدفاعتر است: OpenAI برنامهی inference اختصاصی خود را از وعدهی بهرهوری به نتایج عمومی و اندازهگیریشده روی benchmark شخص ثالث رسانده است. اگر این مزایا در deployment واقعی حفظ شوند، Jalapeño میتواند کنترل بیشتری روی latency، ظرفیت و اقتصاد انرژی سرویسهای agentic به OpenAI بدهد. این benchmark رقابت سختافزاری را تمام نمیکند، اما نشان میدهد OpenAI در حال تبدیل شدن به اپراتور AI infrastructure عمودیتر است، نه فقط خریدار acceleratorهای شرکتهای دیگر.
Sources
- Jalapeño’s first results show industry-leading speed and efficiency in AI inference
- OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show
- OpenAI says its Jalapeño chip can power faster AI responses than the competition
- OpenAI Jalapeño: Better Than Nvidia Blackwell
تاریخ انتشار: