Waymo تراشه ۵ نانومتری سفارشی پشت پشته محاسباتی رباتاکسی خود را معرفی کرد
Waymo جزئیات سیلیکون سفارشی و معماری محاسباتی ناهمگون پشت پلتفرم جدید رباتاکسی خود را منتشر کرده است. این شرکت یک ASIC اختصاصی ۵ نانومتری را معرفی کرده که برای پردازش اولیه ادراک و حسگرها بیش از ۱۰۰۰ تریلیون عملیات یادگیری ماشین در ثانیه انجام میدهد. این افشا که ۲۰ اوت منتشر شد مهم است، چون نشان میدهد یکی از بزرگترین اپراتورهای تجاری رانندگی خودکار در جهان بهجای اتکای کامل به شتابدهندههای عمومی، به سمت یکپارچگی عمودی عمیقتر در زیرساخت هوش مصنوعی حرکت میکند.
این تراشه جایگزین همه پردازندههای داخل خودروی Waymo نیست. طبق توضیح شرکت، ASIC در بخش ابتدایی زنجیره ادراک قرار میگیرد و جریان خام دادههای لیدار، رادار و دوربین را پیش از رسیدن به سامانه استنتاج گستردهتر پردازش میکند. وظایف آن شامل استخراج ویژگی، ترکیب اطلاعات حسگرها و اجرای بارهای شبکه عصبی با محدودیتهای سخت تأخیر است. Waymo میگوید سامانه جدید میتواند ورودی باکیفیت ۱۳ دوربین با وضوح بالا را بهطور همزمان و بلادرنگ پردازش کند.
این مسئله مهندسی با هوش مصنوعی دیتاسنتری متفاوت است. رباتاکسی باید بخش حیاتی رانندگی را بهصورت محلی، پیوسته و تحت محدودیتهای شدید تأخیر، توان، حرارت، فضا و قابلیت اطمینان اجرا کند. Waymo میگوید سامانه محاسباتی خودرو در بازه میلیثانیه تصمیم میگیرد و بر سه اصل پاسخگویی سریع، مقاومسازی و افزونگی طراحی شده است. شرکت همچنین میگوید طی هشت سال ظرفیت محاسباتی را حدود ۲۰ برابر افزایش داده، در حالی که همچنان باید سامانه در خودرو جا بگیرد و مصرف باتری، خنکسازی و صدای تولیدشده کنترل شود.
ASIC سفارشی بازتاب همین تخصصیشدن بار کاری است. Waymo میگوید طراحی شامل شتابدهندههایی برای عملیاتی مانند حذف نویز زمانی است که میتواند ادراک در نور کم را بهبود دهد و از انواع مدل، از کانولوشنهای sparse تا ترنسفورمرهای dense، پشتیبانی کند. چون بارهای رانندگی خودکار اغلب با batch کوچک اجرا میشوند، عدد throughput بهتنهایی تعیینکننده عملکرد نیست. شرکت بر بهینهسازی تمام پشته، از جابهجایی حافظه و وفاداری حسگر تا quantization و تأخیر واقعی، تأکید میکند.
معماری کلی همچنان ناهمگون است. Waymo صراحتاً AMD، Micron، Nvidia، Samsung، SanDisk، Socionext و TSMC را از تأمینکنندگان پلتفرم محاسباتی فعلی نام برده است. بنابراین تراشه سفارشی به این معنا نیست که Waymo پردازندهها یا GPUهای تجاری را کنار گذاشته است. راهبرد شرکت بیشتر شبیه یک مدل ترکیبی است که در آن بخشهای متمایزکننده مسیر استنتاج داخلی میشوند و اجزایی که تأمینکنندگان بیرونی در هزینه، عملکرد یا سرعت توسعه برتری دارند همچنان خریداری میشوند.
گزارشهای مستقل در خطوط اصلی با روایت Waymo همخوان هستند. The Verge همان فرایند ۵ نانومتری، توان بیش از ۱۰۰۰ TOPS برای پردازش اولیه و ادامه استفاده از تأمینکنندگانی از جمله Nvidia و AMD را گزارش کرده است. SiliconANGLE نیز نوشته که ماژول نسل ششم رانندگی خودکار Waymo از ASICهای سفارشی در کنار پشته محاسباتی بزرگتر استفاده میکند. با این حال این رسانهها ادعاهای عملکردی Waymo را با benchmark مستقل تأیید نکردهاند، بنابراین عدد ۱۰۰۰ TOPS و مزیتهای بهرهوری باید همچنان مشخصات اعلامشده توسط شرکت تلقی شوند.
برای تیمهای زیرساخت هوش مصنوعی، درس معماری مهمتر از عدد تیتر است. وقتی AI از سرویس ابری به رباتها، خودروها، سامانههای صنعتی و محیطهای بلادرنگ میرود، نسبت میان شتابدهنده عمومی و سیلیکون تخصصی تغییر میکند. GPU دیتاسنتری انعطاف بالایی دارد، اما خودمختاری edge به تأخیر قابلپیشبینی، پردازش نزدیک به حسگر، بهرهوری انرژی و همطراحی سختافزار و نرمافزار پاداش میدهد. Waymo عملاً خودرو را یک سامانه edge AI توزیعشده میبیند که محاسبات، حسگر و مدل در آن با هم طراحی میشوند.
این رویکرد معماری نرمافزار را هم تغییر میدهد. شتابدهنده سفارشی اهمیت پشتیبانی compiler، راهبرد quantization، تقسیم مدل، observability و رفتار fallback را بیشتر میکند. تیمها دیگر نمیتوانند فقط دقت مدل را بهینه کنند. باید مشخص کنند کدام عملیات روی سیلیکون تخصصی اجرا شود، کدام بخش روی CPU یا GPU بماند، داده چگونه میان پردازندهها حرکت کند، خرابی چگونه تشخیص و ایزوله شود و بهروزرسانی نرمافزار چگونه بدون تضعیف تضمینهای ایمنی انجام شود. در سامانههای ایمنیحیاتی، افزونگی و رفتار قابلپیشبینی میتواند به اندازه توان خام مدل اهمیت داشته باشد.
این افشا برای بازار تراشه AI نیز معنیدار است. Nvidia همچنان تأمینکننده نامبردهشده Waymo است، بنابراین موضوع را نمیتوان صرفاً جایگزینی Nvidia دانست. تصویر دقیقتر این است که اپراتورهای بزرگ AI ممکن است بخشهایی را که برای بار کاریشان بیشترین تمایز ایجاد میکند داخلی کنند و در بخشهای دیگر از اجزای تجاری استفاده کنند. همین الگو در زیرساخت hyperscale ابری دیده میشود و خودروهای خودران آن را به physical AI گسترش میدهند.
محدودیتهای دانستههای عمومی مهماند. Waymo اندازه die، تعداد ترانزیستور، حجم تولید، هزینه واحد، مصرف توان، پهنای باند حافظه، توپولوژی دقیق افزونگی یا benchmarkهای مستقل و قابل بازتولید را منتشر نکرده است. اطلاعات کافی برای مقایسه مستقیم این ASIC با تراشههای رقیب رانندگی خودکار نیز وجود ندارد. در نتیجه ادعای بیش از ۱۰۰۰ TOPS نباید بهعنوان معیار مستقلی برای توانایی رانندگی یا ایمنی تفسیر شود.
با این حال زمان انتشار قابل توجه است. Waymo همزمان در حال گسترش سرویس تجاری خود در شهرهای بیشتری از آمریکا و افزایش مقیاس و تنوع ناوگان است. پلتفرم محاسباتی اختصاصی زمانی از نظر اقتصادی توجیه دارد که اپراتور انتظار حجم استقرار کافی، عمر محصول طولانی یا ارزش راهبردی از کنترل بخشهای حیاتی پشته داشته باشد. این افشا نشان میدهد Waymo بار کاری رانندگی خودکار خود را آنقدر بالغ میداند که چنین سرمایهگذاریای را توجیه کند.
موضوعات بعدی برای رصد، جزئیاتی است که Waymo در رویدادهای فنی مانند Hot Chips منتشر میکند، اینکه نسلهای بعدی خودرو چه مقدار بیشتری از استنتاج را به سیلیکون سفارشی منتقل میکنند و این معماری چه اثری بر هزینه، مصرف توان و سرویسپذیری در مقیاس ناوگان دارد. برای سازندگان physical AI پیام اصلی روشن است: وقتی AI از دیتاسنتر خارج میشود و باید در دنیای واقعی با محدودیت سخت زمانی و ایمنی عمل کند، محاسبات تخصصی و همطراحی انتهابهانتها به تصمیمهای معماری درجهاول تبدیل میشوند.
تاریخ انتشار: