پروژه متنباز SwarmLLM نسخه 0.2.0 را منتشر کرده است؛ سامانهای که یک مدل زبانی بزرگ را میان چند مرورگر روی دستگاههای مختلف تقسیم میکند. همراه این نسخه، نمایشی از اجرای Qwen 3.8 27B روی یک مکبوک و آیفون در ۷ سپتامبر منتشر شده و کد موتور WebGPU، ارتباط مستقیم WebRTC، آزمونهای کارایی و مدل تهدید نیز در دسترس است.
اهمیت این پروژه را نباید با عددهای سرعتی که خود سازنده گزارش کرده سنجید؛ این اندازهگیریها هنوز بهطور مستقل تکرار نشدهاند. نکته فنی مهمتر این است که هر دستگاه فقط بخشی از لایههای مدل را نگه میدارد و خروجی میانی محاسبات را مستقیم به مرورگر بعدی میفرستد. در نتیجه میتوان حافظه و توان پردازشی چند دستگاه موجود را بدون نصب یک محیط اجرای بومی روی تکتک آنها کنار هم قرار داد.
مدل بزرگتر از حافظه یک دستگاه میشود
در معماری SwarmLLM، تبدیل متن به توکن، لایه تعبیه، بخش نهایی مدل و نمونهگیری روی مرورگر میزبان باقی میمانند. لایههای اصلی مدل به چند بازه پیوسته تقسیم میشوند و هر دستگاه فقط بازه خود را اجرا میکند. سپس حالت میانی با دقت f16 از طریق WebRTC برای دستگاه بعدی فرستاده میشود.
برای Qwen 3.8 27B، مستندات پروژه اندازه این داده میانی را ۵۱۲۰ مقدار، حدود ۱۰ کیلوبایت برای هر گام، اعلام میکنند. هر مرورگر نیز فقط وزنهای مربوط به لایههای خودش را دریافت و در حافظه نهان مرورگر نگه میدارد. بنابراین چند دستگاه به یک پردازنده گرافیکی واحد تبدیل نمیشوند؛ آنچه واقعاً تجمیع میشود ظرفیت حافظه و بخشی از توان محاسباتی آنهاست.
مزیت نسخه 0.2.0 این است که این سازوکار در قالب یک اتاق مرورگری ارائه شده است. برخلاف بسیاری از روشهای توزیع مدل، لازم نیست روی همه دستگاهها پایتون، سرویس RPC یا برنامه بومی نصب شود. این کاهش اصطکاک میتواند برای آزمایشگاهها، کلاسها یا تیمهای کوچک با سختافزار ناهمگون کاربردی باشد.
اعداد سرعت هنوز معیار مستقل نیستند
پروژه میگوید روی NVIDIA GB10، سرعت تولید عادی به ۹ توکن در ثانیه و با پیشبینی چندتوکنی به ۱۶.۱ توکن در ثانیه رسیده است. در همان محیط، برای یک نسخه مشخص از llama.cpp سرعت ۸ توکن در ثانیه ثبت شده است. همچنین در آزمایش تقسیم مدل میان مکبوک و آیفون روی یک شبکه وایفای، عدد ۷.۷ توکن در ثانیه در گزارش آزمون آمده، در حالی که ویدیوی همراه نسخه 0.2.0 یک اجرای ۴۰۰ توکنی با ۱۰.۷ توکن در ثانیه را نشان میدهد.
این اعداد را باید ادعای اندازهگیریشده توسط خود پروژه دانست، نه اثبات برتری مرورگر بر اجرای بومی. همان گزارش نشان میدهد آمادهسازی ورودی روی GB10 فاصله بزرگی دارد: برای llama.cpp عدد ۳۷۷ توکن در ثانیه و برای SwarmLLM عدد ۴۴ گزارش شده است. با زیاد شدن تعداد گامهای ارتباطی میان مرورگرها نیز افت سرعت قابل توجه میشود.
پس ارزش فعلی بیشتر در امکان جا دادن مدل روی مجموعهای از دستگاههاست، نه در ادعای سرعت بیشتر. شبکه و هزینه عبور از هر دستگاه همچنان محدودیت اصلی هستند.
پیشبینی چندتوکنی برای کمکردن رفتوبرگشت شبکه است
در تولید خودرگرسیو، اگر برای هر توکن لازم باشد داده از چند دستگاه عبور کند، تأخیر شبکه بهسرعت غالب میشود. SwarmLLM از بخش پیشبینی چندتوکنی مدل استفاده میکند تا چند توکن پیشنهادی بسازد و سپس آنها را در یک مرحله دستهای با بدنه اصلی مدل بررسی کند.
طبق مستندات معماری، فقط توکنهایی پذیرفته میشوند که نتیجه بدنه اصلی مدل آنها را تأیید کند. در نخستین اختلاف، توکن خروجی مدل اصلی مبنا قرار میگیرد و حالتهای بازگشتی از نسخه ذخیرهشده بازسازی میشوند. آزمونهای پروژه نیز برای مسیر پیشبینیشده و مسیر عادی خروجی یکسان را مطالبه میکنند.
این انتخاب مستقیماً محدودیت شبکه را هدف میگیرد: در یک سامانه توزیعشده، سریعتر شدن کرنلها کافی نیست و هر رفتوبرگشت شبکه باید کار بیشتری حمل کند.
مرز اعتماد، اعضای اتاق هستند
مستند امنیتی پروژه در این بخش صریح است. سرویس هماهنگکننده ترافیک مدل را دریافت نمیکند و ارتباط WebRTC میان مرورگرها رمزگذاری میشود؛ با این حال همه اعضای اتاق گفتوگو را میبینند و حالتهای میانی نیز نباید بهعنوان سازوکار حفظ محرمانگی تلقی شوند.
محدودیت مهمتر این است که نسخه فعلی راهی برای اثبات درستی محاسبه دستگاه راه دور ندارد. یک عضو مخرب میتواند داده میانی دستکاریشده برگرداند و سامانه در حال حاضر آن را تشخیص نمیدهد. خود پروژه ممیزی محاسبات را جزو برنامههای آینده قرار داده و استفاده از جمعی ناشناس از دستگاهها را امن معرفی نمیکند.
بنابراین حذف سرویس متمرکز فقط یک مرز اعتماد را برمیدارد و مرز دیگری ایجاد میکند: باید به مرورگرهای مشارکتکننده اعتماد کرد. برای داده حساس، پرسش اصلی فقط محل اجرای مدل نیست؛ باید معلوم باشد چه کسانی اجازه دارند در محاسبه شریک شوند.
کاربرد عملیتر، تجمیع موقت توان محلی است
تحلیل Aipolix این است که SwarmLLM فعلاً بیشتر بهعنوان راهی برای تجمیع موقت توان محلی ارزش دارد تا جایگزینی برای رایانش ابری. یک تیم میتواند چند دستگاه موجود را برای مدت کوتاهی کنار هم بگذارد، بدون نصب جداگانه روی هر دستگاه مدل بزرگتری اجرا کند و پس از پایان کار این مجموعه را از هم باز کند.
برای چنین استفادهای سه کنترل اهمیت ویژه دارند: نسخه دقیق مدل باید مشخص باشد، عضویت اتاق به افراد و دستگاههای مورد اعتماد محدود شود و اگر کارایی اهمیت دارد، آرایش دستگاهها و شرایط آزمون ثبت شود. نسخه 0.2.0 هنوز صحت محاسبه دستگاههای دیگر را راستیآزمایی نمیکند و برای فایل مدل نیز بررسی هش محتوا را به آینده موکول کرده است.
پروژه هنوز کوچک و در ابتدای راه است و نتایج سرعت آن به تکرار مستقل نیاز دارند. با این حال کد منتشرشده یک الگوی استقرار واقعی را نشان میدهد: میتوان استنتاج محلی را در سطح مرورگر میان چند دستگاه تقسیم کرد و در عوض، محدودیت اصلی را از حافظه یک دستگاه به تأخیر شبکه و اعتماد میان اعضا منتقل کرد.