مؤسسه Institute of Foundation Models روش تازهای به نام Uno منتشر کرده که میخواهد یکی از گلوگاههای قدیمی تولید متن در مدلهای زبانی را برطرف کند، بدون اینکه برای افزایش سرعت از توزیع احتمالاتی مدل خودرگرسیو اصلی فاصله بگیرد. مقاله این پروژه ۳ سپتامبر ۲۰۲۶ منتشر شده و مخزن Apache-2.0 آن شامل کد استنتاج، آموزش و ارزیابی و همچنین وزنهای قابل دریافت مدل است.
ایده اصلی این است که مسئولیت «کیفیت پاسخ» از سازوکار «افزایش سرعت» جدا شود. Uno وزنهای معمول مدل خودرگرسیو را حفظ میکند و پس از ثابت کردن آنها، مجموعهای سبک از آداپتورهای انتشار را آموزش میدهد تا چند توکن را همزمان پیشنهاد کنند. سپس نمونهگیر Ψ-Spec این پیشنهادها را با توزیع مدل خودرگرسیو میسنجد و طولانیترین بخش معتبر را میپذیرد.
«بدون افت» در Uno دقیقاً یعنی چه؟
در این مقاله، واژه lossless معنای فنی مشخصی دارد. Ψ-Spec از نمونهگیری رد و پذیرش استفاده میکند تا توکنهای پذیرفتهشده از همان توزیع هدف مدل خودرگرسیو نمونهبرداری شوند. بنابراین منظور این نیست که هر بار دقیقاً همان رشته متن تولید میشود یا هیچ تفاوت عددی ناشی از پیادهسازی ممکن نیست. ادعا این است که برای سریعتر شدن، عمداً توزیع احتمالاتی مدل پایه قربانی نمیشود.
این تفاوت Uno را از دو مسیر رایج افزایش سرعت جدا میکند. در «تولید گمانهای» (speculative decoding) معمولاً یک مدل پیشنویس مستقل لازم است و خروجی آن باید به تأیید مدل اصلی برسد. مدلهای زبانی مبتنی بر انتشار نیز میتوانند چند توکن را موازی تولید کنند، اما معمولاً میان سرعت و کیفیت مصالحه دارند. Uno در عوض قابلیت انتشار را به مدل خودرگرسیو اضافه میکند و مرجع نهایی تأیید را همان وزنهای خودرگرسیو نگه میدارد.
نتیجه مهمتر، سرعت زیر بار همزمان است
تیتر جذاب مقاله از افزایش سرعت تا ۳ برابر حرف میزند، اما برای محیط واقعی، رفتار سامانه زیر بار همزمان مهمتر است. نویسندگان هم حالت تکدرخواست و هم بیشترین اندازه دستهای را که روی یک GPU از نوع NVIDIA H200 جا میشود اندازهگیری کردهاند. در مدل Uno که از ابتدا آموزش داده شده، بیشترین اندازه دسته برای مدل پایه ۶۴ بوده و Uno در همان نقطه حدود ۱.۵ برابر سریعتر گزارش شده است. در حالت تکدرخواست این افزایش سرعت حدود ۲.۲ برابر بوده است.
در نسخه مبتنی بر Qwen3 نیز مقاله بیش از ۵۷۰۰ توکن در ثانیه را در بیشترین اندازه دسته پشتیبانیشده و حدود ۱.۶ برابر افزایش سرعت نسبت به مدل پایه گزارش میکند. در آزمایشهای نویسندگان، Uno از EAGLE-3 و DFlash نیز در تنظیمات مقایسهشده توان عملیاتی بیشتری داشته است.
این موضوع برای سامانههای عاملمحور اهمیت زیادی دارد. یک درخواست کاربر ممکن است به چند فراخوانی موازی مدل، تلاش دوباره و شاخههای مختلف استفاده از ابزار تبدیل شود. بنابراین اندازهگیری سرعت فقط با یک درخواست میتواند ارزش واقعی یک روش بهینهسازی را بیشتر از حد نشان دهد. اگر بهبود در زمانی که GPU زیر بار است هم باقی بماند، اثر آن بر هزینه سرویسدهی و تولید مسیرهای آموزشی بسیار جدیتر میشود.
این بار فقط با یک مقاله روبهرو نیستیم
مخزن عمومی Uno یک موتور استنتاج مبتنی بر Nano-vLLM، دو نمونهگیر خطی و درختی Ψ-Spec، کد آموزش آداپتورهای انتشار، ابزارهای ارزیابی و دستور اجرای Uno Qwen3 8B، Uno 8B و Uno 1B را در اختیار میگذارد. وزنهای عمومی نیز معرفی شدهاند و مسیر بازتولید آموزش، استنتاج و ارزیابی مستند شده است.
این سطح از انتشار مهم است، چون اعداد عملکرد هنوز عمدتاً از سوی خود نویسندگان گزارش شدهاند. مقاله برای مدل 8B در یکی از آزمایشهای توان عملیاتی عدد ۵۲۵۵ توکن در ثانیه را روی H200 گزارش میکند و امتیاز ۶۸.۴ را برای SWE-bench Verified اعلام کرده است. همچنین در مجموعه آزمونهای عاملمحور، برنامهنویسی و استدلال با متن طولانی، نتایج بهتری از مدلهای انتشار مقایسهشده ارائه میدهد. تا زمانی که بازتولید مستقل منتشر نشود، این اعداد باید نتیجه محیط آزمایش خود تیم پژوهشی تلقی شوند.
نکته معماری Uno از خود عدد سرعت مهمتر است
برداشت اصلی Aipolix جداسازی مرجع کیفیت از لایه بهینهسازی سرعت است. در Uno، وزنهای خودرگرسیو همچنان توزیع هدف را تعیین میکنند و آداپتورهای انتشار فقط نقش شتابدهنده را دارند. سازوکار تأیید باعث میشود این لایه بهینهسازی نتواند بیسروصدا جای مرجع اصلی را بگیرد.
این الگو فراتر از همین پروژه ارزش دارد. در سامانههای هوش مصنوعی تولیدی، باید بتوان بخشی از زیرساخت را تغییر یا تنظیم کرد بدون اینکه قرارداد رفتاری سامانه ناخواسته عوض شود. Uno نمونهای روشن از این اصل در مرحله استنتاج است: پیشنهادها را تا جای ممکن سریع تولید کن، اما پذیرش آنها را به مرجعی بسپار که توزیع اصلی را حفظ میکند.
برای تیمهایی که عاملهای پرترافیک اجرا میکنند، پرسش عملی این است که آیا این مزیت روی مدل، سختافزار، طول زمینه و میزان همزمانی خودشان هم تکرار میشود یا نه. انتشار کد امکان چنین آزمایشی را فراهم کرده است. ارزیابی مناسب باید علاوه بر تأخیر، توان عملیاتی کل، مصرف حافظه GPU، نرخ پذیرش توکنها، توزیع خروجی و هزینه تولید مسیرهای آموزشی را با روش فعلی سازمان مقایسه کند.
چه چیزهایی تأیید شده و چه چیزهایی هنوز باز است؟
مقاله، کد، مسیر آموزش، ابزارهای ارزیابی و وزنهای عمومی در دسترساند و مجوز Apache-2.0 امکان بررسی و اجرای پیادهسازی را میدهد. سازوکار «بدون افت» نیز به یک روش تأیید فنی مشخص متکی است و صرفاً ادعای بازاریابی درباره «کیفیت یکسان» نیست.
اما دامنه کامل افزایش سرعت هنوز بهطور مستقل تأیید نشده است. عدد اوج ۳ برابر، نتایج H200 و مقایسههای بنچمارک از آزمایشهای خود نویسندگان میآیند. کرنلهای سختافزاری، شیوه دستهبندی درخواستها، مدل پایه و تنظیمات نمونهگیر میتوانند نتیجه را بهشدت تغییر دهند. Uno در حال حاضر یک روش تازه، قابل بررسی و قابل بازتولید برای استنتاج سریعتر است، نه تضمینی برای اینکه هر استقرار خودرگرسیو همان میزان افزایش سرعت را خواهد گرفت.