پژوهشگران Tencent Hunyuan در یک پیشچاپ به یک پرسش معماری مهم برای هوش مصنوعی چندوجهی پرداختهاند: در چه مقیاسی ممکن است یک مدل بتواند بینایی را مستقیماً از پیکسلها یاد بگیرد و دیگر به رمزگذار بصری ازپیشآموزشدیده و جداگانه وابسته نباشد؟ این مطالعه مدلهای زبانی چندوجهی دارای رمزگذار را با سامانههای بدون رمزگذار مقایسه میکند. طبق گزارش نویسندگان، روش بدون رمزگذار در مقیاسهای آزمایششده برای هدف چندوجهی از نظر محاسباتی کمبازدهتر است، اما با افزایش محاسبات آموزشی سریعتر بهبود مییابد. برازش قوانین مقیاسپذیری احتمال نزدیکشدن دو روش را در حدود 10^22 FLOPs مطرح میکند.
همین نقطه مهمترین نتیجه و همزمان مهمترین محدودیت پژوهش است. پژوهشگران این نقطه تلاقی را مستقیماً مشاهده نکردهاند. برآورد آن از ادامهدادن روند برازششده به بیرون از محدوده اندازهگیریشده به دست آمده است؛ بنابراین باید آن را فرضیهای درباره رفتار در مقیاس بزرگتر دانست، نه یک آستانه اثباتشده. مقاله نیز هنوز پیشچاپ است و نتیجهها به خانواده مدل، داده، روش بهینهسازی و ارزیابیهای همین آزمایش وابستهاند.
پرسش معماری چگونه تغییر میکند
بسیاری از مدلهای زبانی چندوجهی از یک رمزگذار بصری ازپیشآموزشدیده استفاده میکنند تا تصویر را به بازنماییای تبدیل کنند که مدل زبانی بتواند آن را پردازش کند. این ساختار یک پیشزمینه بصری قوی فراهم میکند و میتواند آموزش را کارآمدتر کند، زیرا مدل زبانی مجبور نیست کل فرایند ساخت بازنمایی بصری را از پیکسل خام یاد بگیرد.
در معماری بدون رمزگذار، این بخش تخصصی حذف میشود و رمزگشا باید همزمان با زبان و استدلال چندوجهی، بازنمایی بصری مناسب را نیز یاد بگیرد. در آزمایشهای این پژوهش، مقیاسپذیری هدف متنی در دو روش تقریباً مشابه گزارش شده، اما مدلهای بدون رمزگذار در هدف چندوجهی و در مقیاسهای کوچکتر عقبتر هستند. با این حال، منحنیهای برازششده برای معماری بدون رمزگذار سریعتر بهبود مییابند.
در نتیجه، تصمیم مهندسی دیگر فقط این نیست که آیا یادگیری چندوجهی بدون رمزگذار ممکن است یا نه. پرسش عملیتر این است که آیا سادگی یک معماری یکپارچه در مقیاسهای واقعی میتواند هزینه آموزشی بیشتر آن را جبران کند.
رمزگشا رفتار تخصصی بصری پیدا میکند
نویسندگان همچنین تغییرات درونی رمزگشای بدون رمزگذار را بررسی کردهاند. آنها گزارش میکنند که با افزایش محاسبات، تعامل دوسویه میان توکنهای بصری مفیدتر میشود، پردازش بصری به لایههای ابتداییتر منتقل میشود و مسیریابی متخصصها برای توکنهای بصری تمرکز بیشتری پیدا میکند.
این مشاهدات با این تفسیر سازگار است که رمزگشا بهتدریج محاسبات تخصصیتری برای بینایی ایجاد میکند. برای طراحان سامانههای چندوجهی و مدلهای ترکیب متخصصها، این نکته مهم است: حذف رمزگذار بصری به معنی حذف تخصص بصری نیست. این تخصص ممکن است به درون مدل مشترک منتقل شود و محل تخصیص ظرفیت، مسیریابی و محاسبات را تغییر دهد.
بنابراین، یکپارچهشدن معماری را نباید به معنای ازبینرفتن پردازش تخصصی دانست. مزیت احتمالی، سادهترشدن معماری بیرونی و یادگیری مشترکتر بازنماییهاست.
چرا 10^22 FLOPs آستانه اثباتشده نیست
نقطه تلاقی پیشبینیشده در حدود 10^22 FLOPs خارج از محدوده اندازهگیریشده قرار دارد. در مقیاسهای واقعاً آزمایششده، مدلهای بدون رمزگذار همچنان برای هدف چندوجهی کمبازدهترند و امتیازهای پایینتری در ارزیابیهای پاییندستی دارند. برازش قوانین مقیاسپذیری نیز ممکن است با تغییر داده، دستور آموزش، خانواده مدل یا معیارهای ارزیابی جابهجا شود.
برای تیمهایی که امروز باید درباره معماری یا بودجه آموزش تصمیم بگیرند، شواهد اندازهگیریشده هنوز به نفع رمزگذار بصری ازپیشآموزشدیده است، بهویژه وقتی بهرهوری محاسباتی اولویت دارد. این پیشبینی بیشتر برای طراحی آزمایشهای بعدی مفید است تا توجیه یک مهاجرت فوری.
برداشت Aipolix این است که این پژوهش مسئله مدل چندوجهی بدون رمزگذار را به مسئله تخصیص محاسبات تبدیل میکند. اگر آزمایشهای بزرگتر واقعاً نقطه تلاقی را نشان دهند، رمزگشاهای یکپارچه در مقیاسهای مرزی جذابتر میشوند. اگر این نقطه در دستورهای آموزشی دیگر جابهجا شود، رمزگذارهای تخصصی میتوانند مدت بیشتری مزیت خود را حفظ کنند.
چه چیزی باید در ادامه بررسی شود
قویترین تأیید، یک آموزش کنترلشده در مقیاس بزرگتر است که واقعاً از نقطه پیشبینیشده عبور کند و در عین حال داده، بهینهسازی و ارزیابیهای قابلمقایسه داشته باشد. تکرار نتیجه در خانوادههای مدل دیگر نیز مشخص میکند که این رفتار عمومی است یا به همین طراحی آزمایشی محدود میشود.
تا آن زمان، این مقاله یک نشانه معماری ارزشمند ارائه میکند، نه یک قاعده قطعی. پژوهش احتمال میدهد وابستگی امروز به رمزگذار بصری تا حدی نتیجه اقتصاد محاسبات فعلی باشد، اما همزمان نشان میدهد معماری بدون رمزگذار هنوز در شواهد اندازهگیریشده برتری کارایی به دست نیاورده است.
منابع
https://arxiv.org/abs/2609.35457
https://huggingface.co/papers/2609.35457