پژوهشگران Tencent Hunyuan در یک پیش‌چاپ به یک پرسش معماری مهم برای هوش مصنوعی چندوجهی پرداخته‌اند: در چه مقیاسی ممکن است یک مدل بتواند بینایی را مستقیماً از پیکسل‌ها یاد بگیرد و دیگر به رمزگذار بصری ازپیش‌آموزش‌دیده و جداگانه وابسته نباشد؟ این مطالعه مدل‌های زبانی چندوجهی دارای رمزگذار را با سامانه‌های بدون رمزگذار مقایسه می‌کند. طبق گزارش نویسندگان، روش بدون رمزگذار در مقیاس‌های آزمایش‌شده برای هدف چندوجهی از نظر محاسباتی کم‌بازده‌تر است، اما با افزایش محاسبات آموزشی سریع‌تر بهبود می‌یابد. برازش قوانین مقیاس‌پذیری احتمال نزدیک‌شدن دو روش را در حدود 10^22 FLOPs مطرح می‌کند.

همین نقطه مهم‌ترین نتیجه و هم‌زمان مهم‌ترین محدودیت پژوهش است. پژوهشگران این نقطه تلاقی را مستقیماً مشاهده نکرده‌اند. برآورد آن از ادامه‌دادن روند برازش‌شده به بیرون از محدوده اندازه‌گیری‌شده به دست آمده است؛ بنابراین باید آن را فرضیه‌ای درباره رفتار در مقیاس بزرگ‌تر دانست، نه یک آستانه اثبات‌شده. مقاله نیز هنوز پیش‌چاپ است و نتیجه‌ها به خانواده مدل، داده، روش بهینه‌سازی و ارزیابی‌های همین آزمایش وابسته‌اند.

پرسش معماری چگونه تغییر می‌کند

بسیاری از مدل‌های زبانی چندوجهی از یک رمزگذار بصری ازپیش‌آموزش‌دیده استفاده می‌کنند تا تصویر را به بازنمایی‌ای تبدیل کنند که مدل زبانی بتواند آن را پردازش کند. این ساختار یک پیش‌زمینه بصری قوی فراهم می‌کند و می‌تواند آموزش را کارآمدتر کند، زیرا مدل زبانی مجبور نیست کل فرایند ساخت بازنمایی بصری را از پیکسل خام یاد بگیرد.

در معماری بدون رمزگذار، این بخش تخصصی حذف می‌شود و رمزگشا باید هم‌زمان با زبان و استدلال چندوجهی، بازنمایی بصری مناسب را نیز یاد بگیرد. در آزمایش‌های این پژوهش، مقیاس‌پذیری هدف متنی در دو روش تقریباً مشابه گزارش شده، اما مدل‌های بدون رمزگذار در هدف چندوجهی و در مقیاس‌های کوچک‌تر عقب‌تر هستند. با این حال، منحنی‌های برازش‌شده برای معماری بدون رمزگذار سریع‌تر بهبود می‌یابند.

در نتیجه، تصمیم مهندسی دیگر فقط این نیست که آیا یادگیری چندوجهی بدون رمزگذار ممکن است یا نه. پرسش عملی‌تر این است که آیا سادگی یک معماری یکپارچه در مقیاس‌های واقعی می‌تواند هزینه آموزشی بیشتر آن را جبران کند.

رمزگشا رفتار تخصصی بصری پیدا می‌کند

نویسندگان همچنین تغییرات درونی رمزگشای بدون رمزگذار را بررسی کرده‌اند. آن‌ها گزارش می‌کنند که با افزایش محاسبات، تعامل دوسویه میان توکن‌های بصری مفیدتر می‌شود، پردازش بصری به لایه‌های ابتدایی‌تر منتقل می‌شود و مسیریابی متخصص‌ها برای توکن‌های بصری تمرکز بیشتری پیدا می‌کند.

این مشاهدات با این تفسیر سازگار است که رمزگشا به‌تدریج محاسبات تخصصی‌تری برای بینایی ایجاد می‌کند. برای طراحان سامانه‌های چندوجهی و مدل‌های ترکیب متخصص‌ها، این نکته مهم است: حذف رمزگذار بصری به معنی حذف تخصص بصری نیست. این تخصص ممکن است به درون مدل مشترک منتقل شود و محل تخصیص ظرفیت، مسیریابی و محاسبات را تغییر دهد.

بنابراین، یکپارچه‌شدن معماری را نباید به معنای ازبین‌رفتن پردازش تخصصی دانست. مزیت احتمالی، ساده‌ترشدن معماری بیرونی و یادگیری مشترک‌تر بازنمایی‌هاست.

چرا 10^22 FLOPs آستانه اثبات‌شده نیست

نقطه تلاقی پیش‌بینی‌شده در حدود 10^22 FLOPs خارج از محدوده اندازه‌گیری‌شده قرار دارد. در مقیاس‌های واقعاً آزمایش‌شده، مدل‌های بدون رمزگذار همچنان برای هدف چندوجهی کم‌بازده‌ترند و امتیازهای پایین‌تری در ارزیابی‌های پایین‌دستی دارند. برازش قوانین مقیاس‌پذیری نیز ممکن است با تغییر داده، دستور آموزش، خانواده مدل یا معیارهای ارزیابی جابه‌جا شود.

برای تیم‌هایی که امروز باید درباره معماری یا بودجه آموزش تصمیم بگیرند، شواهد اندازه‌گیری‌شده هنوز به نفع رمزگذار بصری ازپیش‌آموزش‌دیده است، به‌ویژه وقتی بهره‌وری محاسباتی اولویت دارد. این پیش‌بینی بیشتر برای طراحی آزمایش‌های بعدی مفید است تا توجیه یک مهاجرت فوری.

برداشت Aipolix این است که این پژوهش مسئله مدل چندوجهی بدون رمزگذار را به مسئله تخصیص محاسبات تبدیل می‌کند. اگر آزمایش‌های بزرگ‌تر واقعاً نقطه تلاقی را نشان دهند، رمزگشاهای یکپارچه در مقیاس‌های مرزی جذاب‌تر می‌شوند. اگر این نقطه در دستورهای آموزشی دیگر جابه‌جا شود، رمزگذارهای تخصصی می‌توانند مدت بیشتری مزیت خود را حفظ کنند.

چه چیزی باید در ادامه بررسی شود

قوی‌ترین تأیید، یک آموزش کنترل‌شده در مقیاس بزرگ‌تر است که واقعاً از نقطه پیش‌بینی‌شده عبور کند و در عین حال داده، بهینه‌سازی و ارزیابی‌های قابل‌مقایسه داشته باشد. تکرار نتیجه در خانواده‌های مدل دیگر نیز مشخص می‌کند که این رفتار عمومی است یا به همین طراحی آزمایشی محدود می‌شود.

تا آن زمان، این مقاله یک نشانه معماری ارزشمند ارائه می‌کند، نه یک قاعده قطعی. پژوهش احتمال می‌دهد وابستگی امروز به رمزگذار بصری تا حدی نتیجه اقتصاد محاسبات فعلی باشد، اما هم‌زمان نشان می‌دهد معماری بدون رمزگذار هنوز در شواهد اندازه‌گیری‌شده برتری کارایی به دست نیاورده است.

منابع

https://arxiv.org/abs/2609.35457
https://huggingface.co/papers/2609.35457