Ant Ling شش checkpoint از Ling 3.0 را برای آموزش LLM سفارشی باز کرد
تیم Ant Ling از Ant Group شش checkpoint مدل پایه از خانواده Ling 3.0 را منتشر کرده است. توسعهدهندگان اکنون علاوه بر وزنهای نهایی پایه Ling-3.0-tiny و Ling-3.0-flash، به مراحل میانی فرایند آموزش نیز دسترسی دارند. انتشار ۲۰ اوت فراتر از یک بارگذاری معمول مدل است، زیرا چند نقطه از مسیر آموزش را آشکار میکند و به پژوهشگران و تیمهای مهندسی اجازه میدهد نقطه شروع مناسبتری برای ادامه pretraining، fine-tuning یا آزمایش رفتار مدل انتخاب کنند.
این انتشار دو اندازه مدل و سه مرحله آموزشی برای هرکدام را پوشش میدهد. Ling-3.0-tiny در مجموع ۷.۹ میلیارد پارامتر و حدود ۱.۳ میلیارد پارامتر فعال دارد، در حالی که Ling-3.0-flash دارای ۱۲۴ میلیارد پارامتر کل و حدود ۵.۱ میلیارد پارامتر فعال است. برای هر دو اندازه، checkpointهای pretrained، mid-trained و WSM-merged در دسترس قرار گرفتهاند. گزارشهای مستقل چینی نیز تأیید میکنند که با شش artifact مجزا روبهرو هستیم.
این تمایز مهم است، چون اینها checkpointهای پایه هستند نه دستیارهای گفتوگویی آماده. آنها post-training معمول برای تبدیل مدل pretrained به محصول instruction-following را طی نکردهاند. بنابراین ارزش انتشار را نباید با این پرسش سنجید که آیا فوراً جای یک دستیار میزبانیشده را میگیرد یا نه. ارزش اصلی در مواد آموزشی و امکان مشاهده تغییر یک مدل MoE در مراحل مختلف پیش از instruction tuning و reinforcement learning است.
دو اندازه برای بودجههای آزمایشی متفاوت مناسباند. ۱.۳ میلیارد پارامتر فعال مدل tiny آن را به نقطه شروع معقولی برای پژوهش محدود، سازگارسازی دامنهای و آزمایشهایی با تکرارهای آموزشی زیاد تبدیل میکند. مدل flash ظرفیت کل بسیار بزرگتری دارد اما در هر token تنها حدود ۵.۱ میلیارد پارامتر را فعال میکند. Ant Ling این معماری sparse را راهی برای ترکیب ظرفیت بالا با محاسبات استنتاج کمتر نسبت به مدل dense هماندازه معرفی میکند.
طبق مستندات فنی Ant Ling، خانواده Ling 3.0 از معماری native hybrid linear و Kimi Delta Attention استفاده میکند. شرکت میگوید نسخه instruction مدل flash دارای context بومی 256K است که تا یک میلیون token قابل گسترش است و برای tool use و وظایف طولانی طراحی شده است. این قابلیتهای محصولی را نباید خودکار به تمام checkpointهای پایه جدید نسبت داد، اما زمینه معماری آنها را روشن میکند.
برای تیمهای عملیاتی، مهمترین بخش دسترسی به وزنهای میانی است. بیشتر انتشارهای تجاری فقط یک API یا یک checkpoint نهایی ارائه میکنند و مطالعه نحوه شکلگیری قابلیتها، بازنماییها و failure modeها در طول آموزش دشوار میشود. انتشار مراحل pretrained، mid-trained و merged امکان مقایسه رفتار پیش از post-training و انتخاب checkpoint متناسبتر با هدف downstream را فراهم میکند.
این کار میتواند هزینه تخصصیسازی را نیز کاهش دهد. تیمی که مدل مخصوص کدنویسی، مالی، علمی یا یک حوزه تخصصی میسازد لزوماً نیاز ندارد کل مسیر pretraining را تکرار کند. شروع از یک checkpoint میانی یا نهایی اجازه میدهد بودجه محاسباتی روی ادامه pretraining با داده اختصاصی، supervised fine-tuning یا reinforcement learning متمرکز شود. نقطه شروع مناسب به دامنه، توزیع داده و میزان تغییر رفتاری موردنظر بستگی دارد.
شفافیت مدل پایه یک مزیت governance هم دارد. سازمانهایی که سیستمهای open-weight را ارزیابی میکنند باید provenance، مجوز، lineage مدل و مرز میان pretraining و post-training را بفهمند. checkpointهای نامگذاریشده بررسی این lineage را آسانتر میکنند و میتوانند برای مطالعه تغییر رفتارهای مرتبط با ایمنی در مراحل مختلف استفاده شوند، هرچند خود انتشار ثابت نمیکند مدلها ایمنتر یا تفسیرپذیرتر شدهاند.
مجوز نیازمند دقت است. metadata مخازن عمومی و گزارشها artifactهای Ling 3.0 را MIT معرفی میکنند و Ant Ling خانواده را open source مینامد. با این حال تیمهای production باید فایل مجوز و شرایط dependencyها را برای همان revision و runtime دقیق بررسی کنند. بررسی قبلی یک مخزن Ling-3.0-tiny نشان داده بود MIT در metadata ذکر شده ولی در آن لحظه فایل مستقل license دیده نمیشد؛ جزئیات packaging ممکن است تغییر کند.
ادعاهای عملکردی نیز باید محتاطانه خوانده شوند. Ant Ling برای Ling-3.0-flash از بهرهوری، پایداری tool calling و throughput بالا صحبت میکند. این اعداد هدف طراحی را نشان میدهند اما benchmark مستقل شش checkpoint پایه جدید نیستند. مدل پایه پس از fine-tuning، quantization و اجرا روی inference engineهای مختلف میتواند رفتار متفاوتی داشته باشد، بنابراین تیمها باید artifact و serving stack واقعی خود را benchmark کنند.
اهمیت گستردهتر این است که رقابت open-weight دیگر فقط انتشار وزن نهایی نیست. سازندگان مدل بر سر recipe آموزشی، artifactهای میانی، بهرهوری inference و امکان ادامه آموزش توسط تیم downstream رقابت میکنند. برای سازمانی که کنترل بیشتری روی مدل میخواهد، دسترسی به checkpointهای زودتر ممکن است از چند امتیاز leaderboard ارزشمندتر باشد، چون امکان شکلدادن مدل حول داده اختصاصی و محدودیتهای عملیاتی را فراهم میکند.
انتشار Ant Ling سختیهای ساخت LLM تخصصی را حذف نمیکند. ادامه pretraining همچنان به data curation دقیق، تخصص distributed training، زیرساخت evaluation و برنامه safety و alignment نیاز دارد. معماری sparse نیز ملاحظات serving و tooling خاص خود را دارد. بنابراین شش checkpoint باید آزادی مهندسی بیشتر تلقی شوند نه یک مدل enterprise آماده استفاده.
گام بعدی مهم، نحوه استفاده جامعه پژوهشی از checkpointهای میانی است. مقایسه سه مرحله میتواند نشان دهد رفتار long-context، توان کدنویسی، دانش factual یا گرایشهای نامطلوب در کدام بخش آموزش بیشتر تغییر میکنند. ارزیابیهای بازتولیدپذیر از نسخههای quantized و runtimeهای رایج نیز مشخص خواهد کرد آیا تعداد کم پارامتر فعال خارج از زیرساخت Ant Ling واقعاً مزیت هزینهای ایجاد میکند. برای تیمهای LLM فرصت فوری روشن است: Ling 3.0 اکنون چند نقطه ورود به pipeline آموزش ارائه میدهد، نه فقط یک مدل پایه نهایی.
تاریخ انتشار: