NVIDIA گزارشی یکپارچه از تخصصیسازی مدلهای Nemotron 3 برای دو مسئله متفاوت منتشر کرده است: برنامهنویسی رقابتی در International Olympiad in Informatics و اثباتهای ریاضی به زبان طبیعی در International Mathematical Olympiad. انتشار ۷ اکتبر مدلها، دادهها، مقالههای پژوهشی و روشهای inference مربوط به سامانههایی را کنار هم قرار میدهد که به گفته NVIDIA از حد نصاب مدال طلای هر دو رقابت ۲۰۲۶ عبور کردهاند.
برای IOI، تیم از supervised fine-tuning و reinforcement learning روی مدلهای تخصصی استفاده کرده است. داده آموزشی شامل ۲۲ هزار مسئله برنامهنویسی و مسیرهای استدلال مصنوعی بوده است. Nemotron-3-Ultra-CC در مجموع ۵۵۰ میلیارد پارامتر و ۵۵ میلیارد پارامتر فعال دارد. NVIDIA این مدلها را با GenCorrect ترکیب کرده؛ چرخهای که راهحل تولید میکند، آنها را ارزیابی میکند و گزینههای بهتر را چند مرحله اصلاح میکند. در اجرای آیندهنگر همزمان با IOI 2026، NVIDIA امتیاز ۵۳۵.۴ از ۶۰۰ را گزارش کرده که بالاتر از حد نصاب طلای ۳۶۱.۱۲ و بهترین امتیاز انسانی ۴۹۸.۲۷ است.
اما این نتیجه با رتبه رسمی تفاوت مهمی دارد. NVIDIA میگوید محدودیتهای زمان، اینترنت و ارسال پاسخ مشابه شرکتکنندگان بوده، ولی آزمون غیررسمی و بدون نظارت بوده و در رتبهبندی رسمی IOI قرار نگرفته است. مقاله پژوهشی مرتبط روش و همین امتیاز را گزارش میکند، اما منشأ ارزیابی همچنان تیم NVIDIA است.
برای IMO، NVIDIA مدلهای SFT و RL را با مدل عمومی در یک فرایند تولید، بررسی و اصلاح اثباتها ترکیب کرده است. شرکت میگوید اثباتهای نهایی توسط داوران رسمی IMO نمرهگذاری شده و سامانه ۳۰ امتیاز از ۴۲ گرفته است؛ حد نصاب طلا ۲۹ بوده است. NVIDIA همچنین checkpointها، دادههای آموزشی، benchmark شامل ۲۰۰ مسئله، promptها و بخشهای مهم pipeline را از طریق Hugging Face و NeMo-Skills منتشر کرده است.
اهمیت پژوهشی کار فقط به دو امتیاز خلاصه نمیشود. این پروژه نشان میدهد ترکیب یک مدل پایه قدرتمند با داده تخصصی، post-training و محاسبات ساختاریافته در زمان inference میتواند یک متخصص دامنه بسازد. انتشار ابزارها بررسی را آسانتر میکند، اما هنوز معادل بازتولید مستقل کامل نیست. بخش IMO یک مؤلفه ارزیابی خارجی قویتر دارد، در حالی که نتیجه IOI باید همچنان بهعنوان benchmark آیندهنگر و گزارششده توسط NVIDIA توصیف شود.