OpenAI مجموعه بزرگی از نتایج ریاضی تولیدشده توسط یک مدل مرزی داخلی را عمومی کرده است؛ مدلی که هنوز در اختیار کاربران قرار نگرفته است. مخزن عمومی این پروژه ۷۲۲ دست‌نوشته را در ۳۷۲ خانواده از نتایج مرتبط گردآوری می‌کند و حوزه‌های مختلف ریاضی را پوشش می‌دهد. به گفته شرکت، پس از آنکه ارزیابی‌های موجود ریاضی دیگر برای تفکیک توانایی مدل‌های جدید کافی نبودند، آزمایش روی مسائل باز پژوهشی گسترش یافت.

محتوای منتشرشده فقط شامل مقاله‌ها نیست. فایل‌های منبع، فهرستی از رسمی‌سازی‌ها با Lean، ده خلاصه کوتاه از فرایند استدلال مدل و اطلاعاتی درباره نحوه تولید نتایج نیز در دسترس است. OpenAI می‌گوید حدود ۴۰۰۰ مسئله به مدل داده شده و بیشتر نتایج پذیرفته‌شده با یک روش ثابت تولید شده‌اند. بر اساس اعلام شرکت، هر نتیجه به‌طور متوسط معادل حدود سه ساعت محاسبات ChatGPT Pro در حالت reasoning مصرف کرده است. برای برخی نتایج نیز روش متفاوتی به کار رفته که در مخزن توضیح داده شده است.

تعداد بالای دست‌نوشته‌ها به معنای تأیید نهایی همه نتایج نیست. خود OpenAI در مخزن هشدار می‌دهد که آثار در مراحل مختلف بررسی قرار دارند، همه آن‌ها رسمی‌سازی Lean ندارند و بعضی نتایج رسمی‌نشده ممکن است مشکل داشته باشند. اثبات رسمی می‌تواند سازگاری یک برهان با یک سامانه صوری مشخص را بررسی کند، اما تازگی، اهمیت و صحت کلی صدها ادعای پژوهشی همچنان به ارزیابی متخصصان نیاز دارد.

Advisory Group on Mathematics and Artificial Intelligence که مستقل از OpenAI فعالیت می‌کند، این انتشار را رویدادی مهم برای ریاضیات دانسته، اما صریحاً گفته است نقش مشورتی آن نباید به معنای تأیید نتایج یا روش OpenAI تلقی شود. این گروه انتشار عمومی را آغاز فرایند فهم و ارزیابی جامعه ریاضی می‌داند، نه پایان آن.

اهمیت بزرگ‌تر این اتفاق در روش ارزیابی مدل‌هاست. سنجش مدل‌های مرزی از امتیازهای benchmark به سمت تولید دانش علمی پیشنهادی حرکت می‌کند. در چنین وضعیتی، بررسی صحت، تازگی و اهمیت نتایج می‌تواند به همان اندازه تولید آن‌ها به یک گلوگاه تبدیل شود. بنابراین نتیجه مطمئن فعلی این است که یک مدل داخلی حجم بسیار بزرگی از پژوهش ریاضی پیشنهادی تولید کرده که بخشی از آن رسمی‌سازی شده و بخش دیگری هنوز به اعتبارسنجی انسانی نیاز دارد.

منابع