OpenAI مجموعه بزرگی از نتایج ریاضی تولیدشده توسط یک مدل مرزی داخلی را عمومی کرده است؛ مدلی که هنوز در اختیار کاربران قرار نگرفته است. مخزن عمومی این پروژه ۷۲۲ دستنوشته را در ۳۷۲ خانواده از نتایج مرتبط گردآوری میکند و حوزههای مختلف ریاضی را پوشش میدهد. به گفته شرکت، پس از آنکه ارزیابیهای موجود ریاضی دیگر برای تفکیک توانایی مدلهای جدید کافی نبودند، آزمایش روی مسائل باز پژوهشی گسترش یافت.
محتوای منتشرشده فقط شامل مقالهها نیست. فایلهای منبع، فهرستی از رسمیسازیها با Lean، ده خلاصه کوتاه از فرایند استدلال مدل و اطلاعاتی درباره نحوه تولید نتایج نیز در دسترس است. OpenAI میگوید حدود ۴۰۰۰ مسئله به مدل داده شده و بیشتر نتایج پذیرفتهشده با یک روش ثابت تولید شدهاند. بر اساس اعلام شرکت، هر نتیجه بهطور متوسط معادل حدود سه ساعت محاسبات ChatGPT Pro در حالت reasoning مصرف کرده است. برای برخی نتایج نیز روش متفاوتی به کار رفته که در مخزن توضیح داده شده است.
تعداد بالای دستنوشتهها به معنای تأیید نهایی همه نتایج نیست. خود OpenAI در مخزن هشدار میدهد که آثار در مراحل مختلف بررسی قرار دارند، همه آنها رسمیسازی Lean ندارند و بعضی نتایج رسمینشده ممکن است مشکل داشته باشند. اثبات رسمی میتواند سازگاری یک برهان با یک سامانه صوری مشخص را بررسی کند، اما تازگی، اهمیت و صحت کلی صدها ادعای پژوهشی همچنان به ارزیابی متخصصان نیاز دارد.
Advisory Group on Mathematics and Artificial Intelligence که مستقل از OpenAI فعالیت میکند، این انتشار را رویدادی مهم برای ریاضیات دانسته، اما صریحاً گفته است نقش مشورتی آن نباید به معنای تأیید نتایج یا روش OpenAI تلقی شود. این گروه انتشار عمومی را آغاز فرایند فهم و ارزیابی جامعه ریاضی میداند، نه پایان آن.
اهمیت بزرگتر این اتفاق در روش ارزیابی مدلهاست. سنجش مدلهای مرزی از امتیازهای benchmark به سمت تولید دانش علمی پیشنهادی حرکت میکند. در چنین وضعیتی، بررسی صحت، تازگی و اهمیت نتایج میتواند به همان اندازه تولید آنها به یک گلوگاه تبدیل شود. بنابراین نتیجه مطمئن فعلی این است که یک مدل داخلی حجم بسیار بزرگی از پژوهش ریاضی پیشنهادی تولید کرده که بخشی از آن رسمیسازی شده و بخش دیگری هنوز به اعتبارسنجی انسانی نیاز دارد.