A OpenAI tornou pública uma vasta coleção de resultados matemáticos produzidos por um modelo interno de fronteira que ainda não está disponível ao público. O repositório aberto reúne 722 manuscritos organizados em 372 famílias de resultados relacionados e cobre várias áreas da matemática. Segundo a empresa, esta iniciativa surgiu depois de as avaliações matemáticas existentes começarem a deixar de distinguir adequadamente o desempenho dos seus modelos, levando a equipa a testar problemas de investigação em aberto.
O material disponibilizado vai além dos manuscritos finais. O repositório inclui ficheiros fonte, um catálogo de formalizações em Lean, dez resumos abreviados do raciocínio do modelo e informação sobre o processo de produção. A OpenAI afirma ter apresentado aproximadamente 4.000 problemas ao sistema e diz que a maioria dos resultados aceites seguiu um procedimento comum. Em média, cada resultado publicado terá consumido computação equivalente a cerca de três horas de ChatGPT Pro em modo de raciocínio. A empresa identifica também algumas exceções em que o procedimento foi diferente.
A dimensão da coleção não significa, contudo, que toda a matemática esteja validada. O próprio repositório da OpenAI avisa que os trabalhos se encontram em diferentes fases de verificação, que nem todos possuem formalização em Lean e que alguns resultados não formalizados podem conter problemas. A verificação formal pode confirmar uma demonstração dentro de um sistema definido, mas a novidade, relevância e correção global de centenas de resultados continuam a exigir análise por especialistas.
O Advisory Group on Mathematics and Artificial Intelligence, independente da OpenAI, classificou a publicação como um acontecimento importante, mas salientou que o seu papel consultivo não constitui uma aprovação dos resultados nem do processo seguido pela empresa. Para o grupo, tornar o material público é apenas o início do processo de compreensão e incorporação destes resultados no conhecimento matemático.
A principal implicação é metodológica. A avaliação de modelos avançados começa a passar de benchmarks fechados para tentativas de produzir novo conhecimento científico. Nesse cenário, a capacidade de verificar, rever e contextualizar resultados pode tornar-se tão importante como a capacidade de os gerar. A conclusão segura, por enquanto, é que o modelo interno produziu um volume invulgar de investigação matemática candidata, parte formalmente verificada e parte ainda dependente de validação humana.