Investigação
Benchmark TAM expõe limites do GPT-5 na execução de procedimentos longos e regulados
No TAM, configurações GPT-5 atingiram 1% de correspondência exata em ICD e 15,5% nos cálculos de pena.
No TAM, configurações GPT-5 atingiram 1% de correspondência exata em ICD e 15,5% nos cálculos de pena.