پژوهش
بنچمارک TAM ضعف GPT-5 در اجرای فرایندهای طولانی و قانونمحور را نشان میدهد
TAM اجرای دستورالعملهای طولانی را میسنجد؛ GPT-5 در ICD فقط ۱٪ و در محاسبات مجازات ۱۵٫۵٪ پاسخ کاملاً درست داشته است.
TAM اجرای دستورالعملهای طولانی را میسنجد؛ GPT-5 در ICD فقط ۱٪ و در محاسبات مجازات ۱۵٫۵٪ پاسخ کاملاً درست داشته است.