پژوهش
K-Bench نشان میدهد «فراموشسازی» عامل میتواند نشتی داده را پشت پاسخ نهایی پنهان کند
K-Bench نشان میدهد آزمون پاسخ نهایی میتواند دادهای را که در بازیابی، ابزارها یا وضعیت اجرای عامل باقی مانده نبیند.
K-Bench نشان میدهد آزمون پاسخ نهایی میتواند دادهای را که در بازیابی، ابزارها یا وضعیت اجرای عامل باقی مانده نبیند.
TAM اجرای دستورالعملهای طولانی را میسنجد؛ GPT-5 در ICD فقط ۱٪ و در محاسبات مجازات ۱۵٫۵٪ پاسخ کاملاً درست داشته است.