پژوهشگران IBM روش تازهای به نام DRACO منتشر کردهاند که یکی از مشکلات مهم آموزش عاملهای طولانیمدت را هدف میگیرد: ممکن است یک عامل دهها اقدام انجام دهد، اما بازخورد اصلی فقط در پایان مسیر به آن برسد. مقاله در ۳ سپتامبر ۲۰۲۶ در arXiv ثبت شده و IBM نیز کد آموزش، ارزیابی و تحلیل را با مجوز Apache-2.0 منتشر کرده است.
نام DRACO از عبارت Distributing Rubric-based Advantage for Credit Optimization میآید. ایده اصلی این است که امتیاز یک اجرای کامل بهطور یکسان روی همه گامها پخش نشود. سامانه با استفاده از معیارهایی که در طول آموزش ساخته میشوند و ارجاعهای داور به گامهای مشخص، سهم هر بخش از مسیر را جداگانه تعیین میکند. مجموع سیگنال یادگیری برای کل مسیر حفظ میشود، اما محل اثر آن تغییر میکند.
وقتی یک امتیاز نهایی برای دهها تصمیم کافی نیست
در عاملهای طولانیمدت، تعیین اینکه کدام تصمیم واقعاً به موفقیت یا شکست منجر شده دشوار است. ممکن است عامل در ابتدای کار اشتباه کند، بعد چند ابزار را درست فراخوانی کند و در آخرین مرحله دوباره شکست بخورد. یک پاسخ صفر یا یک در پایان کار توضیح نمیدهد کدام بخش باید تقویت یا تضعیف شود.
DRACO برای هر مسئله و هر مسیر، مجموعهای از معیارها میسازد، موارد تکراری را حذف میکند و معیارهایی را که بین اجراهای مختلف تفاوتی ایجاد نمیکنند کنار میگذارد. سپس یک داور، مسیر کامل را ارزیابی و مشخص میکند هر معیار به کدام گامها مربوط است. این ارجاعها به وزنهای جداگانه برای گامها تبدیل میشوند و امتیاز GRPO بر همان اساس در طول مسیر توزیع میشود.
نکته مهم این است که DRACO برای این کار یک مدل جداگانه جهت تشخیص سهم هر گام آموزش نمیدهد. توزیع اعتبار با یک رابطه محاسباتی انجام میشود. بنابراین وابستگی تازه، خود فرایند ساخت معیار و داوری است، نه یک مدل یادگرفتهشده دیگر.
نتایج امیدوارکنندهاند، اما یک عدد با هم نمیخواند
در چکیده مقاله آمده است که DRACO در AppWorld نسبت به مدل پایه ۱۵٫۹ امتیاز بهتر عمل کرده و نسبت به GRPO با پاداش واقعی اما پراکنده ۵٫۳ امتیاز بهبود داشته است. چکیده همچنین برای tau-bench، بدون استفاده از داور پیشرفته بیرونی، از بهبود ۵٫۳ امتیازی نسبت به مدل پایه خبر میدهد.
اما README مخزن رسمی IBM برای tau-bench عدد دیگری ثبت کرده است: ۴٫۶ امتیاز. این اختلاف بهخودیخود روش را بیاعتبار نمیکند، ولی مهم است؛ چون کسی که بخواهد پژوهش را بازتولید کند احتمالاً از همین مخزن شروع خواهد کرد.
به همین دلیل Aipolix اعداد عملکرد را فعلاً نتایج گزارششده توسط نویسندگان میداند، نه واقعیتی که مستقلاً تأیید شده باشد. در این بررسی بازتولید مستقلی پیدا نشد و بهتر است اختلاف ۵٫۳ و ۴٫۶ امتیاز نیز از سوی نویسندگان روشن شود.
داور از ابزار ارزیابی به بخشی از حلقه آموزش تبدیل میشود
پیام مهندسی مهمتر DRACO این است که رفتار داور مستقیماً به فرایند بهینهسازی نزدیک میشود. در چند تنظیم آزمایشی، یک مدل بیرونی قدرتمند معیارها را تولید یا ارزیابی میکند. در تنظیمهای دیگر، نسخهای از همان مدلی که در حال آموزش است نقش داور را میگیرد و حتی یک حالت نیازمند توافق سه داوری جداگانه است.
در چنین معماریای تغییر متن دستور داور، نسخه مدل، تنظیمات نمونهگیری یا شیوه ارجاع به گامها میتواند محل توزیع سیگنال یادگیری را عوض کند، حتی اگر امتیاز کلی مسیر تقریباً ثابت بماند. بنابراین تغییر رفتار داور فقط مسئله کیفیت ارزیابی نیست؛ ممکن است مستقیماً روی آنچه مدل یاد میگیرد اثر بگذارد.
برای تیمهایی که چنین روشی را آزمایش میکنند، نسخه داور، دستورهای ارزیابی، منطق ساخت معیار و خروجی ارجاعها باید کنار تنظیمات آموزش ثبت و نسخهبندی شوند. بازتولید یک اجرا فقط با نگه داشتن وزنهای مدل و تنظیمات بهینهساز ممکن نیست.
انتشار کد امکان بررسی واقعی روش را فراهم میکند
مخزن IBM شامل تنظیمات آموزش، اسکریپتهای اجرا، مستندات مسیر محاسبه پاداش، فرمول توزیع اعتبار، ابزارهای ارزیابی AppWorld و tau-bench و کد تحلیل نتایج است. README هشت تنظیم آزمایشی را توضیح میدهد که در منبع پاداش، نوع داور و نحوه پخش امتیاز با هم تفاوت دارند.
بیشتر آزمایشها با Qwen3.6-27B انجام شدهاند و یک تنظیم از Qwen2.5-32B-Instruct استفاده میکند. تنظیم اصلی DRACO معیارهای پویا را با توزیع اعتبار در سطح گام ترکیب میکند. مخزن همچنین میگوید هر تنظیم فقط ۱۰۰ گام آموزش دیده است؛ جزئیاتی که برای سنجش دامنه شواهد اهمیت دارد.
انتشار کد، روش را قابل آزمون میکند اما جای بازتولید مستقل را نمیگیرد. AppWorld و tau-bench محیطهای کنترلشدهاند و عاملهای واقعی میتوانند مسیرهای طولانیتر، خطاهای ابزار متنوعتر و دادههای مشاهدهای ناقصتری داشته باشند.
پیش از استفاده چه چیزی باید آزمایش شود
آزمایش مفید این نیست که فقط ببینیم امتیاز بنچمارک بالا میرود یا نه. بهتر است تیمها ابتدا توزیع یکسان و توزیع گامبهگام اعتبار را با مدل پایه، اجرای عامل و داور تا حد ممکن یکسان مقایسه کنند. سپس بررسی کنند آیا نتیجه با تغییر مدل داور، متن معیارها و نوع وظایف همچنان پایدار میماند.
آزمایش دوم باید روی حساسیت به خطای داور تمرکز کند. چون روش از ارجاعهای داور برای تعیین سهم هر گام استفاده میکند، میتوان بخشی از این ارجاعها را عمداً حذف یا تغییر داد و اثر آن را بر آموزش سنجید. این کار نشان میدهد مدل رفتار واقعی مسئله را یاد گرفته یا بیش از حد به سبک خاص یک داور وابسته شده است.
حتی اگر اعداد مقاله بعد از بازتولید تغییر کنند، ایده معماری DRACO همچنان قابل توجه است: آموزش عاملهای طولانیمدت به زنجیرهای قابل ردیابی از شواهد ارزیابی تا بهینهسازی نیاز دارد. این روش آن زنجیره را آشکار میکند و در عین حال نشان میدهد خود داور باید مانند سایر اجزای مهم مسیر آموزش، نسخهبندی و قابل ممیزی باشد.