Recuris با تکامل حافظه، عملکرد agentهای بلندمدت را بهبود میدهد
پژوهشگرانی از NUS، دانشگاه Stanford، دانشگاه Oxford و Princeton معماری Recuris را معرفی کردهاند؛ سیستمی برای agentهای هوش مصنوعی بلندمدت که بدون تغییر مدل زبانی پایه، عملکرد اجرای taskهای چندمرحلهای را بهبود میدهد. در این روش LLM ثابت میماند و چیزی که evolve میشود لایه بیرونی memory-control است؛ لایهای که state تأییدشده task را نگه میدارد، skill مناسب را انتخاب میکند و از failureهای قبلی یاد میگیرد.
این تفاوت مهم است، چون عبارت «recursive self-improvement» ممکن است این تصور را ایجاد کند که مدل وزنهای خودش را بازنویسی میکند. Recuris کار محدودتر و قابلکنترلتری انجام میدهد. Working Memory ثبت میکند چه چیزی انجام شده، چه چیزی هنوز باز است و چه evidenceای آن state را تأیید میکند. Experiential Memory نیز skillهای قابل استفاده مجدد را نگه میدارد. انتخاب skill بر اساس state فعلی و تأییدشده انجام میشود، نه بر اساس کل history مکالمه.
حافظهای که از اجرای واقعی یاد میگیرد
در طول اجرای یک task، Recuris میان Working Memory و Experiential Memory ارتباط برقرار میکند. بعد از هر action یا tool call، یک checker بررسی میکند آیا پاسخ environment واقعاً تغییر پیشنهادی state را تأیید میکند یا نه. بنابراین agent صرفاً به دلیل تلاش برای اجرای یک ابزار یا دریافت تأیید کلامی، یک هدف را complete در نظر نمیگیرد.
در سطح چند task، harness یک trace ساختاریافته از state، skill انتخابشده، action، observation و تصمیم checker ذخیره میکند. سپس یک Meta-Agent ثابت تلاش میکند مشخص کند failure به کدام بخش memory system مربوط بوده و فقط همان قسمت را patch کند. patch جدید تنها زمانی پذیرفته میشود که validation gate ثابت نشان دهد failure را رفع کرده و روی held-out development set regression ایجاد نمیکند. خود مدل پایه، Meta-Agent و outer improvement procedure تغییر نمیکنند.
بهبود محسوس روی benchmarkهای long-horizon
در ارزیابی مقاله روی چهار benchmark بلندمدت و ده مدل، Recuris در ۳۵ مورد از ۳۷ ترکیب کامل مدل و benchmark نرخ موفقیت را افزایش داده است. روی τ²-Retail، GPT-5.6 Sol از ۵۸.۳ درصد به ۷۶.۱ درصد رسیده و Claude Opus 5 از ۷۲.۴ درصد به ۸۷.۹ درصد افزایش یافته است. Qwen3.6-27B نیز روی SkillFlow از ۴۲.۲ به ۵۸.۷ درصد رسیده است.
نویسندگان همچنین گزارش میکنند که مزیت Recuris در interactionهای طولانیتر بیشتر میشود. در طولانیترین گروه taskها، بهبود تا ۳۲.۲ واحد درصد افزایش یافته و برخی failure modeهای رایج long-horizon تا ۸۰ درصد کاهش پیدا کردهاند. در یک آزمایش کنترلشده برای fault localization نیز trace ساختاریافته بسیار بهتر از نتیجه نهایی task توانسته بخش مسئول memory system را مشخص کند.
context بیشتر راهحل نبود
یکی از نتایج مهم برای مهندسی agent این است که قرار دادن skillهای بیشتر در prompt نتیجه بهتری نداد. در یک مقایسه کنترلشده، نگهداشتن کل skill library بهصورت دائمی در context، در اولین فراخوانی ۳۱۱۱ token بیشتر مصرف کرد، ۱۸ واحد ضعیفتر از Recuris عمل کرد و به ازای هر task موفق ۴۶ درصد token بیشتری مصرف کرد.
این نتیجه یک نکته معماری مهم را تقویت میکند: memory مفید با context بزرگ یکی نیست. در agentهای طولانیمدت، مسئله اصلی این است که سیستم بداند در این لحظه چه stateای واقعاً درست است، کدام تجربه به آن state مربوط میشود و دقیقاً چه زمانی باید آن تجربه وارد context شود.
محدودیتهایی که باید جدی گرفت
نتایج امیدوارکنندهاند، اما هنوز خروجی نویسندگان یک preprint تازه در arXiv هستند و replication مستقل لازم است. قویترین مزیتهای cross-task نیز در taskهایی دیده شدهاند که tool، policy یا ساختار مشترک دارند. در Terminal-Bench 2.1 که taskها مستقلترند، cross-task evolution در سیزده دور هیچ patchی را نپذیرفت.
مقاله test-time adaptation را نیز جداگانه روی Terminal-Bench بررسی میکند. با budget برابر چهار attempt، adaptation نرخ solved-within-budget را فقط ۲.۳ واحد افزایش داد و p-value گزارششده 0.774 بود. خود نویسندگان صریحاً میگویند در این sample size اثر memory learning از run-to-run variation جدا نمیشود. بخش اصلی جهش headline در این benchmark از retry بیشتر آمده بود، نه از یادگیری حافظه.
چرا برای مهندسی agent مهم است
Recuris سطح قابلتغییر agent را از وزنهای مدل به harness اطراف مدل منتقل میکند. از نظر عملیاتی این جذاب است، چون تغییرات memory میتوانند محدود، validate، rollback و حتی میان مدلهای مختلف منتقل شوند، بدون اینکه نیاز به retraining مدل پایه باشد.
برای تیمهایی که agentهای long-horizon میسازند، مقاله یک جهت معماری مهم را تقویت میکند: verified state tracking، انتخاب هدفمند skill و bounded memory evolution ممکن است به اندازه انتخاب یک مدل قویتر اهمیت داشته باشند. کد پروژه نیز عمومی شده است و مرحله بعدی روشن است: باید دید آیا این مزایا خارج از benchmark harness نویسندگان و در workflowهای واقعی با toolهای پرخطا، failureهای ناقص و توزیع task متغیر نیز تکرار میشوند یا نه.
Sources
- Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
- Recuris source code
تاریخ انتشار: