عوامل هوش مصنوعی خود تکاملی برای بهبود با تبدیل تعاملات گذشته به مهارت های قابل استفاده مجدد طراحی شده اند. یک مقاله تحقیقاتی جدید نشان میدهد که چرا این قابلیت یک مشکل امنیتی متفاوت ایجاد میکند: یک تعامل مسموم میتواند به یک قابلیت ذخیره شده تبدیل شود که بعداً دوباره بازیابی میشود، حتی زمانی که درخواست کاربر آینده خوشخیم به نظر برسد.
نویسندگان EvoSkill Injection یک مدل تهدید برای این شکست تعریف میکنند و SARGE را معرفی میکنند، یک چارچوب ترکیبی چند عامله که تلاش میکند عوامل خود تکاملیافته را وادار به تولید، تشدید و تقویت مهارتهای مخرب کند. مفهوم مهم معماری گسترده تر از نرخ حمله گزارش شده است. هنگامی که یک عامل رفتار اجرایی را در یک فروشگاه مهارت مداوم می نویسد، آن ذخیره به بخشی از مرز امنیتی تبدیل می شود.
هدف حمله، یادگیری است، نه تنها پاسخ فعلی
تزریق سریع مرسوم و آزمایش جیلبریک معمولاً این سؤال را مطرح میکند که آیا مهاجم میتواند مدلی را وادار به تولید یا اجرای چیزی ناامن کند یا خیر. EvoSkill Injection مکانیسمی با عمر طولانیتر را هدف قرار میدهد. مهاجم یک مسیر تعامل متخاصم را فراهم می کند و سپس رفتار حاصل را به عنوان یک تجربه موفق که باید ذخیره و مجددا استفاده شود، قاب بندی می کند.
این مقاله سه سیستم خود-تکامل، AutoSkill، Voyager و ExpeL را ارزیابی میکند. SARGE از یک ارکستراتور، عوامل حمله و یک قاضی برای آزمایش سه مرحله استفاده می کند: ایجاد یک مهارت مخرب، افزایش یک مهارت موجود و تقویت یک مهارت به طوری که عامل با آن به عنوان یک رفتار ترجیحی برخورد کند. سپس از یک جلسه جدید برای بررسی اینکه آیا قابلیت ذخیره شده باقی می ماند و دوباره فعال می شود یا خیر استفاده می شود.
نویسندگان نرخ موفقیت حمله pass@4 را 43.5% برای تولید، 54.6% برای تشدید و 49.9% برای تقویت در راه اندازی AutoSkill مبتنی بر GPT-4o-mini گزارش کرده اند. این اعداد نتایج تحقیقاتی هستند، نه نرخ تولید ثابت، اما مکانیسمی را که مقاله سعی دارد جداسازی کند را نشان می دهد.
پایداری مرز کنترل را تغییر می دهد
یافتههای مهمتر این است که بعد از حمله چه اتفاقی میافتد. در EvoSkillSafetyBench این مقاله، نرخ پاسخ مضر گزارش شده برای AutoSkill از 6.5% در شرایط تمیز به 19.2% پس از حمله افزایش یافت. Voyager از 5.5% به 32.5% افزایش یافت در حالی که ExpeL از 8.8% به 15.2% رسید. نویسندگان همچنین افزایش در چندین ستون فقرات مدل را گزارش کردند.
برای تیم های مهندسی، این نشان می دهد که یک بانک مهارت نباید مانند یک حافظه پنهان معمولی از زمینه مفید رفتار شود. به حالت پایدار قابل اجرا نزدیکتر است. یک مهارت میتواند الگوهای استفاده از ابزار، اقدامات مبتنی بر کد یا رویههای تصمیمگیری را رمزگذاری کند و تأثیر آن میتواند از تعاملی که آن را ایجاد کرده است، زنده بماند.
که حداقل مدل حکمرانی را تغییر می دهد. یک سیستم تولیدی باید بداند که یک مهارت از کجا آمده است، کدام تعامل باعث ایجاد آن شده، چه نسخه خطمشی آن را تأیید کرده است، چه مجوزهایی را میتواند اعمال کند، کدام نماینده یا مستاجر میتواند آن را بازیابی کند و چگونه میتوان آن را غیرفعال یا بازگرداند. بدون آن منشأ، یک لایه بهینه سازی ظاهرا مفید می تواند به یک مسیر بادوام برای تقویت امتیاز تبدیل شود.
نرده های محافظ خروجی نمی توانند وضعیت خراب را تعمیر کنند
این مقاله دفاع های سبک وزن را بر اساس درخواست های تأیید مهارت و حل تعارض آزمایش می کند. نویسندگان میگویند این اقدامات پاسخهای مضر را کاهش میدهد، اما امتناع را افزایش میدهد و مانع از تولید، ذخیره یا تکامل مهارتهای مخرب نمیشود.
این تمایز مهم است. یک فیلتر پاسخ میتواند از آشکار شدن یک قابلیت ذخیره شده در یک نوبت بدون حذف خود قابلیت جلوگیری کند. مدل بعدی، مسیر ابزار یا شرایط بازیابی ممکن است همان مهارت مسموم شده را به طور متفاوتی فعال کند. به عبارت دیگر، ایمنی خروجی و یکپارچگی حالت مشکلات جداگانه ای هستند.
بنابراین یک طراحی قوی تر به کنترل هایی در مرز نوشتن نیاز دارد. ایجاد مهارت و بهروزرسانی باید قبل از تداوم بررسی شود، مهارتهای پرخطر ممکن است به تأیید قطعی یا تأیید انسانی نیاز داشته باشند، و مهارتهای ذخیرهشده باید دارای منشأ و نسخههای تغییرناپذیر باشند. بازیابی همچنین به کنترلهای دامنه نیاز دارد تا مهارتی که در یک کار آموخته میشود نتواند در سکوت اختیاری را در کار دیگر کسب کند.
خود-بهبودی یک زنجیره تامین در داخل عامل ایجاد می کند
امنیت زنجیره تامین نرمافزار سنتی قبل از ورود به سیستم میپرسد کد و وابستگیها از کجا آمدهاند. عوامل خود تکاملیافته زنجیره تأمین کوچکتری را در زمان اجرا ایجاد میکنند: تعاملات به تجربیات نامزد تبدیل میشوند، تجربیات به مهارتها تبدیل میشوند و مهارتها بعداً بر اقدامات تأثیر میگذارند.
مدل تهدید مقاله مفید است زیرا انتقال از تجربه به قابلیت قابل استفاده مجدد را به عنوان یک مرحله ساخت حساس به امنیت شناسایی می کند. تیمهایی که قبلاً مهارتهای شخص ثالث یا سرورهای MCP را اسکن میکنند، همچنان میتوانند این مسیر را از دست بدهند، اگر مهارتهای تولید شده داخلی بهطور خودکار اعتماد شوند، صرفاً به این دلیل که خود عامل آنها را ایجاد کرده است.
کنترل عملی این است که یادگیری را غیرفعال نکنید. این است که پیشنهاد یک مهارت را از تأیید آن جدا کنید. یک عامل ممکن است یک مهارت نامزد ایجاد کند، اما یک لایه خط مشی متفاوت باید تصمیم بگیرد که آیا می توان آن را ذخیره کرد، چه محدوده ای دریافت می کند و آیا تغییرات بعدی نیاز به اعتبار سنجی مجدد دارد یا خیر.
شواهد مهم اما محدود هستند
این یک نتیجه تحقیق arXiv v1 است و نویسندگان بیان میکنند که این مقاله در EMNLP 2026 پذیرفته شده است. این بر مسیرهای حمله ساخته شده، فراخوانی های مکرر مدل و یک داور مبتنی بر LLM متکی است، و نویسندگان خاطرنشان می کنند که مدل های مهاجم یا قاضی قوی تر می توانند نتایج را تغییر دهند. EvoSkillBench همچنین هشت دسته انتخابی پرخطر را به جای فضای کامل حملات دنیای واقعی پوشش می دهد.
این محدودیتها بدین معناست که درصدهای گزارششده نباید بهعنوان تخمینهایی در مورد اینکه چقدر عوامل تولید به خطر میافتند خوانده شوند. نتیجه قویتر معماری است: سیستمهایی که بهطور مستقل تجربه را به رفتار قابل استفاده مجدد تبدیل میکنند، یک لایه پایداری دارند که میتواند مسموم شود و مکانیسمهای ایمنی باید مستقیماً از آن لایه محافظت کنند.
بنابراین برای تیم هایی که عامل های طولانی مدت می سازند، بررسی امنیتی باید کل چرخه عمر مهارت را شامل شود: تولید، اعتبارسنجی، ذخیره سازی، نسخه سازی، بازیابی، اجرا و حذف. هنگامی که عوامل بتوانند ابزارها و روال های خود را یاد بگیرند، دیگر کنترل کردن آنچه به یاد می آورند کافی نیست. سازمان ها همچنین باید بر آنچه که اجازه دارند تبدیل شوند، حکومت کنند.