ایمنی و اخلاق
-
عاملهای هوشمند
آسیبپذیری Plugin4Shell نشان داد افزونهٔ تأییدشده هم ممکن است با کد دیگری نصب شود
بررسی دقیق Plugin4Shell، وضعیت اصلاح Claude Code و Codex، ابهامهای Copilot و Gemini CLI و راه بررسی کد واقعی افزونهها.
-
حکمرانی هوش مصنوعی
اوپنایآی از شش رفتار مسئلهساز مدلهایش پرده برداشت؛ تصمیم انتشار گزارشها همچنان داخلی است
اوپنایآی شش نمونه از رفتار مسئلهساز مدلهای خود را منتشر کرده است. این گزارشها درباره دستورهای پنهان در خلاصهها، انتقال اطلاعات و نظارت بر عاملها چه میگویند؟
-
پژوهش
K-Bench نشان میدهد «فراموشسازی» عامل میتواند نشتی داده را پشت پاسخ نهایی پنهان کند
K-Bench نشان میدهد آزمون پاسخ نهایی میتواند دادهای را که در بازیابی، ابزارها یا وضعیت اجرای عامل باقی مانده نبیند.
-
حکمرانی هوش مصنوعی
Anthropic ارزیابان مستقل را وارد فرایندهای داخلی ایمنی مدل میکند
Anthropic برای ارزیابان بیرونی دسترسی مداوم شبیه تیمهای داخلی ریسک در نظر گرفته است؛ گامی مهم برای راستیآزمایی که هنوز استاندارد مشترک ممیزی نیست.
-
عاملهای هوشمند
ماجرای RubyGems نشان میدهد انتشار بسته چگونه میتواند به مسیر اجرای عامل تبدیل شود
حادثه RubyGems نشان میدهد امنیت عاملها باید انتشار بسته، ساخت خودکار و مسیرهای غیرمستقیم نوشتن و اجرا را نیز جزو سطح دسترسی واقعی حساب کند.
-
پژوهش
GuardedAct اختیار اجرای اصلاحات زیرساختی را از مدل جدا میکند
GuardedAct نشان میدهد چگونه میتوان اقدام پیشنهادی مدل را پیش از تغییر زیرساخت واقعی در محیط شبیهسازی و با کنترل مستقل ارزیابی کرد.
-
پژوهش
RAG-Safety-Bench نشان میدهد ایمنی مدل با اضافه شدن بازیابی تضمینشده نیست
RAG-Safety-Bench نشان میدهد ایمنی مدل پایه لزوماً به سامانه RAG منتقل نمیشود و آزمون باید خودِ فرایند بازیابی و زمینه ورودی را هم پوشش دهد.
-
پژوهش
DeFiFlowBench: فرایند بهظاهر درستِ عامل هم میتواند به معاملهای ناایمن برسد
DeFiFlowBench نشان میدهد فرایند DeFi با ساختار درست هم میتواند معامله پرریسک اجرا کند و کنترل نهایی باید مستقل از تولیدکننده باشد.
-
پژوهش
EBL-Core میان تأیید سیاستی عامل و اختیار واقعی اجرا مرز میگذارد
EBL-Core پیشنهاد میکند اختیار اجرای عملیات پرخطر عاملهای هوش مصنوعی در لحظه استفاده با عمل، سیاست، شواهد و شرایط فعلی دوباره تطبیق داده شود.
-
پژوهش
پژوهش تازه: حذف قواعد اختیار از حافظه عاملها به عبور از محدوده مجاز انجامید
پژوهش Tencent Zhuque نشان میدهد حذف قواعد اختیار هنگام مدیریت حافظه میتواند عاملها را از محدوده مجاز خارج کند؛ نه صرفاً کوتاه شدن متن.