ایمنی و اخلاق
-
پژوهش
بهروزرسانی هوکها میتواند مسیری خارج از کنترل مستقیم مدل باز کند
پژوهش HookPry نشان میدهد چرا تغییر هوکهای اجرایی باید مانند تغییر مجوز بررسی شود و با کمترین سطح دسترسی و ثبت منشأ اجرا همراه باشد.
-
پژوهش
نوسان APIهای اشتراکی میتواند تصمیمگیری با ارزیابهای زبانی را بیاعتبار کند
پژوهشی پیشثبتشده نشان میدهد ناپایداری سرویسهای اشتراکی میتواند اعتبار معیارهای سخت مبتنی بر ارزیابهای زبانی را کاهش دهد.
-
پژوهش
PatchBench نشان میدهد توقف یک کرش، اثبات رفع آسیبپذیری نیست
PatchBench نشان میدهد بررسی یک ورودی میتواند موفقیت عاملهای اصلاح آسیبپذیری را بیش از واقعیت نشان دهد و بر تأیید مستقل امنیتی و رفتاری تأکید میکند.
-
پژوهش
پژوهش CPE نشان میدهد ساخت اطلاعات زمینهای عاملها خودش یک مرز امنیتی است
پژوهش CPE نشان میدهد اطلاعات کماعتماد میتوانند هنگام ساخت ورودی عامل به سطح اختیار بالاتری برسند و چرا منشأ، دامنه و ماندگاری باید کنترل شوند.
-
مدلهای جدید
GPT-6 Astra عرضه شد؛ دسترسی مرحلهای و محدودیتهای سایبری بخشی از مدل عملیاتی آن هستند
OpenAI عرضه GPT-6 Astra را با دسترسی مرحلهای، سطح بحرانی توانمندی سایبری و پایش زمان اجرا آغاز کرد.
-
مدلهای جدید
روش تازه Astra ممکن است نظارت بر استدلال مدل را دشوارتر کند
گزارشها میگویند Astra از recurrent depth استفاده میکند؛ روشی که در کنار کنترلهای تازه OpenAI، پرسشهای جدیدی درباره نظارت بر استدلال مدل ایجاد کرده است.
-
عاملهای هوشمند
تأیید Copilot حالا میتواند یکی از شروط ادغام کد در GitHub باشد
GitHub اجازه میدهد تأیید Copilot جزو تأییدهای لازم پیش از ادغام کد باشد؛ قابلیتی که میتوان آن را در سطح سازمان، مخزن و مسیر فایلها محدود کرد.
-
عاملهای هوشمند
GitHub دامنه حذف محتوا در Copilot را گسترش داد، اما این کنترل هنوز سراسری نیست
برنامه Copilot و نسخه خط فرمان آن سیاست حذف محتوا را رعایت میکنند، اما GitHub هنوز برای حالتهای عاملی و برخی فایلسیستمها محدودیت دارد.
-
پژوهش
ارزیابهای ارزان میتوانند خطاهای واقعی سامانههای آبشاری هوش مصنوعی را پنهان کنند
پژوهشی تازه نشان میدهد مسیریابی و سنجش کیفیت در سامانه آبشاری مدل نباید بدون مسیر حسابرسی مستقل به همان ارزیاب وابسته باشند.
-
عاملهای هوشمند
فالکن گاردین امنیت عاملهای هوش مصنوعی را به زمان اجرا میبرد
Falcon گاردین پرامپت و فراخوانی ابزار را به اقدامهای نقطه پایانی متصل میکند و کنترل زمان اجرا را به امنیت عاملهای سازمانی میافزاید.