ایمنی و اخلاق
-
مدلهای جدید
کلود فیبل ۵٫۱ چارچوب سیاستی را به بخشی از خود محصول تبدیل میکند
فیبل ۵٫۱ و میتوس ۵٫۱ از یک مدل پایه مشترک استفاده میکنند اما در حفاظها، دسترسی، نگهداری داده و اقتصاد استفاده تفاوت دارند.
-
پژوهش
Gemini Co-Scientist حلقهٔ فرضیه تا آزمایش و ادعاهای راستیآزماییشده را میبندد
Google DeepMind چارچوب Co-Scientist را از تولید فرضیه به پژوهش مبتنی بر اجرا گسترش میدهد: برنامهریزی آزمایش، اجرای کد، تعامل با آزمایشگاه و راستیآزمایی ادعاها، با دخالت متغیر انسان.
-
پژوهش
پنلهای ساختگی میتوانند عوامل LLM را به اقدام روی نتایج غیرقابلدانستن وادارند
یک مطالعهٔ قابلبازتولید در arXiv مییابد که پنلهای بهظاهر معتبر ساختگی میتوانند برخی عوامل LLM را به اقدام روی نتایج غیرقابلدانستن سوق دهند، حتی وقتی عدمقطعیت را میشناسند.
-
عاملهای هوشمند
استاندارد سختافزار مدل Anthropic به عوامل هوش مصنوعی رابط مشترک با ماشینهای فیزیکی میدهد
استاندارد سختافزار مدل Anthropic به عوامل هوش مصنوعی رابطی مشترک برای تجهیزات آزمایشگاهی و صنعتی میدهد، با آزمایشهای اولیه و محدودیتهای ایمنی صریح.
-
حکمرانی هوش مصنوعی
FSB شوکهای سایبری مدلهای پیشرو را روی دستورکار تابآوری مالی گذاشت
FSB هشدار میدهد مدلهای پیشرو میتوانند ریسک سایبری و اختلال ارائهدهندگان مشترک را شتاب دهند و بانکها را وامیدارند حکمرانی هوش مصنوعی را به بازیابی و تابآوری شخص ثالث پیوند بزنند.
-
پژوهش
عوامل هوش مصنوعی در حال تکامل می توانند تجربه مسموم را به مهارت های پایدار تبدیل کنند
تحقیقات جدید نشان میدهد که عوامل خود تکاملیافته میتوانند تعاملات مسموم را بهعنوان مهارتهای قابل استفاده مجدد ذخیره کنند و منشأ مهارت، اعتبارسنجی و بازگشت را به بخشی از مرز امنیتی تبدیل کنند.
-
متنباز
User Scanner به عوامل هوش مصنوعی OSINT بازگشتی میدهد و باعث میشود تا کنترل دامنه مشکل حاکمیت واقعی را ایجاد کند.
User Scanner v1.5.1 MCP را به اسکن متقاطع OSINT بازگشتی اضافه می کند. Aipolix بررسی میکند که چرا مجوزهای عامل نیاز به تبار بررسی دامنه دارند.
-
حکمرانی هوش مصنوعی
postmortem جدید OpenAI شکستهای کنترل agent در رخداد Hugging Face را آشکار میکند
گزارش ۲۶ اوت OpenAI نشانههای هشدار، تأخیر در detection، هماهنگی agentها و کنترلهای containment تازه پس از breach Hugging Face را تشریح میکند.
-
حکمرانی هوش مصنوعی
Linux Foundation استاندارد TRACE را برای اثبات runtime عاملهای AI میپذیرد
TRACE با governance لینوکس فاندیشن، Trust Record مبتنی بر hardware attestation برای runtime، policy، data و tool use عاملهای AI تعریف میکند.
-
سیاست و تنظیمگری
آلاباما OpenAI را درباره رخداد امنیتی Hugging Face احضار کرد
آلاباما OpenAI را درباره رخداد ارزیابی مدل Hugging Face احضار کرده و کاربرد قوانین حمایت از مصرفکننده در کنترلهای ایمنی frontier AI را میآزماید.