پژوهش
-
پژوهش
PatchBench نشان میدهد توقف یک کرش، اثبات رفع آسیبپذیری نیست
PatchBench نشان میدهد بررسی یک ورودی میتواند موفقیت عاملهای اصلاح آسیبپذیری را بیش از واقعیت نشان دهد و بر تأیید مستقل امنیتی و رفتاری تأکید میکند.
-
پژوهش
پژوهش CPE نشان میدهد ساخت اطلاعات زمینهای عاملها خودش یک مرز امنیتی است
پژوهش CPE نشان میدهد اطلاعات کماعتماد میتوانند هنگام ساخت ورودی عامل به سطح اختیار بالاتری برسند و چرا منشأ، دامنه و ماندگاری باید کنترل شوند.
-
پژوهش
CordisBench نشان میدهد کدام تصمیمهای چرخهعمر عامل را باید محاسبه کرد، نه به مدل سپرد
CordisBench نشان میدهد با پیچیدهتر شدن زیرساخت عامل، بعضی پیامدهای چرخهعمر بهتر است بهجای استدلال مدل، پیش از اجرا بهصورت قطعی محاسبه و بررسی شوند.
-
پژوهش
ارزیابهای ارزان میتوانند خطاهای واقعی سامانههای آبشاری هوش مصنوعی را پنهان کنند
پژوهشی تازه نشان میدهد مسیریابی و سنجش کیفیت در سامانه آبشاری مدل نباید بدون مسیر حسابرسی مستقل به همان ارزیاب وابسته باشند.
-
پژوهش
هارنسدِو نشان میدهد عاملهای خودبهبوددهنده به دروازه انتشار نیاز دارند
هارنسدِو نشان میدهد چارچوبهای عاملِ در حال تکامل پیش از ارتقا به اعتبارسنجی پنهان، آزمون اجراکننده، شواهد زمان اجرا و بازگشت نیاز دارند.
-
مدلهای جدید
AMALIA مدل ۹ میلیاردپارامتری پرتغالی اروپایی را با پنجرهٔ 32K و مسیر استقرار محلی عرضه کرد
پروژهٔ پرتغالی AMALIA یک مدل باز ۹ میلیاردپارامتری برای پرتغالی اروپایی منتشر کرده است؛ با پنجرهٔ 32K، آموزش SFT و DPO، منابع ارزیابی عمومی و مسیر محلی از طریق vLLM.
-
پژوهش
Gemini Co-Scientist حلقهٔ فرضیه تا آزمایش و ادعاهای راستیآزماییشده را میبندد
Google DeepMind چارچوب Co-Scientist را از تولید فرضیه به پژوهش مبتنی بر اجرا گسترش میدهد: برنامهریزی آزمایش، اجرای کد، تعامل با آزمایشگاه و راستیآزمایی ادعاها، با دخالت متغیر انسان.
-
پژوهش
پنلهای ساختگی میتوانند عوامل LLM را به اقدام روی نتایج غیرقابلدانستن وادارند
یک مطالعهٔ قابلبازتولید در arXiv مییابد که پنلهای بهظاهر معتبر ساختگی میتوانند برخی عوامل LLM را به اقدام روی نتایج غیرقابلدانستن سوق دهند، حتی وقتی عدمقطعیت را میشناسند.
-
پژوهش
openJiuwen مهار عامل کدنویسی را به لایهٔ سامانهای قابلاندازهگیری تبدیل میکند
openJiuwen یک مهار ترکیبی و سازگار در زمان اجرا برای عامل کدنویسی پیشنهاد میکند و نشان میدهد چرا حسابرسی معیار با مدل همتراز برای مهندسی عامل اهمیت دارد.
-
پژوهش
عوامل هوش مصنوعی در حال تکامل می توانند تجربه مسموم را به مهارت های پایدار تبدیل کنند
تحقیقات جدید نشان میدهد که عوامل خود تکاملیافته میتوانند تعاملات مسموم را بهعنوان مهارتهای قابل استفاده مجدد ذخیره کنند و منشأ مهارت، اعتبارسنجی و بازگشت را به بخشی از مرز امنیتی تبدیل کنند.