FLEET نمونهگیری تکراری LLM را به جستوجوی حافظهمحور تبدیل میکند
FLEET با استفاده از حافظه در decoding، بهبود LiveCodeBench و حدود ۳ برابر بهرهوری نمونهگیری را گزارش میکند؛ با محدودیتهای مهم در استقرار.
FLEET با استفاده از حافظه در decoding، بهبود LiveCodeBench و حدود ۳ برابر بهرهوری نمونهگیری را گزارش میکند؛ با محدودیتهای مهم در استقرار.
Home، Code، Autopilot و Managed Runtime معماری Copilot را به لایهای برای اجرای عاملهای ماندگار و نرمافزار سازمانی تبدیل میکنند.
Routines اجرای زمانبندیشده و رویدادمحور عاملها را با مدیریت هویت، تاریخچه اجرا و ادامه کار در Foundry فراهم میکند.
Rollouts و Security Review عاملهای Cursor را از pull request به پایش سلامت استقرار و بازبینی امنیتی میبرند.
AIDE² در یک آزمایش هشتروزه کد پیرامونی عامل پژوهشی خود را تغییر داد و نسخههای بهتر را با ارزیابیهای پنهان انتخاب کرد؛ محدودیت اصلی همچنان کیفیت همین مرز ارزیابی است.
Anthropic میگوید عاملهای Claude یک سامانه آنزیمی ناشناخته را در داده DNA پیدا کردهاند؛ آزمایش اولیه امیدوارکننده است اما کارکرد ART هنوز مشخص نیست.
DeepSeek Harness در 0.1.7 افزونهها را در زمان اجرا ترکیبپذیرتر کرده است؛ Aipolix پیامدهای عملی این معماری را بررسی میکند.
اختلاف قیمت Sol و Luna معماری چندمدلی را مهمتر کرده است. Aipolix هزینه مأموریت کامل، زمینه بلند و اقامت داده را بررسی میکند.
Opus 5.5 قیمت توکن و حافظه نهان را کاهش داده و بعضی درخواستهای حساس را به مسیر دیگری میفرستد؛ پیامد آن برای ارزیابی عاملها چیست؟
تعرفه پایه Grok 4.7 ثابت است، اما مصرف بیشتر توکن خروجی و قیمتگذاری متفاوت متنهای طولانی میتواند هزینه نهایی کار را تغییر دهد.