Astra، مدل بعدی OpenAI، فقط بهخاطر تواناییهای بالاتر توجه پژوهشگران ایمنی را جلب نکرده است. گزارش تازهای درباره معماری این مدل نشان میدهد روشی که میتواند قدرت استدلال را افزایش دهد، ممکن است بخشی از فرایند تصمیمگیری مدل را از دید ابزارهای نظارتی دورتر کند.
The Information گزارش داده Astra از روشی به نام «عمق بازگشتی» یا recurrent depth استفاده میکند. در این روش، مدل میتواند پیش از تولید مرحله بعدی پاسخ، اطلاعات را چند بار از همان لایههای داخلی عبور دهد. در نتیجه بخشی از محاسباتی که به پاسخ نهایی میرسد لزوماً به شکل متن قابلخواندن ظاهر نمیشود.
این به معنی غیرقابلنظارت شدن Astra نیست. طبق همان گزارش، OpenAI استفاده از این روش را محدود کرده تا مدل همچنان زنجیره استدلال قابلخواندنی داشته باشد. خود OpenAI نیز گفته Astra با نظارت بیشتر بر زنجیره استدلال عرضه خواهد شد تا رفتارهای خارج از محدوده مجاز سریعتر شناسایی و متوقف شوند.
مسئله اصلی دقیقتر از این است که «Astra شفاف است یا نه». سؤال مهم این است که اگر بخشی از استدلال مدلهای قدرتمندتر به محاسبات داخلی منتقل شود، سامانههای ایمنی تا چه اندازه میتوانند همچنان به متن استدلال مدل تکیه کنند.
عمق بازگشتی بخشی از استدلال را به داخل مدل میبرد
مدلهای استدلالی فعلی معمولاً بخشی از روند حل مسئله خود را به صورت متن تولید میکنند. این متن تصویر کاملی از تمام محاسبات داخلی مدل نیست، اما برای تیمهای ایمنی ارزش دارد. از روی آن میتوان نشانههایی از تلاش برای دور زدن محدودیتها، برنامهریزی مشکوک یا آگاهی مدل از خروج از محدوده مجاز را پیدا کرد.
در recurrent depth، مدل پیش از تولید واژه بعدی میتواند چند بار روی همان وضعیت داخلی کار کند. بنابراین برای انجام محاسبات بیشتر لازم نیست همه مراحل میانی را به زبان طبیعی بیان کند.
The Information میگوید OpenAI این روش را در Astra به شکل محدود به کار گرفته است. TechCrunch و The Verge نیز همین نگرانی را برجسته کردهاند: اگر سهم بیشتری از استدلال به فضای داخلی مدل منتقل شود، نظارت بر زنجیره استدلال میتواند اطلاعات کمتری درباره آنچه واقعاً در حال رخ دادن است ارائه کند.
هنوز نمیتوان گفت این مسئله در Astra تا چه اندازه جدی است. OpenAI توضیح کامل معماری مدل را منتشر نکرده و میگوید زنجیره استدلال Astra همچنان برای نظارت قابل استفاده است. بنابراین میزان واقعی کاهش مشاهدهپذیری هنوز مشخص نیست.
این موضوع برای Astra اهمیت بیشتری دارد
بحث معماری درست زمانی مطرح شده که OpenAI برای عرضه Astra کنترلهای ایمنی قویتری نسبت به مدلهای قبلی در نظر گرفته است.
OpenAI میگوید Astra نخستین مدل این شرکت است که در چارچوب Preparedness Framework به سطح «بحرانی» در تواناییهای امنیت سایبری رسیده است. به گفته شرکت، این مدل با ابزار و دسترسی مناسب میتواند بدون هدایت مرحلهبهمرحله انسان، آسیبپذیریهای ناشناخته را پیدا کند و برای نفوذ به سامانههای مقاوم روشهای عملی بسازد.
OpenAI بخشی از توسعه و عرضه Astra را به تعویق انداخت تا کنترلهای مربوط به سوءاستفاده سایبری و رفتارهای خارج از مجوز را تقویت کند. دسترسی به پیشرفتهترین تواناییهای سایبری نیز در ابتدا محدود خواهد بود.
وقتی مدلی چنین تواناییهایی دارد، کیفیت نظارت دیگر فقط یک موضوع پژوهشی نیست. این کنترلها مستقیماً تعیین میکنند چه چیزی را میتوان با اطمینان در اختیار کاربر قرار داد.
زنجیره استدلال هرگز گزارش کامل ذهن مدل نبوده است
در این بحث یک نکته مهم نباید گم شود. متن استدلال مدل ابزار مفیدی برای بررسی رفتار است، اما هیچگاه گزارش کامل و بینقصی از تمام محاسبات داخلی شبکه عصبی نبوده است.
زنجیره استدلال ممکن است ناقص باشد، بخشی از اطلاعات را جا بیندازد یا حتی توضیحی ارائه دهد که دقیقاً همان فرایندی نباشد که پاسخ را ساخته است. بنابراین یک سامانه ایمنی نباید آن را بهتنهایی معادل گزارش ممیزی در نظر بگیرد.
با این حال، ناقص بودن یک نشانه به معنی بیارزش بودن آن نیست. OpenAI گفته بررسی زنجیره استدلال در تحلیل برخی رفتارهای نامطلوب عاملهای قبلی کمک کرده و برنامه ایمنی Astra نیز صراحتاً بر نظارت بیشتر بر استدلال و عملکرد مدل تکیه دارد.
نگرانی درباره recurrent depth این است که همین نشانه مفید نیز در آینده ضعیفتر شود، اگر بخش بیشتری از تصمیمگیری در وضعیتهای داخلی رخ دهد که مستقیماً به متن تبدیل نمیشوند.
حاکمیت نباید به یک کانال نظارتی وابسته باشد
نتیجه عملی برای Aipolix این نیست که recurrent depth ذاتاً روش نامناسبی است. نتیجه مهمتر این است که کنترل مدلهای مرزی نباید به یک ابزار مشاهدهپذیری وابسته باشد.
اگر زنجیره استدلال در نسلهای بعدی اطلاعات کمتری بدهد، سازمان باید بتواند رفتار مدل را از مسیرهای دیگری نیز کنترل کند: محدودیت دسترسی به ابزارها، قواعد مجوزدهی برای عملیات حساس، جداسازی محیط اجرا، محدودیت شبکه، ثبت کامل عملیات، تشخیص رفتار غیرعادی، محدودیت نرخ و امکان توقف عامل در صورت خروج از محدوده مجاز.
جالب اینکه برنامه خود OpenAI برای Astra نیز به همین سمت میرود. شرکت از چند لایه همزمان صحبت میکند: آموزش مدل برای رعایت محدودیتها، کنترل سوءاستفاده سایبری، نظارت بر زنجیره استدلال، طبقهبندهایی که استدلال و عمل را بررسی میکنند و سازوکاری که میتواند فعالیت مشکوک را متوقف کند.
اگر مشاهده مستقیم استدلال سختتر شود، اهمیت این کنترلهای مستقل بیشتر خواهد شد.
افزایش توانایی نباید بیسروصدا یک ابزار ایمنی را تضعیف کند
عمق بازگشتی از نظر فنی جذاب است، چون میتواند بدون افزایش مشابه در اندازه مدل، امکان محاسبه بیشتری فراهم کند. اگر این روش مزیت واقعی در کیفیت یا هزینه ایجاد کند، طبیعی است که توسعهدهندگان دیگر نیز به سمت آن بروند.
اما همین مزیت میتواند یک هزینه پنهان داشته باشد. آزمایشگاه ممکن است عملکرد مدل را بهتر کند و همزمان بخشی از سیگنالی را که تیم ایمنی برای فهم رفتار آن استفاده میکند از دست بدهد.
اگر معیار موفقیت فقط توانایی مدل باشد، این تغییر میتواند بهتدریج یک ابزار نظارتی مفید را در سطح صنعت ضعیف کند.
طبق گزارش TechCrunch، دانشمند ارشد OpenAI نیز پس از انتشار این خبر بر اهمیت حفظ قابلیت نظارت بر زنجیره استدلال تأکید کرده است. همچنین گزارشها میگویند استفاده Astra از recurrent depth عمداً محدود شده است.
این دو نکته مثبتاند، اما پاسخ نهایی نیستند. برای نسلهای بعدی باید علاوه بر افزایش توانایی، دقیقاً اندازهگیری شود چه مقدار از قابلیت نظارت از دست میرود و چه کنترل مستقلی جای آن را میگیرد.
در زمان عرضه Astra چه چیزهایی مهم خواهد بود؟
OpenAI گفته همراه عرضه Astra جزئیات بیشتری را در system card مدل منتشر خواهد کرد. برای ارزیابی این موضوع، آن سند اهمیت زیادی خواهد داشت.
باید دید OpenAI قابلیت نظارت بر زنجیره استدلال را چگونه اندازهگیری میکند، آیا میزان استفاده از recurrent depth در نسخهها و سطحهای دسترسی مختلف تفاوت دارد، هنگام ناقص بودن متن استدلال چه کنترل مستقلی رفتار مدل را بررسی میکند و این کنترلها چند بار فعالیت سالم کاربران را به اشتباه متوقف میکنند.
تا آن زمان، نتیجهای که میتوان با اطمینان گرفت محدود است: گزارشها میگویند Astra از recurrent depth استفاده میکند؛ OpenAI میگوید زنجیره استدلال مدل همچنان قابلخواندن است و نظارت بیشتری روی آن اعمال خواهد شد؛ و شماری از پژوهشگران نگراناند استفاده گستردهتر از همین روش در آینده یکی از ابزارهای مهم نظارت بر رفتار مدل را ضعیف کند.
برای سازمانهایی که قصد استفاده از Astra را دارند، بهتر است متن استدلال مدل یکی از شواهد کنترل باشد، نه خود مرز کنترل.