OpenAI در ۳ سپتامبر GPT-6 Astra را عرضه کرد و این مدل پس از دوره ارزیابی پیش از انتشار، به‌تدریج وارد محیط‌های عملیاتی می‌شود. طبق اطلاعات رسمی، دسترسی ابتدا برای شرکت‌های عضو برنامه Daybreak و از طریق API آغاز شده و در روزهای آینده به کاربران Plus، Pro، Business و Enterprise گسترش پیدا می‌کند. اهمیت این عرضه فقط در افزایش توان مدل نیست. Astra نخستین مدل OpenAI است که این شرکت آن را در سطح «بحرانی» توانمندی سایبری در چارچوب آمادگی خود قرار داده است.

برای سازمان‌ها، چنین مدلی را دیگر نمی‌توان فقط با معیار کیفیت پاسخ یا هزینه سنجید. پرسش تازه این است که چه کسانی، برای چه کاری و با چه سطحی از ابزار و دسترسی شبکه باید بتوانند از قوی‌ترین قابلیت‌های Astra استفاده کنند.

عرضه مرحله‌ای، با تصمیم تازه برای دسترسی

راهنمای سازمانی OpenAI می‌گوید Astra از امروز برای شرکت‌های عضو Daybreak و از طریق API در حال عرضه است و دسترسی گسترده‌تر در ChatGPT طی روزهای آینده انجام می‌شود. در محیط‌های واجد شرایط Enterprise و Edu نیز مدل در زمان عرضه به‌صورت پیش‌فرض خاموش است و مدیران باید آن را جداگانه فعال کنند.

این نکته برای مدیریت دسترسی مهم است. تنظیمات قبلی Early Model Access به Astra منتقل نمی‌شود. حتی سازمانی که پیش‌تر دسترسی زودهنگام به مدل‌های جدید را باز گذاشته بود، برای Astra باید تصمیم مستقلی بگیرد. مدیران می‌توانند دسترسی را در سطح کل محیط کاری یا برای نقش‌های مشخص فعال کنند.

رویترز گزارش داده که OpenAI، Astra را سریع‌ترین و چندمنظوره‌ترین مدل خود تا امروز معرفی کرده و نمونه‌هایی از استفاده آن در توسعه نرم‌افزار و بازی، امور حقوقی، تهیه اظهارنامه مالیاتی، طراحی معماری و پژوهش‌های مصرف‌کننده ارائه کرده است. نمونه‌های منتشرشده از مشتریان OpenAI نیز نشان می‌دهد هدف اصلی فقط گفت‌وگو با مدل نیست و Astra برای کارهای چندمرحله‌ای و عامل‌محور در نظر گرفته شده است. با این حال، ارقام عملکردی این نمونه‌ها ادعای OpenAI یا مشتریان آن هستند و نباید به‌عنوان اثبات مستقل برتری عمومی مدل تلقی شوند.

توان سایبری Astra مرز انتشار را تغییر می‌دهد

OpenAI دو روز پیش از عرضه اعلام کرد Astra به سطح «بحرانی» توانمندی سایبری رسیده است. در تعریف این شرکت، مدلی در این سطح می‌تواند در صورت داشتن ابزار و دسترسی مناسب، آسیب‌پذیری‌های ناشناخته را پیدا کند و برای سامانه‌های مقاوم مسیر بهره‌برداری عملی بسازد، بدون اینکه در تمام مراحل به هدایت مداوم انسان نیاز داشته باشد.

OpenAI می‌گوید Astra در ارزیابی ExploitBench امتیاز کامل گرفته و در یک مجموعه آزمون داخلی جدیدتر نیز هنگام حل مسائل به دو آسیب‌پذیری ناشناخته رسیده است. این نتایج حاصل ارزیابی خود OpenAI هستند و تأیید مستقل محسوب نمی‌شوند. شرکت همچنین تصریح کرده که قوی‌ترین نتایج سایبری مربوط به سطح دسترسی Daybreak Blue است، نه تنظیمات عادی محصول.

در نتیجه نام GPT-6 Astra به‌تنهایی توان واقعی یک استقرار را توضیح نمی‌دهد. قابلیت در لایه‌های مختلف دسترسی و حفاظتی ارائه می‌شود و بخش پیشرفته سایبری در ابتدا محدودتر از دسترسی عمومی مدل خواهد بود.

برای تیم امنیت، ثبت نام مدل در فهرست دارایی‌ها کافی نیست. باید سطح دسترسی، ابزارهای فعال، دسترسی شبکه، نقش کاربر و تنظیمات حفاظتی نیز ثبت شود تا مشخص باشد هر استقرار Astra عملاً چه کاری می‌تواند انجام دهد.

پایش ایمنی بخشی از رفتار عملیاتی مدل شده است

OpenAI می‌گوید Astra همراه با سامانه‌های پایش بیشتری عرضه می‌شود تا رفتارهای بالقوه خارج از مجوز شناسایی شوند. این کنترل‌ها ممکن است کار مجاز را نیز کند، متوقف یا موقتاً معلق کنند. در ChatGPT یا Codex ممکن است ادامه کار به بررسی کاربر نیاز داشته باشد؛ در برخی محیط‌ها مانند API، اجرای کار می‌تواند متوقف شود.

این یعنی پایش ایمنی فقط یک آزمون پیش از عرضه نیست و مستقیماً بر رفتار سامانه در محیط عملیاتی اثر دارد. اگر یک فرایند سازمانی فرض کند هر مأموریت طولانی Astra حتماً تا انتها اجرا می‌شود، ممکن است حتی بدون خرابی فنی مدل با توقف روبه‌رو شود.

در طراحی عامل‌ها بهتر است خطای مدل از توقف ناشی از سیاست ایمنی جدا ثبت شود. وضعیت کار باید قابل بازیابی باشد، عملیات حساس در صورت تکرار نتیجه ناخواسته ایجاد نکنند و برای توقف توسط سامانه حفاظتی مسیر مشخصی تعریف شود. شاخص‌های قابلیت اطمینان نیز باید این نوع توقف را جدا از خطای عمومی سرویس اندازه‌گیری کنند.

کنترل دسترسی حالا بخشی از حاکمیت مدل است

شیوه عرضه Astra یک الگوی مهم را نشان می‌دهد: برای مدل‌های مرزی، کنترل قابلیت فقط با یک کلید روشن یا خاموش در سطح کل سازمان انجام نمی‌شود و هویت کاربر، نقش او و نوع کار اهمیت بیشتری پیدا می‌کند.

OpenAI برای محیط‌های سازمانی امکان کنترل Astra از طریق تنظیمات دسترسی به مدل و نقش‌های سازمانی را فراهم کرده است. خاموش بودن پیش‌فرض مدل در برخی محیط‌های Enterprise و Edu نیز یک نقطه تصمیم روشن پیش از فعال‌سازی ایجاد می‌کند.

بنابراین سؤال مناسب این نیست که «آیا Astra را تأیید می‌کنیم؟» بلکه باید پرسید «کدام پیکربندی Astra برای کدام کار مجاز است؟» استفاده یک تیم توسعه برای بررسی مخزن کد، استفاده یک تیم حقوقی برای تحلیل اسناد و استفاده یک تیم امنیت برای آزمون سامانه‌های مقاوم، حتی با یک نام مدل، سطح خطر یکسانی ندارند.

مجوز عملیاتی بهتر است مدل را به گروه کاربری، ابزارها، نوع داده، دسترسی شبکه، دامنه عملیات مجاز و مسیر رسیدگی در صورت توقف یا تخلف متصل کند. تغییر هر یک از این موارد می‌تواند به معنی تغییر واقعی قابلیت باشد و بررسی تازه‌ای بخواهد.

ارقام روز عرضه جای آزمون داخلی را نمی‌گیرند

نمونه‌های منتشرشده در روز عرضه نشان می‌دهند OpenAI، Astra را برای کارهای طولانی و چندمرحله‌ای هدف گرفته است. Legora می‌گوید عامل مبتنی بر Astra توانسته ۴۱ سند مالی را در چند دقیقه بررسی کند و در یک سناریوی مشخص تقریباً ۴۰ درصد نسبت به مدل قبلی بهتر عمل کند، هرچند میانگین بهبود در کل آزمون‌های داخلی Legora حدود ۳ درصد بوده است. Playco نیز از ۵۰ درصد کاهش اصلاحات دستی در آزمایش ساخت نمونه بازی خبر داده است.

این نتایج برای شناخت نوع کاربرد مفیدند، اما از نمونه‌های مشتریان OpenAI و ارزیابی‌های شریک تجاری می‌آیند. از آنها نمی‌توان نتیجه گرفت Astra روی مخزن کد، اسناد، سیاست‌ها یا ابزارهای هر سازمان دیگری همان عملکرد را خواهد داشت.

مسیر مناسب برای پذیرش، آزمون کنترل‌شده روی داده و فرایند خود سازمان است. پیش از جایگزینی مدل فعلی، باید خطاهای مهم، مجوز ابزارها، قواعد داده حساس، رفتار هنگام توقف ایمنی و نقاط الزام بررسی انسانی آزمایش شوند.

تغییر اصلی فقط یک عدد بهتر در بنچمارک نیست

Astra یک عرضه مهم مدل است، اما پیام عملی آن فراتر از امتیازهای بنچمارک است. OpenAI هم‌زمان با عرضه مدل، بخشی از قابلیت‌ها را محدود کرده، پایش زمان اجرا را افزایش داده، کنترل دسترسی مبتنی بر نقش را برجسته کرده و صریحاً هشدار داده که سازوکارهای حفاظتی ممکن است اجرای کار مجاز را متوقف کنند.

در چنین شرایطی انتخاب مدل به تصمیم معماری و حاکمیتی تبدیل می‌شود. توان واقعی Astra حاصل ترکیب خود مدل با سطح دسترسی، ابزارها، مجوزها و سامانه‌های پایش است. برای استفاده سازمانی، همین ترکیب باید موضوع تأیید باشد؛ نام مدل به‌تنهایی دیگر توصیف دقیقی از خطر یا رفتار عملیاتی یک عامل پیشرفته نیست.

منابع
- معرفی GPT-6 Astra
- گزارش OpenAI درباره توانمندی‌ها و حفاظت‌های Astra
- راهنمای مدل‌ها و محدودیت‌های سازمانی ChatGPT
- گزارش رویترز