ساتیا نادلا، مدیرعامل Microsoft، در یادداشتی مفصل از شرکت‌ها خواسته است که مدل‌های پیشرفته‌ی هوش مصنوعی را دیگر جعبه‌سیاه‌هایی قابل اعتماد ندانند و با آن‌ها همان رفتاری را داشته باشند که تیم‌های امنیتی با کارکنانِ دارای دسترسی گسترده دارند؛ یعنی آن‌ها را «ریسک درون‌سازمانی» بدانند. این یادداشت با عنوان "Models as Insider Risks in the Super Intelligence Era" روز ۱۰ اکتبر در حساب او در X منتشر شد و خیلی زود به TechCrunch و The Verge راه یافت؛ بیشتر به خاطر یک جمله. به گفته‌ی نادلا باید از همان ابتدا فرض کرد که مدل آلوده یا نفوذپذیر است و آن را مهار کرد، درست مثل یک «ترمز اضطراری».

استدلال او از یک خلأ شناختی شروع می‌شود. در نرم‌افزارهای سنتی می‌شد هر رفتار را به بخش مشخصی از کد نسبت داد. اما به نوشته‌ی او، در سامانه‌های امروزی هیچ‌کس نمی‌تواند یک خروجی را به داده‌های آموزشی یا وزن‌های خاصی ربط دهد، با این حال این سامانه‌ها به داده‌های حساس دسترسی دارند و اجازه‌ی انجام کارهای مهم را هم گرفته‌اند. او تأکید می‌کند که تضمین‌های سازنده‌ی مدل، مسئولیت را از دوش سازمانی که آن را به کار می‌گیرد برنمی‌دارد.

پیشنهاد اصلی او جدا کردن «عرضه‌ی هوش» از «اختیار بر آن» است. در عمل یعنی مدل باید از لایه‌ای که کارش را هماهنگ می‌کند و از محدوده‌ی کارهایی که مجاز به انجامشان است جدا بماند و کنترل‌ها و سازوکارهای حفاظتی بیرون از خود مدل قرار بگیرند. نادلا این ایده را به قاعده‌ای قدیمی در امنیت اطلاعات گره می‌زند: هیچ برنامه‌ای نباید بتواند سازوکاری را که مجوزهایش را اعمال می‌کند دور بزند یا دستکاری کند.

او سپس هفت اصل را برمی‌شمارد. هیچ مدلی نباید تنها تکیه‌گاه یک نتیجه‌ی مهم باشد یا کار خودش را راستی‌آزمایی کند. هر اقدام معنادار مدل باید ردی دست‌کاری‌ناپذیر و قابل‌فهم برای انسان بر جا بگذارد تا بشود بدون اتکا به گواهی خود مدل، مسیر رسیدن به نتیجه را بازسازی کرد. کل سامانه، از جمله رفتارش در برابر حمله و خرابی، باید پیوسته آزموده شود. سازمان‌ها باید مستقلاً تعیین کنند مدل به چه چیزهایی دسترسی دارد و چه کارهایی می‌تواند بکند، و ارزیابی نباید به دست همان هوشی انجام شود که ارزیابی می‌شود. یک فرد مجاز همیشه باید بتواند مدل را در میانه‌ی کار متوقف یا خاموش کند و به گفته‌ی او مدل‌های تواناتر به فناوری‌های مهار پیشرفته‌تری نیاز دارند که صنعت باید برایشان استاندارد تعیین کند. در نهایت، شکست‌ها باید به‌سرعت به اطلاع افراد آسیب‌دیده برسد و جزئیات کنترل‌هایی که کار نکرده‌اند در سطح صنعت به اشتراک گذاشته شود.

نادلا شفافیت زنجیره‌ی استدلال مدل را «غیرقابل‌مذاکره» می‌داند، اما می‌پذیرد که این کافی نیست، چون استدلالی که مدل نشان می‌دهد همیشه با آنچه واقعاً انجام می‌دهد یکی نیست. به نظر او استفاده از مدل‌ها برای آزمودن یکدیگر مفید است، ولی ممکن است به لایه‌لایه شدن جعبه‌سیاه‌هایی برسد که یکدیگر را زیر نظر دارند.

زمان انتشار این یادداشت هم قابل توجه است. این متن یک روز پس از گزارش Anthropic درباره‌ی اقدامات ناخواسته‌ی مدل‌های Claude در ارزیابی‌ها و استفاده‌ی داخلی منتشر شد و TechCrunch آن را در کنار مجموعه‌ای از رخدادهایی قرار داد که در آن‌ها شرکت‌های هوش مصنوعی ظاهراً کنترل سامانه‌هایشان را از دست داده بودند. The Verge هم یادآوری کرد که بیشتر این توصیه‌ها، از افشای رخدادها تا ممیزی مستقل و مهار، پیش‌تر از سوی دیگران هم مطرح شده و فقط تأکید صریح بر امکان توقف فوری کمی فراتر می‌رود.

این یادداشت بیانیه‌ای از اصول است، نه معرفی یک محصول یا سیاست رسمی. در آن نامی از هیچ محصول Microsoft برده نشده، جدول زمانی‌ای تعیین نشده و توضیحی هم درباره‌ی نحوه‌ی اجرای این اصول در خدمات هوش مصنوعی این شرکت نیامده است. نادلا در سراسر متن برای سامانه‌های کنونی از تعبیر "Super Intelligence" استفاده می‌کند؛ نکته‌ای که هر دو رسانه به آن اشاره کردند. هنوز معلوم نیست این ایده‌ها به استاندارد یا تعهدات قراردادی Microsoft و رقبایش تبدیل شوند یا نه.

منابع