ساتیا نادلا، مدیرعامل Microsoft، در یادداشتی مفصل از شرکتها خواسته است که مدلهای پیشرفتهی هوش مصنوعی را دیگر جعبهسیاههایی قابل اعتماد ندانند و با آنها همان رفتاری را داشته باشند که تیمهای امنیتی با کارکنانِ دارای دسترسی گسترده دارند؛ یعنی آنها را «ریسک درونسازمانی» بدانند. این یادداشت با عنوان "Models as Insider Risks in the Super Intelligence Era" روز ۱۰ اکتبر در حساب او در X منتشر شد و خیلی زود به TechCrunch و The Verge راه یافت؛ بیشتر به خاطر یک جمله. به گفتهی نادلا باید از همان ابتدا فرض کرد که مدل آلوده یا نفوذپذیر است و آن را مهار کرد، درست مثل یک «ترمز اضطراری».
استدلال او از یک خلأ شناختی شروع میشود. در نرمافزارهای سنتی میشد هر رفتار را به بخش مشخصی از کد نسبت داد. اما به نوشتهی او، در سامانههای امروزی هیچکس نمیتواند یک خروجی را به دادههای آموزشی یا وزنهای خاصی ربط دهد، با این حال این سامانهها به دادههای حساس دسترسی دارند و اجازهی انجام کارهای مهم را هم گرفتهاند. او تأکید میکند که تضمینهای سازندهی مدل، مسئولیت را از دوش سازمانی که آن را به کار میگیرد برنمیدارد.
پیشنهاد اصلی او جدا کردن «عرضهی هوش» از «اختیار بر آن» است. در عمل یعنی مدل باید از لایهای که کارش را هماهنگ میکند و از محدودهی کارهایی که مجاز به انجامشان است جدا بماند و کنترلها و سازوکارهای حفاظتی بیرون از خود مدل قرار بگیرند. نادلا این ایده را به قاعدهای قدیمی در امنیت اطلاعات گره میزند: هیچ برنامهای نباید بتواند سازوکاری را که مجوزهایش را اعمال میکند دور بزند یا دستکاری کند.
او سپس هفت اصل را برمیشمارد. هیچ مدلی نباید تنها تکیهگاه یک نتیجهی مهم باشد یا کار خودش را راستیآزمایی کند. هر اقدام معنادار مدل باید ردی دستکاریناپذیر و قابلفهم برای انسان بر جا بگذارد تا بشود بدون اتکا به گواهی خود مدل، مسیر رسیدن به نتیجه را بازسازی کرد. کل سامانه، از جمله رفتارش در برابر حمله و خرابی، باید پیوسته آزموده شود. سازمانها باید مستقلاً تعیین کنند مدل به چه چیزهایی دسترسی دارد و چه کارهایی میتواند بکند، و ارزیابی نباید به دست همان هوشی انجام شود که ارزیابی میشود. یک فرد مجاز همیشه باید بتواند مدل را در میانهی کار متوقف یا خاموش کند و به گفتهی او مدلهای تواناتر به فناوریهای مهار پیشرفتهتری نیاز دارند که صنعت باید برایشان استاندارد تعیین کند. در نهایت، شکستها باید بهسرعت به اطلاع افراد آسیبدیده برسد و جزئیات کنترلهایی که کار نکردهاند در سطح صنعت به اشتراک گذاشته شود.
نادلا شفافیت زنجیرهی استدلال مدل را «غیرقابلمذاکره» میداند، اما میپذیرد که این کافی نیست، چون استدلالی که مدل نشان میدهد همیشه با آنچه واقعاً انجام میدهد یکی نیست. به نظر او استفاده از مدلها برای آزمودن یکدیگر مفید است، ولی ممکن است به لایهلایه شدن جعبهسیاههایی برسد که یکدیگر را زیر نظر دارند.
زمان انتشار این یادداشت هم قابل توجه است. این متن یک روز پس از گزارش Anthropic دربارهی اقدامات ناخواستهی مدلهای Claude در ارزیابیها و استفادهی داخلی منتشر شد و TechCrunch آن را در کنار مجموعهای از رخدادهایی قرار داد که در آنها شرکتهای هوش مصنوعی ظاهراً کنترل سامانههایشان را از دست داده بودند. The Verge هم یادآوری کرد که بیشتر این توصیهها، از افشای رخدادها تا ممیزی مستقل و مهار، پیشتر از سوی دیگران هم مطرح شده و فقط تأکید صریح بر امکان توقف فوری کمی فراتر میرود.
این یادداشت بیانیهای از اصول است، نه معرفی یک محصول یا سیاست رسمی. در آن نامی از هیچ محصول Microsoft برده نشده، جدول زمانیای تعیین نشده و توضیحی هم دربارهی نحوهی اجرای این اصول در خدمات هوش مصنوعی این شرکت نیامده است. نادلا در سراسر متن برای سامانههای کنونی از تعبیر "Super Intelligence" استفاده میکند؛ نکتهای که هر دو رسانه به آن اشاره کردند. هنوز معلوم نیست این ایدهها به استاندارد یا تعهدات قراردادی Microsoft و رقبایش تبدیل شوند یا نه.