رویداد سهروزه Grok Bot Galaxy از امروز در سانفرانسیسکو و بهصورت آنلاین آغاز شده است. SpaceXAI در این برنامه میخواهد Grok Bot را نه در قالب یک چتبات، بلکه در جریان کار واقعی تیمهای مهندسی، محصول، فروش، پشتیبانی و بازاریابی نشان دهد. رویداد از ۱۵ تا ۱۷ سپتامبر در The Howard برگزار میشود و بخشهایی از آن پخش زنده دارد.
اهمیت Galaxy در همین انتخاب است. ادعای اصلی Grok Bot این نیست که پاسخهای بهتری در یک پنجره گفتوگو تولید میکند. SpaceXAI آن را مجموعهای از عاملهای ماندگار معرفی میکند که هرکدام هویت، حافظه، محیط اجرا و ابزارهای خود را دارند و روی یک رایانه ابری جداگانه کار میکنند. بنابراین پرسش مهم این رویداد این است که چنین عاملی وقتی با کار روزمره، چند نرمافزار، تأخیر، تأیید انسانی و تحویل کار به عامل دیگر روبهرو میشود، تا چه اندازه قابل اتکاست.
برنامه Galaxy بر اساس نقشهای واقعی سازمانی چیده شده است
روز نخست با معرفی Grok Bot شروع میشود و سپس به کاربرد آن برای مهندسان، مدیران محصول و بنیانگذاران میپردازد. روز دوم به مهندسی فروش، فروش، توسعه فروش و پشتیبانی مشتری اختصاص دارد. در روز سوم نیز عملیات بازاریابی، خدمات پس از فروش و بازاریابی بررسی میشوند و برنامه با نمایش نهایی در پخش زنده پایان مییابد.
SpaceXAI در صفحه رسمی رویداد از شرکتکنندگان میخواهد «کار واقعی» به Grok Bot بسپارند. قرار است کاربران عامل بسازند، هدف و شیوه کار را به آن بیاموزند و سپس کارهایی را که میان چند ابزار، وبسایت و نرمافزار پخش شدهاند به آن واگذار کنند. این سنجش با یک دموی معمولی مدل زبانی فرق دارد. مسئله دیگر فقط پاسخ درست نیست؛ عامل باید مسئولیت یک کار را در طول زمان حفظ کند.
گزارش مستقل Yahoo نیز از چالشی همزمان خبر داده که در آن سه نفر از کارکنان SpaceXAI طی سه روز با کمک Grok Bot یک استارتاپ را از ابتدا میسازند. این برنامه را نباید با آزمون علمی یا معیار مستقل عملکرد اشتباه گرفت. پخش زنده میتواند نقاط قوت و ضعف یک فرایند را آشکار کند، اما بهتنهایی چیزی درباره نرخ موفقیت در محیطهای دیگر ثابت نمیکند.
Grok Bot قرار است بعد از پایان گفتوگو هم به کار ادامه دهد
SpaceXAI در ماه اوت Grok Bot را بهصورت بتا معرفی کرد. طبق توضیحات شرکت، هر Bot رایانه خودش را دارد، میتواند وارد ابزارهای موجود شود، میان صندوقهای ایمیل و نرمافزارهای مختلف حرکت کند و وقتی تصمیمی نیازمند تأیید کاربر است دوباره او را وارد فرایند کند. چند Bot نیز میتوانند همزمان کار کنند و با یکدیگر پیام ردوبدل کنند.
یادداشت طراحی منتشرشده در سوم سپتامبر جزئیات بیشتری میدهد. در این معماری، Bot به یک گفتوگوی منفرد محدود نیست و هویت، حافظه، محیط اجرا و ابزارهایش را حفظ میکند. دستورها میتوانند به مهارتهای قابل استفاده مجدد یا کارهای زمانبندیشده تبدیل شوند. یک کار زمانبندیشده حتی میتواند با رسیدن زمان مشخص یا وقوع یک رویداد، بدون دستور تازه کاربر، Bot را فعال کند.
همین ماندگاری مرز کنترل را مهمتر میکند. رابط Grok Bot وضعیت کار را نشان میدهد، امکان مشاهده محیط کاری عامل را فراهم میکند و در صورت نیاز کاربر میتواند کنترل رایانه آن را در دست بگیرد و بعد دوباره تحویل دهد. برای استفاده سازمانی، همین نقطه میان «واگذاری کار» و «دخالت انسان» از توانایی خام مدل مهمتر است.
آزمون واقعی، هماهنگی و حدود اختیار است
چیدمان Galaxy بر اساس واحدهای مختلف سازمانی فرصت خوبی برای بررسی مسئلهای میدهد که در دموهای تکعاملی کمتر دیده میشود. حتی اگر یک عامل فروش و یک عامل مهندسی جداگانه خوب کار کنند، هنگام تداخل مسئولیتها سؤالهای تازهای شکل میگیرد: حافظه مشترک کجاست؟ هر عامل به چه حسابها و اطلاعاتی دسترسی دارد؟ چه زمانی اجازه دارد کار را به عامل دیگری بسپارد؟ کدام اقدام حتماً باید به تأیید انسان برسد؟
در مدل Grok Bot، هر عامل میتواند حافظه و کارهای تکرارشونده مخصوص نقش خود را داشته باشد و گفتوگوی گروهی نیز زمینه مشترکی برای یک پروژه ایجاد کند. این طراحی میتواند نیاز به انتقال دستی اطلاعات میان چند عامل را کم کند. در مقابل، ماندگاری حافظه و دستورهای دورهای خطر دیگری میسازد: یک فرض اشتباه یا مجوز قدیمی نیز ممکن است همراه عامل باقی بماند.
برای مدیر فنی، معیار مفید تماشای Galaxy فقط این نیست که دمو در پایان «موفق» میشود یا نه. باید دید عامل به کدام سامانهها دسترسی دارد، چه اقدامهایی قابل بازگشتاند، در کجا تأیید انسانی اجباری است، سابقه اقدامات چگونه بررسی میشود و دسترسیها هنگام همکاری چند عامل چگونه محدود میشوند. پاسخ این پرسشها مشخص میکند Grok Bot میتواند بخشی از زیرساخت عملیاتی شود یا همچنان ابزاری باشد که به نظارت نزدیک انسان نیاز دارد.
پخش زنده امکان مشاهده میدهد، اما معیار مستقل نیست
سه روز نمایش زنده و کار در چند واحد سازمانی میتواند اطلاعات بیشتری از یک ویدیوی تبلیغاتی کوتاه بدهد. با این حال، محیط و محصول همچنان در اختیار خود SpaceXAI است. منابع رسمی منتشرشده برای Galaxy نیز معیار مستقل و قابل تکراری برای سنجش قابلیت اطمینان این فرایندها ارائه نمیکنند.
در نتیجه، موفقیت یک کار در پخش زنده فقط نشان میدهد آن سناریو قابل انجام بوده است. از آن نمیتوان نرخ موفقیت در شرکتهای دیگر، ساختارهای دسترسی متفاوت یا دادههای پیچیدهتر را نتیجه گرفت. ادعاهای مربوط به بهرهوری، هزینه یا قابلیت اطمینان تا زمانی که داده مستقل یا اندازهگیری قابل تکرار وجود نداشته باشد باید به منبع ادعا نسبت داده شوند.
نکته مهم Galaxy این است که بحث عاملهای هوش مصنوعی را از کیفیت گفتوگو به «مسئولیت ماندگار» میبرد: عاملهایی با نقش ثابت، رایانه مستقل، حافظه، کارهای زمانبندیشده و نقطه مشخص برای بازگشت کنترل به انسان. در دو روز آینده، جزئیات مربوط به سطح دسترسی، ثبت و ممیزی اقدامات، همکاری میان Botها، بازیابی پس از خطا و محدودیتهای استقرار سازمانی میتوانند این رویداد را از یک نمایش محصول به آزمونی جدیتر برای عاملهای ماندگار تبدیل کنند.