گوگل دو مدل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را برای تعامل صوتی بلادرنگ عرضه کرده است. تغییر مهم برای توسعهدهندگان فقط کیفیت مکالمه نیست: نسخه Extended Thinking میتواند در حالی که ارتباط صوتی با کاربر ادامه دارد، در پسزمینه استدلال کند و ابزارهای غیرهمزمان را فراخوانی کند.
در مستندات گوگل، این تفاوت مستقیماً در چرخه عمر ارتباط دیده میشود. در Gemini 3.8 Live، دریافت turnComplete: true همچنان پایان نوبت را نشان میدهد. اما در Extended Thinking ممکن است همین پیام برسد و پردازش هنوز ادامه داشته باشد. برنامه باید وضعیت interaction_status را دنبال کند؛ IN_PROGRESS یعنی کار هنوز جریان دارد و تنها IDLE پایان کامل تعامل را مشخص میکند.
پایان جمله دیگر پایان کار نیست
دستیارهای صوتی معمولاً وقتی برای پاسخ به چند ثانیه پردازش یا تماس با سرویس بیرونی نیاز دارند، با یک انتخاب ناخوشایند روبهرو میشوند: یا کاربر در سکوت منتظر بماند، یا سیستم زودتر پاسخ دهد و از پردازش عمیقتر صرفنظر کند. Extended Thinking الگوی دیگری پیشنهاد میکند. مدل میتواند هنگام ادامه پردازش، توضیح کوتاهی به کاربر بدهد و همزمان ابزارها را در پسزمینه اجرا کند.
برای نمونه، یک دستیار سفر میتواند اعلام کند که در حال بررسی گزینههاست و در همان زمان جستوجوی پرواز یا هتل را انجام دهد. در نتیجه، پخش یک پاسخ صوتی دیگر بهتنهایی نشان نمیدهد که وظیفه تمام شده است.
این تفاوت برای طراحی محصول مهم است. وضعیت میکروفن، دکمه لغو، امکان ارسال درخواست بعدی و نمایش «در حال پردازش» نباید صرفاً به پایان پخش صدا وابسته باشند. برنامه به یک ماشین حالت روشن برای کل تعامل نیاز دارد.
استفاده از مدل جدید فقط عوض کردن نام مدل نیست
در Extended Thinking همه تابعهایی که بهعنوان ابزار معرفی میشوند باید با رفتار NON_BLOCKING تعریف شوند. فراخوانی مسدودکننده پشتیبانی نمیشود. توسعهدهنده همچنین میتواند میزان استدلال پسزمینه را با سه سطح کم، متوسط و زیاد تنظیم کند.
بنابراین مهاجرت به این مدل مستلزم تغییر منطق سمت کاربر است. برنامه باید پس از turnComplete همچنان پیامها را دریافت کند، فراخوانیهای بعدی ابزار یا صوت را پردازش کند، نتیجه ابزارها را برگرداند و تا رسیدن وضعیت IDLE تعامل را تمامشده نداند.
در مقابل، Gemini 3.8 Live همان چرخه سادهتر را حفظ میکند و برای مکالمههایی مناسب است که پاسخ سریع اهمیت بیشتری دارد یا ابزارها تقریباً فوری جواب میدهند.
مرز تازهای که توسعهدهنده باید مدیریت کند
برداشت مهمتر از این عرضه، جدا شدن «نوبت گفتوگو» از «کل تعامل» است. ممکن است مدل یک جمله را تمام کرده باشد، اما وظیفهای که کاربر آغاز کرده هنوز در پسزمینه ادامه داشته باشد.
این تغییر چند سؤال عملی ایجاد میکند: اگر کاربر وسط پردازش حرف بزند چه اتفاقی میافتد؟ لغو کردن باید کدام ابزارها را متوقف کند؟ اگر یک سرویس بیرونی دیر پاسخ دهد رابط کاربری چه وضعیتی نشان دهد؟ و ثبت رویدادها چگونه باید نوبتهای صوتی را از چرخه طولانیتر استدلال و اجرای ابزار جدا کند؟
این نتیجهگیری تحلیلی بر پایه پروتکل مستندشده گوگل است و به معنای خودمختاری مدل یا تضمین درستی استدلال نیست. اهمیت آن در این است که توسعهدهنده اکنون برای کاری که پس از پایان یک جمله ادامه پیدا میکند، وضعیت رسمی و قابل پیگیری در اختیار دارد.
ورودی چندرسانهای و زمینه ۱۲۸ هزار توکنی
طبق کارت مدل Google DeepMind، هر دو نسخه Gemini 3.8 Live ورودی صوت، تصویر، ویدئو و متن را میپذیرند و میتوانند متن و صوت تولید کنند. این مدلها بر پایه Gemini 3 Pro ساخته شدهاند و تا ۱۲۸ هزار توکن ورودی و ۶۴ هزار توکن خروجی را پشتیبانی میکنند.
همان کارت مدل محدودیتهای آشنای مدلهای پایه را نیز یادآوری میکند. امکان تولید پاسخ نادرست یا ساختگی همچنان وجود دارد و گاهی کندی یا پایان مهلت پردازش رخ میدهد. بنابراین Extended Thinking تضمین قابلیت اطمینان نیست. برعکس، وقتی تعامل طولانیتر میشود و چند ابزار درگیر هستند، مدیریت خطا اهمیت بیشتری پیدا میکند.
پیش از مهاجرت چه چیزهایی باید آزمایش شوند؟
تیمهایی که Extended Thinking را ارزیابی میکنند بهتر است فقط کیفیت صدا را نسنجند. تأخیر ابزارها، قطع کردن کار هنگام IN_PROGRESS، دریافت چند turnComplete در یک تعامل، شکست ابزار، لغو درخواست و ارسال پیام تازه پیش از IDLE همگی باید در آزمونها پوشش داده شوند.
برای انتخاب میان دو مدل نیز مرز نسبتاً روشنی وجود دارد. اگر سرعت رفتوبرگشت مکالمه اولویت دارد و وظیفه ساده است، Gemini 3.8 Live انتخاب طبیعیتری است. اگر درخواست به چند مرحله استدلال یا ابزارهای کندتر نیاز دارد و برنامه برای مدیریت یک تعامل طولانی آماده است، Extended Thinking کاربرد بیشتری دارد.
اهمیت این عرضه در نهایت فقط «فکر کردن هنگام صحبت» نیست. گوگل پردازش پسزمینه را به بخشی رسمی از قرارداد Live API تبدیل کرده و همین موضوع معماری برنامههای صوتی عاملمحور را تغییر میدهد.