گوگل دو مدل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را برای تعامل صوتی بلادرنگ عرضه کرده است. تغییر مهم برای توسعه‌دهندگان فقط کیفیت مکالمه نیست: نسخه Extended Thinking می‌تواند در حالی که ارتباط صوتی با کاربر ادامه دارد، در پس‌زمینه استدلال کند و ابزارهای غیرهمزمان را فراخوانی کند.

در مستندات گوگل، این تفاوت مستقیماً در چرخه عمر ارتباط دیده می‌شود. در Gemini 3.8 Live، دریافت turnComplete: true همچنان پایان نوبت را نشان می‌دهد. اما در Extended Thinking ممکن است همین پیام برسد و پردازش هنوز ادامه داشته باشد. برنامه باید وضعیت interaction_status را دنبال کند؛ IN_PROGRESS یعنی کار هنوز جریان دارد و تنها IDLE پایان کامل تعامل را مشخص می‌کند.

پایان جمله دیگر پایان کار نیست

دستیارهای صوتی معمولاً وقتی برای پاسخ به چند ثانیه پردازش یا تماس با سرویس بیرونی نیاز دارند، با یک انتخاب ناخوشایند روبه‌رو می‌شوند: یا کاربر در سکوت منتظر بماند، یا سیستم زودتر پاسخ دهد و از پردازش عمیق‌تر صرف‌نظر کند. Extended Thinking الگوی دیگری پیشنهاد می‌کند. مدل می‌تواند هنگام ادامه پردازش، توضیح کوتاهی به کاربر بدهد و هم‌زمان ابزارها را در پس‌زمینه اجرا کند.

برای نمونه، یک دستیار سفر می‌تواند اعلام کند که در حال بررسی گزینه‌هاست و در همان زمان جست‌وجوی پرواز یا هتل را انجام دهد. در نتیجه، پخش یک پاسخ صوتی دیگر به‌تنهایی نشان نمی‌دهد که وظیفه تمام شده است.

این تفاوت برای طراحی محصول مهم است. وضعیت میکروفن، دکمه لغو، امکان ارسال درخواست بعدی و نمایش «در حال پردازش» نباید صرفاً به پایان پخش صدا وابسته باشند. برنامه به یک ماشین حالت روشن برای کل تعامل نیاز دارد.

استفاده از مدل جدید فقط عوض کردن نام مدل نیست

در Extended Thinking همه تابع‌هایی که به‌عنوان ابزار معرفی می‌شوند باید با رفتار NON_BLOCKING تعریف شوند. فراخوانی مسدودکننده پشتیبانی نمی‌شود. توسعه‌دهنده همچنین می‌تواند میزان استدلال پس‌زمینه را با سه سطح کم، متوسط و زیاد تنظیم کند.

بنابراین مهاجرت به این مدل مستلزم تغییر منطق سمت کاربر است. برنامه باید پس از turnComplete همچنان پیام‌ها را دریافت کند، فراخوانی‌های بعدی ابزار یا صوت را پردازش کند، نتیجه ابزارها را برگرداند و تا رسیدن وضعیت IDLE تعامل را تمام‌شده نداند.

در مقابل، Gemini 3.8 Live همان چرخه ساده‌تر را حفظ می‌کند و برای مکالمه‌هایی مناسب است که پاسخ سریع اهمیت بیشتری دارد یا ابزارها تقریباً فوری جواب می‌دهند.

مرز تازه‌ای که توسعه‌دهنده باید مدیریت کند

برداشت مهم‌تر از این عرضه، جدا شدن «نوبت گفت‌وگو» از «کل تعامل» است. ممکن است مدل یک جمله را تمام کرده باشد، اما وظیفه‌ای که کاربر آغاز کرده هنوز در پس‌زمینه ادامه داشته باشد.

این تغییر چند سؤال عملی ایجاد می‌کند: اگر کاربر وسط پردازش حرف بزند چه اتفاقی می‌افتد؟ لغو کردن باید کدام ابزارها را متوقف کند؟ اگر یک سرویس بیرونی دیر پاسخ دهد رابط کاربری چه وضعیتی نشان دهد؟ و ثبت رویدادها چگونه باید نوبت‌های صوتی را از چرخه طولانی‌تر استدلال و اجرای ابزار جدا کند؟

این نتیجه‌گیری تحلیلی بر پایه پروتکل مستندشده گوگل است و به معنای خودمختاری مدل یا تضمین درستی استدلال نیست. اهمیت آن در این است که توسعه‌دهنده اکنون برای کاری که پس از پایان یک جمله ادامه پیدا می‌کند، وضعیت رسمی و قابل پیگیری در اختیار دارد.

ورودی چندرسانه‌ای و زمینه ۱۲۸ هزار توکنی

طبق کارت مدل Google DeepMind، هر دو نسخه Gemini 3.8 Live ورودی صوت، تصویر، ویدئو و متن را می‌پذیرند و می‌توانند متن و صوت تولید کنند. این مدل‌ها بر پایه Gemini 3 Pro ساخته شده‌اند و تا ۱۲۸ هزار توکن ورودی و ۶۴ هزار توکن خروجی را پشتیبانی می‌کنند.

همان کارت مدل محدودیت‌های آشنای مدل‌های پایه را نیز یادآوری می‌کند. امکان تولید پاسخ نادرست یا ساختگی همچنان وجود دارد و گاهی کندی یا پایان مهلت پردازش رخ می‌دهد. بنابراین Extended Thinking تضمین قابلیت اطمینان نیست. برعکس، وقتی تعامل طولانی‌تر می‌شود و چند ابزار درگیر هستند، مدیریت خطا اهمیت بیشتری پیدا می‌کند.

پیش از مهاجرت چه چیزهایی باید آزمایش شوند؟

تیم‌هایی که Extended Thinking را ارزیابی می‌کنند بهتر است فقط کیفیت صدا را نسنجند. تأخیر ابزارها، قطع کردن کار هنگام IN_PROGRESS، دریافت چند turnComplete در یک تعامل، شکست ابزار، لغو درخواست و ارسال پیام تازه پیش از IDLE همگی باید در آزمون‌ها پوشش داده شوند.

برای انتخاب میان دو مدل نیز مرز نسبتاً روشنی وجود دارد. اگر سرعت رفت‌وبرگشت مکالمه اولویت دارد و وظیفه ساده است، Gemini 3.8 Live انتخاب طبیعی‌تری است. اگر درخواست به چند مرحله استدلال یا ابزارهای کندتر نیاز دارد و برنامه برای مدیریت یک تعامل طولانی آماده است، Extended Thinking کاربرد بیشتری دارد.

اهمیت این عرضه در نهایت فقط «فکر کردن هنگام صحبت» نیست. گوگل پردازش پس‌زمینه را به بخشی رسمی از قرارداد Live API تبدیل کرده و همین موضوع معماری برنامه‌های صوتی عامل‌محور را تغییر می‌دهد.

منابع
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- https://ai.google.dev/gemini-api/docs/live-api/thinking
- https://deepmind.google/models/model-cards/gemini-3-8-audio/