OpenAI مدل GPT-Live-1 را در API در اختیار توسعهدهندگان گذاشته است؛ همان مدل صوتی تمامدوطرفهای که پیشتر وارد ChatGPT شده بود. اهمیت این عرضه فقط طبیعیتر شدن مکالمه نیست. بخش صوتی زنده میتواند گفتوگو را مدیریت کند و کارهای سنگینتر مانند استدلال یا استفاده از ابزار را به مدل یا عامل دیگری بسپارد.
OpenAI برای لایه صوتی ۰٫۰۵ دلار بهازای هر دقیقه اعلام کرده و هزینه مدل پشت صحنه و ابزارها جداگانه محاسبه میشود. برای تیمهای فنی، مسئله اصلی حالا هماهنگ کردن وضعیت، مجوزها و چرخه عمر این دو بخش است.
زمانبندی مکالمه در خود مدل مدیریت میشود
در معماریهای متداول، تشخیص گفتار، مدل زبانی و تولید صدا سه مرحله جدا هستند. OpenAI میگوید GPT-Live-1 ورودی و خروجی صوتی را در یک مدل پردازش میکند و به همین دلیل با مکث، تأییدهای کوتاه، حرف زدن همزمان و تغییر جهت ناگهانی کاربر بهتر کنار میآید.
نسخه API از تماس تلفنی نیز پشتیبانی میکند. مستندات OpenAI نشان میدهد نشست ورودی SIP را میتوان مستقیماً با gpt-live-1 پذیرفت. متن پیادهشده از صدا، متن پاسخ، تشخیص نوبت صحبت، راهنمایی برای واژههای خاص و کنترل لحن و سرعت گفتار نیز در دسترساند.
OpenAI میگوید مدل در Full Duplex Bench نسبت به GPT-Realtime-2.1 سی واحد درصد بهتر عمل کرده و همراه GPT-6 Astra در ارزیابی Tau3 رتبه نخست را گرفته است. این اعداد حاصل ارزیابی خود شرکتاند و باید روی سناریوهای واقعی هر محصول دوباره سنجیده شوند.
گفتوگو و انجام کار میتوانند دو مسیر جدا داشته باشند
GPT-Live-1 لازم نیست همه استدلال و استفاده از ابزار را خودش انجام دهد. OpenAI میگوید میتوان کار را به GPT-6 Astra، مدل دیگری از OpenAI یا یک مدل ثالث واگذار کرد. در نمونه رسمی، زمینه مکالمه به Codex داده میشود و پاسخ آن دوباره به نشست زنده برمیگردد.
این جداسازی اجازه میدهد لایه صوتی سریع و پیوسته بماند، اما مسائل پیچیدهتر به مدلی سپرده شوند که برای استدلال یا کار با ابزار مناسبتر است.
در مقابل، دو چرخه عملیاتی ایجاد میشود که ممکن است از هم فاصله بگیرند. کاربر میتواند وسط مکالمه نظرش را عوض کند، در حالی که کار واگذارشده هنوز در حال اجراست. نشست صوتی وضعیت خودش را دارد و بخش پشت صحنه نیز وضعیت کار، مجوزها و فراخوانی ابزارهای جداگانهای دارد.
قطع کردن صحبت با لغو کردن عمل یکی نیست
برداشت Aipolix این است که در این معماری، لغو کردن کار باید قابلیتی صریح باشد. در یک چت ساده، متوقف کردن تولید پاسخ اغلب شبیه متوقف شدن کل فرایند به نظر میرسد. در عامل صوتی با واگذاری کار، متوقف شدن صدا و متوقف شدن عملی که در پشت صحنه انجام میشود دو موضوع جدا هستند.
فرض کنید عامل صوتی مشغول رزرو، تغییر تنظیمات حساب یا سپردن اصلاح یک مخزن کد به عامل دیگری باشد. اگر کاربر بگوید «نه، انجامش نده»، لایه صوتی میتواند فوراً سکوت کند، اما سامانه باید جداگانه تصمیم بگیرد کار واگذارشده لغو شود، ادامه پیدا کند یا برای تأیید متوقف بماند.
این قاعده نباید فقط از متن مکالمه برداشت شود. هر کار واگذارشده بهتر است شناسه، دامنه اختیار و وضعیت چرخه عمر خودش را داشته باشد. در گزارشهای سامانه هم باید بتوان درخواست صوتی، واگذاری ایجادشده، مدل یا عامل دریافتکننده، ابزارهای اجراشده و اثر نهایی را به هم وصل کرد.
برای کارهای طولانی یا دارای اثر خارجی، موضوع مهمتر است. مزیت تمامدوطرفه بودن این است که گفتوگو و کار میتوانند همزمان پیش بروند؛ اما همین همزمانی احتمال فاصله گرفتن خواسته فعلی کاربر از کاری را که سامانه همچنان انجام میدهد بیشتر میکند.
هزینه واقعی فقط نرخ هر دقیقه نیست
عدد ۰٫۰۵ دلار در دقیقه مربوط به لایه صوتی است. مدل پشت صحنه و ابزارها جداگانه هزینه دارند. بنابراین هزینه واقعی هر کار به مدت مکالمه، مصرف توکن، استفاده از ابزار و میزان واگذاری نیز وابسته است.
برای کارهای ساده و پرتعداد میتوان از مدل ارزانتر استفاده کرد و برای پشتیبانی پیچیده یا برنامهنویسی سراغ مدل قویتر رفت. این انعطاف مفید است، اما نرخ لایه صوتی بهتنهایی تصویر کاملی از هزینه نمیدهد.
ارزیابی تولیدی بهتر است هزینه را برای یک کار کامل بسنجد: مدت صوت، مصرف مدل پشت صحنه، فراخوانی ابزار، تلاشهای دوباره و دفعاتی که مکالمه به استدلال گرانتر منتقل میشود.
امنیت نیز باید هر دو بخش را پوشش دهد
کارت ایمنی GPT-Live میگوید خود مدل صوتی کنترلهای ایمنی سامانهای دارد و وقتی کار به مدل دیگری واگذار میشود، حفاظتهای همان مدل پشت صحنه نیز اعمال میشود. OpenAI همچنین میگوید GPT-Live بدون واگذاری، بهتنهایی دسترسی گسترده به ابزار یا اجرای کد ندارد.
پس ریسک فقط به مدل صوتی مربوط نیست. سطح خطر به مدلی که کار را میگیرد، ابزارهای آن و قواعد مجوزدهی برنامه بستگی دارد.
برای عامل صوتی واقعی، کنترل باید تمام زنجیره را پوشش دهد: قواعد مکالمه در لایه زنده، مجوز ابزار و عملیات در بخش پشت صحنه و وضعیتی در برنامه که هر واگذاری را به درخواست کاربر متصل نگه دارد. طبیعیتر شدن مکالمه نباید باعث شود اثرهای خارجی سختتر قابلردیابی یا لغو شوند.
عرضه GPT-Live-1 در API یک مدل ترکیب تازه برای عاملها ارائه میکند: گفتوگوی پیوسته در جلو و مدلها و ابزارهای قابلتعویض در پشت آن. فرصت فنی، تعامل سریعتر و طبیعیتر است؛ مسئولیت فنی هم این است که واگذاری، لغو، مجوزها، ثبت رویدادها و هزینه به همان اندازه صریح طراحی شوند.