تیم Pipecat در شرکت Daily مدل PhoneLLM Alpha 1 را منتشر کرده است؛ یک مدل زبانی open-weights که مشخصاً برای voice agentهای تلفنی آموزش دیده است. هدف این مدل رقابت بهعنوان یک frontier model عمومی نیست. PhoneLLM برای مسئله محدودتری optimize شده است: پاسخ سریع، حفظ وضعیت در مکالمات چندمرحلهای و اجرای درست tool callها بدون وابستگی به reasoning طولانی.
این تفاوت در voice agent اهمیت زیادی دارد. در یک رابط متنی، یک ثانیه latency اضافه معمولاً فقط آزاردهنده است. در تماس تلفنی، همین تأخیر میتواند مکالمه را غیرطبیعی یا خراب جلوه دهد. Pipecat استدلال میکند که بسیاری از frontier modelها برای workloadهایی optimize شدهاند که reasoning بیشتر قابل تحمل است، در حالی که phone agent تولیدی به ترکیب متفاوتی از سرعت، tool accuracy و هزینه نیاز دارد.
یک مدل 30B MoE با 3.5B پارامتر active
PhoneLLM Alpha 1 یک full-parameter fine-tune از NVIDIA Nemotron 3 Nano 30B-A3B است. مدل در مجموع حدود ۳۰ میلیارد parameter دارد، اما به دلیل معماری mixture-of-experts در هر token حدود ۳.۵ میلیارد parameter آن active میشود.
Pipecat مدل را با NVIDIA NeMo آموزش داده و weights را روی Hugging Face منتشر کرده است. model card طول context برابر 262,144 token، زبان فعلی English و تنظیم temperature صفر با thinking غیرفعال را برای inference توصیه میکند.
مدل را میتوان با vLLM یا SGLang serve کرد. Pipecat میگوید PhoneLLM روی یک NVIDIA B200 اجرا میشود و در single-request به P95 time-to-first-token کمتر از 100ms میرسد. این اعداد اندازهگیری خود تیم سازنده هستند و باید بهعنوان deployment guidance دیده شوند، نه benchmark مستقل.
PhoneLLM همچنین speech-to-speech model نیست. این مدل در لایه LLM یک pipeline متداول voice agent قرار میگیرد و در کنار speech recognition و text-to-speech استفاده میشود.
PhoneBench اقتصاد واقعی phone agent را وارد benchmark میکند
بخش شاید مهمتر این release معرفی PhoneBench Alpha 1 است؛ benchmark جدید Pipecat برای ارزیابی LLMها در phone agent.
PhoneBench پانزده مدل را روی مکالمات چندمرحلهای customer service ارزیابی میکند. معیارها شامل tool call، رفتار authentication، escalation، factual grounding، coherence مکالمه و هماهنگی بین چیزی است که agent میگوید و عملی که واقعاً انجام میدهد.
چون بسیاری از این موارد با exact match قابل ارزیابی نیستند، Pipecat از یک panel از LLM judgeها استفاده میکند که به گفته تیم با human labelها calibration شدهاند. Pipecat همچنین میگوید scenarioها، tool listها و promptهای benchmark از داده training PhoneLLM جدا نگه داشته شدهاند.
PhoneBench علاوه بر accuracy، time-to-first-answer-token و هزینه تخمینی هر دقیقه مکالمه را نیز اندازه میگیرد. این موضوع آن را به تصمیم واقعی برای production voice agent نزدیکتر میکند، چون در benchmarkهای معمول زبان، latency و serving economics اغلب دیده نمیشوند.
نتیجه گزارششده نزدیک GPT-5.6 Terra با هزینه بسیار کمتر
در PhoneBench Alpha 1، Pipecat برای PhoneLLM امتیاز 72.3% گزارش میکند که تقریباً با GPT-5.6 Terra با امتیاز 72.4% برابر است. Gemini 3.6 Flash با 78.6% در این benchmark بالاتر قرار دارد.
تفاوت اصلی در cost و latency گزارششده است. PhoneBench هزینه PhoneLLM را حدود 0.0025 دلار به ازای هر دقیقه مکالمه تخمین میزند، در برابر 0.0347 دلار برای GPT-5.6 Terra. Pipecat این اختلاف را حدود 94% کاهش هزینه توصیف میکند.
برای P95 time-to-first-answer-token نیز PhoneLLM حدود 600ms و GPT-5.6 Terra حدود 1,957ms گزارش شدهاند، یعنی اختلافی نزدیک به 1.3 ثانیه.
این اعداد مهماند، اما یک caveat اساسی دارند. PhoneBench توسط همان تیمی طراحی و اجرا شده که PhoneLLM را train کرده است. benchmark از LLM judge، تخمین هزینه و configuration انتخابی Pipecat استفاده میکند. بنابراین نتیجه نشان میدهد PhoneLLM در evaluation framework خود Pipecat چگونه عمل میکند و نباید آن را بهعنوان برتری مستقل اثباتشده معرفی کرد.
سیگنال مهمتر، تخصصیشدن مدلهاست
این release یک انتخاب معماری مهمتر را برای production agentها نشان میدهد.
frontier model عمومی جذاب است چون میتواند تعداد زیادی task را انجام دهد. اما یک agent محدود لزوماً در هر turn به دانش گسترده یا reasoning طولانی نیاز ندارد. بیشتر به tool use قابل پیشبینی، latency کم، رفتار پایدار و هزینهای نیاز دارد که با تعداد زیاد interaction مقیاسپذیر باشد.
Pipecat عملاً در حال آزمایش این فرض است که بخشی از این نیازها را میتوان با fine-tuning هدفمند وارد model weights کرد، بهجای اینکه همه چیز فقط با prompt engineering و routing به مدلهای بزرگتر حل شود.
این pattern میتواند خارج از phone agent هم مهم باشد. customer support، scheduling، assistantهای transactional و workflowهای محدود ممکن است بخش عمده turnها را با specialist model اجرا کنند و فقط موارد پیچیده را به مدل بزرگتر route کنند.
open weights بودن نیز deployment را تغییر میدهد. تیمها میتوانند PhoneLLM را self-host کنند، inference را بر اساس latency target خود optimize کنند و workload مکالمه حساس را داخل infrastructure کنترلشده نگه دارند. در کنار BSD terms مربوط به تغییرات Pipecat، الزامهای license مدل پایه Nemotron نیز همچنان اعمال میشود.
مرحله بعدی چیست
PhoneLLM Alpha 1 هنوز Alpha و در حال حاضر English-only است. مهمترین claimهای performance از benchmark خود Pipecat میآیند، بنابراین independent testing روی accentهای مختلف، audio pipelineهای noisy، مکالمات طولانیتر، tool schemaهای متفاوت و traffic واقعی production اهمیت زیادی خواهد داشت.
اما ایده اصلی روشن است: performance یک voice agent دیگر فقط مسئله انتخاب «بهترین LLM» نیست. specialization مدل، serving configuration، evaluation، latency و cost باید همزمان طراحی شوند.
PhoneLLM و PhoneBench این trade-off را آشکار میکنند. سؤال production بهتدریج از «کدام LLM در کل بهتر است؟» به این تبدیل میشود: «کدام مدل برای این agent، با این latency target، این ابزارها و این cost envelope مناسبتر است؟»