تیم Pipecat در شرکت Daily مدل PhoneLLM Alpha 1 را منتشر کرده است؛ یک مدل زبانی open-weights که مشخصاً برای voice agentهای تلفنی آموزش دیده است. هدف این مدل رقابت به‌عنوان یک frontier model عمومی نیست. PhoneLLM برای مسئله محدودتری optimize شده است: پاسخ سریع، حفظ وضعیت در مکالمات چندمرحله‌ای و اجرای درست tool callها بدون وابستگی به reasoning طولانی.

این تفاوت در voice agent اهمیت زیادی دارد. در یک رابط متنی، یک ثانیه latency اضافه معمولاً فقط آزاردهنده است. در تماس تلفنی، همین تأخیر می‌تواند مکالمه را غیرطبیعی یا خراب جلوه دهد. Pipecat استدلال می‌کند که بسیاری از frontier modelها برای workloadهایی optimize شده‌اند که reasoning بیشتر قابل تحمل است، در حالی که phone agent تولیدی به ترکیب متفاوتی از سرعت، tool accuracy و هزینه نیاز دارد.

یک مدل 30B MoE با 3.5B پارامتر active

PhoneLLM Alpha 1 یک full-parameter fine-tune از NVIDIA Nemotron 3 Nano 30B-A3B است. مدل در مجموع حدود ۳۰ میلیارد parameter دارد، اما به دلیل معماری mixture-of-experts در هر token حدود ۳.۵ میلیارد parameter آن active می‌شود.

Pipecat مدل را با NVIDIA NeMo آموزش داده و weights را روی Hugging Face منتشر کرده است. model card طول context برابر 262,144 token، زبان فعلی English و تنظیم temperature صفر با thinking غیرفعال را برای inference توصیه می‌کند.

مدل را می‌توان با vLLM یا SGLang serve کرد. Pipecat می‌گوید PhoneLLM روی یک NVIDIA B200 اجرا می‌شود و در single-request به P95 time-to-first-token کمتر از 100ms می‌رسد. این اعداد اندازه‌گیری خود تیم سازنده هستند و باید به‌عنوان deployment guidance دیده شوند، نه benchmark مستقل.

PhoneLLM همچنین speech-to-speech model نیست. این مدل در لایه LLM یک pipeline متداول voice agent قرار می‌گیرد و در کنار speech recognition و text-to-speech استفاده می‌شود.

PhoneBench اقتصاد واقعی phone agent را وارد benchmark می‌کند

بخش شاید مهم‌تر این release معرفی PhoneBench Alpha 1 است؛ benchmark جدید Pipecat برای ارزیابی LLMها در phone agent.

PhoneBench پانزده مدل را روی مکالمات چندمرحله‌ای customer service ارزیابی می‌کند. معیارها شامل tool call، رفتار authentication، escalation، factual grounding، coherence مکالمه و هماهنگی بین چیزی است که agent می‌گوید و عملی که واقعاً انجام می‌دهد.

چون بسیاری از این موارد با exact match قابل ارزیابی نیستند، Pipecat از یک panel از LLM judgeها استفاده می‌کند که به گفته تیم با human labelها calibration شده‌اند. Pipecat همچنین می‌گوید scenarioها، tool listها و promptهای benchmark از داده training PhoneLLM جدا نگه داشته شده‌اند.

PhoneBench علاوه بر accuracy، time-to-first-answer-token و هزینه تخمینی هر دقیقه مکالمه را نیز اندازه می‌گیرد. این موضوع آن را به تصمیم واقعی برای production voice agent نزدیک‌تر می‌کند، چون در benchmarkهای معمول زبان، latency و serving economics اغلب دیده نمی‌شوند.

نتیجه گزارش‌شده نزدیک GPT-5.6 Terra با هزینه بسیار کمتر

در PhoneBench Alpha 1، Pipecat برای PhoneLLM امتیاز 72.3% گزارش می‌کند که تقریباً با GPT-5.6 Terra با امتیاز 72.4% برابر است. Gemini 3.6 Flash با 78.6% در این benchmark بالاتر قرار دارد.

تفاوت اصلی در cost و latency گزارش‌شده است. PhoneBench هزینه PhoneLLM را حدود 0.0025 دلار به ازای هر دقیقه مکالمه تخمین می‌زند، در برابر 0.0347 دلار برای GPT-5.6 Terra. Pipecat این اختلاف را حدود 94% کاهش هزینه توصیف می‌کند.

برای P95 time-to-first-answer-token نیز PhoneLLM حدود 600ms و GPT-5.6 Terra حدود 1,957ms گزارش شده‌اند، یعنی اختلافی نزدیک به 1.3 ثانیه.

این اعداد مهم‌اند، اما یک caveat اساسی دارند. PhoneBench توسط همان تیمی طراحی و اجرا شده که PhoneLLM را train کرده است. benchmark از LLM judge، تخمین هزینه و configuration انتخابی Pipecat استفاده می‌کند. بنابراین نتیجه نشان می‌دهد PhoneLLM در evaluation framework خود Pipecat چگونه عمل می‌کند و نباید آن را به‌عنوان برتری مستقل اثبات‌شده معرفی کرد.

سیگنال مهم‌تر، تخصصی‌شدن مدل‌هاست

این release یک انتخاب معماری مهم‌تر را برای production agentها نشان می‌دهد.

frontier model عمومی جذاب است چون می‌تواند تعداد زیادی task را انجام دهد. اما یک agent محدود لزوماً در هر turn به دانش گسترده یا reasoning طولانی نیاز ندارد. بیشتر به tool use قابل پیش‌بینی، latency کم، رفتار پایدار و هزینه‌ای نیاز دارد که با تعداد زیاد interaction مقیاس‌پذیر باشد.

Pipecat عملاً در حال آزمایش این فرض است که بخشی از این نیازها را می‌توان با fine-tuning هدفمند وارد model weights کرد، به‌جای اینکه همه چیز فقط با prompt engineering و routing به مدل‌های بزرگ‌تر حل شود.

این pattern می‌تواند خارج از phone agent هم مهم باشد. customer support، scheduling، assistantهای transactional و workflowهای محدود ممکن است بخش عمده turnها را با specialist model اجرا کنند و فقط موارد پیچیده را به مدل بزرگ‌تر route کنند.

open weights بودن نیز deployment را تغییر می‌دهد. تیم‌ها می‌توانند PhoneLLM را self-host کنند، inference را بر اساس latency target خود optimize کنند و workload مکالمه حساس را داخل infrastructure کنترل‌شده نگه دارند. در کنار BSD terms مربوط به تغییرات Pipecat، الزام‌های license مدل پایه Nemotron نیز همچنان اعمال می‌شود.

مرحله بعدی چیست

PhoneLLM Alpha 1 هنوز Alpha و در حال حاضر English-only است. مهم‌ترین claimهای performance از benchmark خود Pipecat می‌آیند، بنابراین independent testing روی accentهای مختلف، audio pipelineهای noisy، مکالمات طولانی‌تر، tool schemaهای متفاوت و traffic واقعی production اهمیت زیادی خواهد داشت.

اما ایده اصلی روشن است: performance یک voice agent دیگر فقط مسئله انتخاب «بهترین LLM» نیست. specialization مدل، serving configuration، evaluation، latency و cost باید هم‌زمان طراحی شوند.

PhoneLLM و PhoneBench این trade-off را آشکار می‌کنند. سؤال production به‌تدریج از «کدام LLM در کل بهتر است؟» به این تبدیل می‌شود: «کدام مدل برای این agent، با این latency target، این ابزارها و این cost envelope مناسب‌تر است؟»

Sources
- Daily / Pipecat: Announcing Pipecat PhoneLLM Alpha 1
- Pipecat: PhoneBench Alpha 1
- Hugging Face: Pipecat PhoneLLM Alpha 1 model card