L'équipe Pipecat de Daily a publié PhoneLLM Alpha 1, un modèle open-weights entraîné spécifiquement pour les agents vocaux téléphoniques. Il ne cherche pas à devenir un modèle frontier généraliste. Il est optimisé pour un problème de production plus étroit: répondre vite, maintenir l'état d'un dialogue multi-tours et appeler correctement les outils sans dépendre de longues traces de raisonnement.

Cette distinction est importante pour la voix. Dans une interface texte, une seconde de latence supplémentaire est gênante. Au téléphone, elle peut rendre la conversation artificielle. Pipecat estime que les modèles frontier récents sont souvent optimisés pour des tâches où un temps de raisonnement supplémentaire est acceptable, alors qu'un agent téléphonique exige un autre équilibre entre vitesse, précision des outils et coût.

Un MoE de 30B avec 3,5B de paramètres actifs

PhoneLLM Alpha 1 est un fine-tuning complet de NVIDIA Nemotron 3 Nano 30B-A3B. Le modèle compte environ 30 milliards de paramètres au total, mais près de 3,5 milliards sont actifs par token grâce à son architecture mixture-of-experts.

Pipecat l'a entraîné avec NVIDIA NeMo et publie les poids sur Hugging Face. La model card indique une fenêtre de contexte de 262 144 tokens, l'anglais comme langue prise en charge et recommande une température à zéro avec le mode thinking désactivé.

Le modèle peut être servi avec vLLM ou SGLang. Pipecat indique qu'il fonctionne sur un seul NVIDIA B200 et annonce un P95 inférieur à 100 ms pour le time-to-first-token en requête unique. Ces chiffres sont des mesures de l'équipe elle-même et doivent être lus comme des indications de déploiement, pas comme une validation indépendante.

PhoneLLM n'est pas non plus un modèle speech-to-speech. Il occupe la couche LLM d'un pipeline d'agent vocal classique, aux côtés de la reconnaissance vocale et de la synthèse vocale.

PhoneBench ajoute l'économie de production au benchmark

La partie la plus intéressante de la sortie est peut-être PhoneBench Alpha 1, le nouveau benchmark de Pipecat pour les LLM utilisés dans les agents téléphoniques.

PhoneBench évalue quinze modèles sur des conversations multi-tours de service client. Les critères incluent les tool calls, l'authentification, l'escalade, le factual grounding, la cohérence de la conversation et la correspondance entre ce que l'agent dit et l'action qu'il exécute réellement.

Comme ces propriétés sont difficiles à mesurer avec un simple exact match, Pipecat utilise un panel de LLM judges calibrés, selon l'équipe, par rapport à des labels humains. Les scénarios, outils et prompts du benchmark sont présentés comme séparés des données utilisées pour entraîner PhoneLLM.

PhoneBench mesure aussi le time-to-first-answer-token et estime le coût par minute. Cela le rapproche d'une décision de production réelle, où la latence et l'économie du serving sont aussi importantes que l'accuracy.

Des résultats proches de GPT-5.6 Terra selon Pipecat

Dans PhoneBench Alpha 1, Pipecat attribue 72,3% à PhoneLLM, presque au même niveau que GPT-5.6 Terra à 72,4%. Gemini 3.6 Flash arrive en tête avec 78,6%.

La différence la plus forte apparaît dans le coût et la latence rapportés. PhoneBench estime PhoneLLM à environ 0,0025 dollar par minute de conversation, contre 0,0347 dollar pour GPT-5.6 Terra. Pipecat présente cette différence comme une réduction d'environ 94%.

Le benchmark indique également environ 600 ms de P95 time-to-first-answer-token pour PhoneLLM, contre 1 957 ms pour GPT-5.6 Terra, soit environ 1,3 seconde d'écart.

Ces chiffres sont significatifs, mais nécessitent une réserve. PhoneBench est conçu et exécuté par la même organisation qui a entraîné PhoneLLM. Il s'appuie sur des LLM judges, des coûts estimés et la configuration de serving choisie par Pipecat. Les résultats décrivent donc les performances dans le cadre d'évaluation de Pipecat, et non une supériorité établie de manière indépendante.

Le signal principal est la spécialisation

La sortie met en évidence un choix d'architecture plus large pour les agents en production.

Un modèle frontier généraliste est utile car il peut accomplir de nombreux types de tâches. Mais un agent étroitement défini n'a pas forcément besoin de connaissances universelles ou d'un long raisonnement à chaque tour. Il a surtout besoin d'un tool use prévisible, d'une faible latence, d'un dialogue stable et d'une économie compatible avec un grand nombre d'interactions.

Pipecat teste donc l'idée qu'une partie de ces exigences peut être intégrée directement dans les poids grâce à un fine-tuning ciblé, plutôt que résolue uniquement par le prompting et le routage vers des modèles plus grands.

Ce modèle peut dépasser la téléphonie. Le support client, la prise de rendez-vous et d'autres workflows transactionnels peuvent exécuter la majorité des tours avec un modèle spécialisé et réserver les cas complexes à un modèle plus puissant.

Les poids ouverts modifient aussi le déploiement. Les équipes peuvent auto-héberger PhoneLLM, optimiser le serving autour de leurs propres objectifs de latence et garder des conversations sensibles dans une infrastructure contrôlée. Les obligations de licence du Nemotron sous-jacent restent applicables en plus des termes BSD de Pipecat.

Ce qu'il faut surveiller

PhoneLLM Alpha 1 reste une version alpha et ne prend actuellement en charge que l'anglais. Les principales affirmations de performance viennent du benchmark de Pipecat, ce qui rend les tests indépendants importants, notamment sur différents accents, des pipelines audio bruités, de longues conversations, des schémas d'outils variés et du trafic réel.

L'idée de fond est toutefois claire: les performances d'un agent vocal deviennent un problème de système combinant spécialisation du modèle, serving, évaluation, latence et coût.

PhoneLLM et PhoneBench rendent ce compromis explicite. La question n'est plus seulement «quel LLM est le meilleur?», mais «quel modèle est le meilleur pour cet agent, avec cette cible de latence, ces outils et cette enveloppe de coût?»

Sources
- Daily / Pipecat: Announcing Pipecat PhoneLLM Alpha 1
- Pipecat: PhoneBench Alpha 1
- Hugging Face: Pipecat PhoneLLM Alpha 1 model card