Nouveaux modèles

Tencent ouvre Hy4 preview au code et aux agents à contexte d'un million de tokens

Tencent a publié Hy4 preview le 28 août comme grand modèle de langage ouvert destiné au génie logiciel, au travail bureautique et à la recherche scientifique. L'intérêt de cette sortie tient moins au fait que Tencent le présente comme un modèle de premier plan qu'au fait que l'entreprise livre une surface complète pour les développeurs : poids téléchargeables sous licence Apache 2.0, fenêtre de contexte d'un million de tokens, chemins de déploiement documentés pour vLLM et SGLang, outils de finetuning et de quantification, ainsi qu'un accès API payant.

Cette combinaison fait de Hy4 preview une option concrète pour les équipes qui évaluent de grands modèles ouverts pour des workflows agentiques à long contexte. Selon l'annonce de Tencent, le modèle compte 770 milliards de paramètres au total mais en active 49 milliards par token. Le dépôt officiel décrit une architecture Mixture-of-Experts avec 256 experts routés, huit experts routés activés par token, un expert partagé, une attention clairsemée et une couche native de décodage spéculatif. Reuters a confirmé indépendamment la sortie du 28 août et son orientation vers le code, la recherche et les tâches analytiques.

Un très grand modèle avec une empreinte active plus réduite

Hy4 preview est volumineux, même selon les standards actuels des modèles ouverts. Tencent annonce 770 milliards de paramètres pour le backbone, 49 milliards de paramètres actifs et une longueur de contexte d'un million de tokens. L'architecture Mixture-of-Experts signifie que la majorité des paramètres ne sont pas activés pour chaque token. Cela ne rend pas le déploiement léger, mais modifie le profil de calcul par rapport à un modèle dense d'une taille totale comparable.

Le dépôt fournit des détails d'architecture utiles aux équipes d'infrastructure, au lieu de se limiter à un endpoint hébergé. Le backbone comporte 78 couches. Tencent indique que le chemin d'attention utilise Gated DeepSeek Sparse Attention avec un mécanisme IndexCache qui réutilise les indices clairsemés entre les couches. Une couche native de multi-token prediction est également intégrée pour soutenir le décodage spéculatif. Le dépôt inclut des instructions de déploiement pour vLLM et SGLang, ainsi que des parcours de finetuning et de quantification.

Pour les architectes, cela signifie que Hy4 preview peut être évalué comme un modèle qu'une organisation peut exploiter et modifier, et pas seulement consommer derrière une interface hébergée. La licence Apache 2.0 est particulièrement importante pour les entreprises qui ont besoin de droits plus clairs pour l'adaptation interne et la redistribution que ceux offerts par certaines licences spécifiques aux modèles. Les équipes doivent toujours examiner la licence complète et leurs propres obligations de conformité, mais ce choix réduit un obstacle fréquent à l'adoption.

Tencent vise les livrables de travail, pas seulement le chat

Tencent positionne Hy4 preview sur des workloads de productivité plutôt que sur les seuls benchmarks conversationnels. L'entreprise indique avoir construit des données d'entraînement avec des ingénieurs logiciel, des développeurs de jeux, des analystes financiers et des spécialistes de la sécurité internes. La cible annoncée est le travail de longue durée couvrant planification, debugging, validation, analyse de plusieurs documents et création de livrables comme des documents, feuilles de calcul et présentations.

Le modèle est également intégré à CodeBuddy et WorkBuddy, et Tencent indique qu'il est accessible via Tencent Cloud TokenHub et OpenRouter. Le preview offre donc plusieurs chemins d'évaluation : héberger soi-même les poids, utiliser une API gérée ou tester le modèle dans des produits qui encapsulent des workflows agentiques autour de lui.

Tencent rapporte une évaluation interne en aveugle auprès de 163 experts et sur 203 tâches d'ingénierie, dans laquelle Hy4 preview obtient 2,99 sur 4, légèrement devant les modèles de comparaison cités par l'entreprise. Ces chiffres doivent être considérés comme des résultats fournis par le vendeur, et non comme un classement indépendant. La conception des tâches, la population d'évaluateurs et les conditions de comparaison sont déterminantes, et aucune reproduction indépendante n'est encore établie.

L'auto-optimisation est intéressante, mais demande de la prudence

L'une des affirmations les plus inhabituelles de Tencent est que Hy4 preview a participé à certaines parties de son propre développement. L'entreprise affirme que le modèle a proposé des approches, lancé des expériences et itéré sur des méthodes d'entraînement, des stratégies de données, des cadres d'évaluation et des opérateurs de bas niveau. Tencent indique également que le modèle a analysé des goulots d'étranglement d'inférence et contribué à des optimisations de fusion d'opérateurs et de communication qui auraient augmenté le débit de bout en bout de 31,8 % par rapport à son baseline.

Ce type de boucle peut être important pour les équipes qui construisent de l'ingénierie de modèles automatisée ou une infrastructure agentique. Le modèle n'est alors plus seulement le workload à optimiser. Il participe aussi au diagnostic et à la modification du système qui l'exécute.

Les preuves disponibles proviennent toutefois de Tencent. La sortie ne démontre pas que le même processus se généralise à d'autres stacks de modèles, environnements matériels ou équipes d'ingénierie, et le gain de débit dépend du baseline et des conditions d'implémentation de Tencent. Il faut donc le considérer comme un cas d'usage interne concret qui mérite d'être reproduit, plutôt que comme une preuve générale d'auto-amélioration récursive.

Ce que les développeurs devraient mesurer ensuite

Pour le génie logiciel, les questions pratiques comptent davantage que le nombre de paramètres. Les équipes devraient mesurer la résolution de tâches à l'échelle d'un dépôt, la fiabilité des outils, la qualité des patches, la discipline de test, la conservation du contexte et le coût dans leurs propres harnesses. Une fenêtre d'un million de tokens peut réduire une partie de la pression sur le retrieval, mais un contexte long ne garantit ni de meilleures décisions ni un coût d'inférence inférieur.

Les équipes d'infrastructure doivent aussi tester le serving sous une concurrence réaliste. Un chemin actif de 49 milliards de paramètres reste important, tandis que l'empreinte totale de 770 milliards entraîne des contraintes de stockage, de placement mémoire et de routage des experts. La quantification et le décodage spéculatif peuvent aider, mais l'économie de production dépendra de la topologie matérielle, de la longueur des requêtes et du taux d'utilisation.

Tencent affiche un prix API de 0,834 dollar par million de tokens en entrée, 2,501 dollars par million de tokens en sortie et 0,042 dollar par million de tokens en cache. Ces tarifs hébergés donnent un point de comparaison utile entre auto-hébergement et accès géré, sans pour autant représenter le coût applicatif total d'un agent de longue durée.

Hy4 preview est donc notable parce qu'il réunit trois éléments souvent séparés : un très grand modèle ouvert, une stack de déploiement exploitable par les développeurs et un positionnement clair sur la production de livrables réels. Les affirmations de performance doivent encore être validées indépendamment et le produit reste explicitement en preview. Pour les équipes qui évaluent des modèles ouverts pour le code et les systèmes agentiques à long contexte, la sortie est néanmoins suffisamment concrète pour être testée dès maintenant.

Sources
- Tencent Releases and Open-Sources Tencent Hy4 preview
- Tencent-Hunyuan/Hy4-preview
- Reuters: China's Tencent releases new open-source AI model for coding, research tasks

Publié: