SpaceXAI a lancé Grok 4.7 le 21 septembre 2026 pour la programmation assistée et les travaux qui demandent plusieurs étapes. Le modèle est disponible par l’API de l’éditeur, dans Grok Build et Cursor; GitHub annonce également son arrivée progressive dans Copilot. Son tarif de base par jeton reste identique à celui de Grok 4.6. Cela ne signifie pourtant pas que le coût d’une tâche terminée restera le même.

Une évaluation extérieure, publiée par Artificial Analysis, observe des progrès sur plusieurs travaux de longue durée, mais aussi une consommation nettement plus élevée de jetons de sortie et des résultats inégaux selon les épreuves. Pour une équipe qui envisage une migration, la question utile porte donc sur le coût d’un résultat validé, et non sur le seul prix affiché par million de jetons.

Ce que confirme réellement la sortie du modèle

Dans son annonce officielle, SpaceXAI présente une base plus grande que celle de Grok 4.6 et un entraînement par renforcement prolongé sur des problèmes difficiles. L’entreprise attribue aussi au nouveau modèle une meilleure vérification de son propre travail et une adaptation plus poussée à son environnement d’agents. Ces éléments décrivent les choix et les affirmations du concepteur; ils ne constituent pas en eux-mêmes une validation indépendante des performances ni des protections de sécurité.

Les notes de version du 21 septembre confirment l’identifiant `grok-4.7`, une capacité de contexte de 500 000 jetons, des entrées textuelles et visuelles, et des sorties textuelles. Quatre niveaux d’effort de raisonnement sont proposés: low, medium, high et xhigh, le troisième étant sélectionné par défaut. Dans la Responses API, `reasoning.encrypted_content` est toujours renvoyé; les applications qui poursuivent une conversation doivent transmettre ces éléments sans les modifier lors de l’appel suivant.

L’arrivée dans les outils de développement ne se fait pas partout en une fois. GitHub annonce un déploiement progressif dans plusieurs environnements Copilot, dont l’agent de programmation dans le cloud. Les administrateurs disposent d’une règle de sélection des modèles pour encadrer l’accès. Une annonce de disponibilité ne garantit donc pas que chaque utilisateur puisse déjà choisir Grok 4.7.

Des progrès mesurés, mais tributaires du contexte d’essai

Artificial Analysis a testé Grok 4.7 au niveau de raisonnement xhigh. Il obtient 46 points à son indice général, deux de plus que Grok 4.6. Dans l’indice consacré aux agents de programmation, le résultat passe de 47 à 56 points lorsque les deux versions utilisent Grok Build. Certaines évaluations de travaux professionnels complexes montrent également une amélioration.

Il faut lire ces chiffres avec leur protocole. L’épreuve de programmation mesure un modèle associé à un environnement d’exécution particulier; elle ne permet pas d’attribuer toute la progression aux seuls poids du modèle. Sur d’autres composantes, les gains sont plus modestes et l’évaluateur signale des reculs, notamment dans une épreuve de recherche au sein de longs contextes et dans un test d’automatisation. Il serait également trompeur de rapprocher sans précision un modèle testé en xhigh d’un autre exécuté à son réglage high par défaut.

Les comparaisons de SpaceXAI mettent en avant des avantages de rapidité et de coût sur certains bancs d’essai. Elles restent des mesures publiées par le fournisseur; les résultats de Cursor ne constituent pas non plus une expertise extérieure à cet écosystème commercial. L’évaluation indépendante confirme des progrès ciblés, sans prouver une amélioration uniforme pour chaque dépôt, application ou usage de sécurité.

Un tarif inchangé peut masquer une facture plus lourde

Pour l’API de SpaceXAI, lorsque l’invite contient moins de 200 000 jetons, les tarifs sont de 2 dollars par million de jetons en entrée, 0,50 dollar pour les entrées issues du cache et 6 dollars pour les sorties. Au-delà de ce seuil, ils passent respectivement à 4, 1 et 12 dollars. La variante Fast, plus chère, est annoncée dans Cursor et Grok Build, mais n’est pas proposée sur l’API publique de xAI.

Les conditions de Cursor prévoient une autre frontière tarifaire. Le contexte ordinaire y atteint 256 000 jetons, avec une option étendue jusqu’à 500 000. Quand l’entrée dépasse 256 000 jetons, la requête standard entière est facturée au double du tarif normal. Dans l’option Fast à contexte étendu, le barème atteint trois fois le tarif standard. Une estimation qui appliquerait à Cursor le seuil de 200 000 jetons de l’API xAI serait donc erronée.

L’évaluation d’Artificial Analysis révèle un autre facteur. À effort xhigh équivalent, Grok 4.7 produit environ 81 000 jetons de sortie par tâche, contre environ 38 000 pour Grok 4.6. Le volume a ainsi plus que doublé dans ces essais, alors que le tarif de sortie de base est resté stable. Cela ne suffit pas à calculer le coût d’une tâche réussie: il faut aussi tenir compte des entrées, du cache, des tentatives infructueuses et de la part des résultats effectivement acceptés.

Le bon indicateur économique est le travail réellement validé

L’analyse d’Aipolix part de ces deux constats: le fournisseur facture des jetons, tandis que l’entreprise attend un résultat exploitable. Il faut donc définir avant l’essai ce qui constitue une tâche réussie, par exemple une modification de code ayant passé des tests indépendants ou un document conforme à tous les critères de livraison. On exécute ensuite les deux modèles sur les mêmes cas, avec les mêmes outils, les mêmes versions des dépôts et les mêmes règles de nouvelle tentative.

La mesure doit comprendre les livrables acceptés, le temps de correction humaine, la durée totale, la consommation de jetons, l’usage du cache et les dépenses liées aux échecs. La documentation de facturation de xAI indique que `usage.cost_in_usd_ticks` fournit le montant réellement facturé pour chaque appel, après réductions et avec les coûts des outils exécutés côté serveur. Cette valeur concerne une requête précise: elle doit être additionnée sur toute la séquence de travail.

À prix égal par jeton, un modèle qui consomme deux fois plus de sorties doit compenser cette dépense par davantage de résultats acceptés, moins de reprises ou moins de correction humaine. À l’inverse, une seule réussite peut coûter moins cher que plusieurs essais ratés avec un modèle réputé économique. Seule une comparaison fondée sur les tâches propres à l’organisation permet de trancher.

Avant une migration, vérifier les performances dans son propre environnement

La sortie de Grok 4.7 est concrète, avec de nouvelles capacités documentées et des progrès observés par un évaluateur extérieur dans plusieurs usages d’agents. Les promesses générales du concepteur concernant la vitesse, la sécurité ou la supériorité demandent toutefois à rester attribuées. Les différences de tarifs entre plateformes et les variations de consommation selon l’effort de raisonnement compliquent encore la comparaison.

Une démarche prudente consiste à conduire un essai limité avec le réglage réellement envisagé en production, en conservant des tâches et un environnement stables. Il faut inclure des demandes de long contexte, contrôler les autorisations des modèles dans Copilot et préserver une solution de repli. La décision de généraliser Grok 4.7 doit venir de la qualité des livrables acceptés et de leur coût complet.

Sources
- https://x.ai/news/grok-4-7
- https://docs.x.ai/developers/release-notes
- https://artificialanalysis.ai/articles/benchmarking-grok-4-7
- https://prod.cursor.com/docs/models/grok-4-7
- https://docs.x.ai/developers/cost-tracking
- https://github.blog/changelog/2026-09-21-grok-4-7-is-now-available-in-github-copilot/