Le 21 septembre, SpaceXAI a présenté Grok 4.7, décrit par l'entreprise comme son "modèle le plus performant pour le codage et le travail de connaissance". Le prix et la vitesse de l'API restent identiques à ceux de Grok 4.6 : 2 dollars par million de tokens en entrée, 6 dollars par million de tokens en sortie, avec en plus une version rapide au prix doublé et à la vitesse de sortie doublée. Le modèle est déjà disponible sur Cursor, Grok Build, la console API et des plateformes tierces.
"our most capable model for coding and knowledge work."
C'est ainsi que SpaceXAI positionne officiellement Grok 4.7 : un modèle destiné au codage et au travail de connaissance.
Selon l'entreprise, le nouveau modèle repose sur une base plus large que celle de 4.6, avec un entraînement par renforcement plus long, axé sur les tâches longues qui durent plusieurs heures, une meilleure autovérification et une meilleure gestion des contextes longs, ainsi qu'une intégration native avec Grok Bot.
Résultats officiels et évaluations tierces
Quelques chiffres publiés par SpaceXAI elle-même : DeepSWE v1.1 71,0 %, CursorBench 4.0 46,3 %, Terminal-Bench 4.0 37,6 %, EEBench (génie électrique) 64,0 %. Côté sécurité, l'entreprise affirme être en tête du secteur pour le taux de refus et la résistance au jailbreak, avec un taux de fuite des alertes de risque de 3,3 % sur HackerBench v0.3 ; l'accès red team reste réservé, sur invitation, à certains partenaires en cybersécurité.
Résultats de l'évaluateur indépendant Artificial Analysis : indice d'intelligence global de 46 points, soit 2 de plus que 4.6 ; indice d'agent de codage combiné à Grok Build de 56 points, soit 9 de plus que 4.6. Dans le détail, DeepSWE v1.1 est passé de 65 % à 73 %, Terminal-Bench 4.0 de 18 % à 33 %, et SWE-Atlas-QnA de 58 % à 63 %. Selon cette évaluation, Grok 4.7 associé à Grok Build se classe quatrième de l'indice d'agent de codage, derrière Claude Fable 5.1, GPT-6 Astra et Claude Opus 5. Sur le benchmark de travail de connaissance à long terme AA-Briefcase, il obtient 1657 points Elo, soit 111 de plus que 4.6.
La page officielle de lancement ne propose pas de classement direct face à la concurrence, et SpaceXAI n'a pas non plus réagi aux classements des évaluations tierces.
Faire le calcul de la consommation
La grille tarifaire n'a pas bougé, mais la consommation de tokens relevée par Artificial Analysis, si : au niveau xhigh, Grok 4.7 produit en moyenne environ 81 000 tokens de sortie par tâche, contre environ 38 000 pour 4.6 au même niveau, soit une hausse de 125 %. La vitesse de sortie est d'environ 188 tokens par seconde, une tâche durant en moyenne 7,1 minutes.
En calculant grossièrement, rien que pour la sortie, une tâche coûte environ 0,23 dollar sur 4.6 et environ 0,49 dollar sur 4.7. Le prix affiché reste le même, mais la dépense réelle par tâche a plus que doublé ; une bonne partie du gain de score s'obtient en laissant le modèle "réfléchir plus longtemps".
Rapporté à la grille tarifaire de cette semaine, le calcul devient encore plus frappant. Un jour après le lancement de Grok 4.7, Claude Opus 5.5 d'Anthropic et GPT-6 Sol d'OpenAI sont arrivés à leur tour : Opus 5.5 facture 4 dollars par million de tokens en entrée et 20 dollars en sortie, tandis que GPT-6 Sol est descendu à 2 et 10 dollars. Au prix affiché par million de tokens, le prix de sortie de Grok 4.7 reste le plus bas ; l'ampleur de la réduction de cet écart une fois ramené à la dépense réelle par tâche dépendra de la consommation de tokens des deux autres modèles, des données tierces qui ne sont pas encore toutes disponibles.
Moins de deux jours après que Grok 4.7 a atteint 46 points, Opus 5.5 et GPT-6, deux nouvelles générations de modèles, ont déjà rejoint la file d'évaluation d'Artificial Analysis ; la moitié supérieure du classement devrait encore bouger.
Sources : page officielle de lancement de SpaceXAI, CocoLoop, rapport d'évaluation d'Artificial Analysis ; le prix de l'API et les résultats officiels ont été vérifiés sur la page de lancement de SpaceXAI, l'indice d'intelligence, l'indice d'agent de codage et la consommation de tokens ont été vérifiés selon les données d'Artificial Analysis, et le coût de sortie par tâche est une estimation approximative basée sur le prix affiché.