Grok 4.6 arrive avec une fenêtre de contexte de 500 000 jetons et une offensive sur les agents de longue durée

SpaceXAI a lancé Grok 4.6 le 12 août, la dernière itération de sa famille de modèles phares, résolument tournée vers le développement logiciel et les agents d’IA de longue durée. L’entreprise, née de l’absorption de xAI par SpaceX en juin 2026, présente cette sortie comme une réponse à la demande croissante de modèles capables de mener à bien des tâches complexes en plusieurs étapes : rechercher un sujet, parcourir une vaste base de code ou transformer une idée encore sommaire en application fonctionnelle.

Le modèle conserve la fenêtre de contexte de 500 000 jetons de son prédécesseur, Grok 4.5, avec une date limite de connaissances fixée au 1er février 2026. Il accepte du texte et des images et produit du texte, avec des niveaux de raisonnement configurables et un usage d’outils couvrant l’appel de fonctions, l’exécution de code, la recherche web et la recherche X. Les prix restent fixés à 2 dollars pour chaque million de jetons d’entrée et 6 dollars pour chaque million de jetons de sortie, avec une variante plus rapide au double du prix.

SpaceXAI affirme que Grok 4.6 fait jeu égal avec GPT-5.6 Sol sur l’indice composite d’intelligence d’Artificial Analysis, les deux obtenant 61 points contre 62 pour Claude Fable 5 Max. Les tests indépendants menés par Artificial Analysis aboutissent à un constat similaire : un Elo de 1 753 sur sa jauge GDPval-AA v2 du travail intellectuel pratique des agents, deuxième seulement derrière Claude Opus 5, et assez proche de Claude Fable 5 et de Qwen3.8 Max pour se situer dans la marge d’erreur. La même analyse a constaté que Grok 4.6 termine ses tâches en environ 53 tours et quelque 0,5 milliard de jetons d’entrée en moyenne, contre environ 103 tours et 2 milliards de jetons pour Claude Opus 5 à effort maximal, ce qui lui confère un net avantage de coût sur les longues exécutions d’agents.

Le tableau de benchmarks publié par le fournisseur montre des gains partout par rapport à Grok 4.5, dont un bond de 11,9 points sur DeepSWE et de 10,3 points sur Terminal-Bench, ainsi que des premières places sur GDPVal-AA v2, sur AA-Briefcase et sur le benchmark juridique Harvey LAB. Sur les mesures spécifiques au codage, le tableau est plus contrasté : GPT-5.6 Sol Max reste en tête sur DeepSWE v1.1 avec 73 % et sur Terminal-Bench v3.0 avec 34,6 %.

Support independent reporting built on evidence, transparency, and scientific rigor.

Back evidence-based news

L’entraînement a suivi le schéma établi par Grok 4.5, mais est allé plus loin : une phase complémentaire plus longue avec des données générées par le modèle et soigneusement sélectionnées, un optimiseur amélioré, et des trajectoires SFT régénérées par Grok 4.5 lui-même dans le raisonnement, les STEM, l’ingénierie logicielle, les environnements d’agents et le travail intellectuel, avec filtrage des traces problématiques. L’apprentissage par renforcement a couvert des tâches d’agents dans l’optimisation de noyau, le développement web et la conception assistée par ordinateur. L’entreprise indique que les garde-fous du modèle ont été calibrés en parallèle des capacités élargies et testés dans la suite de pré-déploiement la plus vaste qu’elle ait jamais réalisée.

La disponibilité suit le schéma du déploiement de Grok 4.5 : le modèle est disponible dans Cursor et Grok Build, via l’API de SpaceXAI et par l’intermédiaire de partenaires comme OpenRouter, Vercel et Cloudflare, avec une utilisation incluse doublée dans Cursor et Grok Build pendant la semaine de lancement. Le calendrier s’inscrit dans la cadence rapide de SpaceXAI après son introduction en Bourse ; l’entreprise, cotée sous le symbole SPCX, a fait du codage et du travail d’agents sa voie concurrentielle, et son acquisition de l’éditeur Cursor lui a donné un accès direct au marché des développeurs ainsi que de véritables sessions de codage pour ses données d’entraînement.

Traduit par Lydie

Sources: Introducing Grok 4.6 (SpaceXAI, Aug 2026); Introducing Grok 4.6 (Cursor, Aug 2026); Grok 4.6 (xAI Docs, Aug 2026); Grok 4.6 benchmarks and analysis (Artificial Analysis, Aug 2026); SpaceXAI releases Grok 4.6 (9to5Mac, Aug 2026)

Scroll to Top