Google a revu en profondeur la facturation de sa plateforme d’IA Gemini cet été, avec une structure tarifaire plus granulaire qui varie selon le modèle, la tâche et le volume de données, des changements qui signifient que les utilisateurs risquent d’obtenir moins de réponses pour le même niveau de dépenses, à moins qu’ils ne suivent activement leur consommation.
La nouvelle tarification divise les coûts en plusieurs composantes. Les jetons d’entrée représentent le texte, les images ou les fichiers envoyés au modèle ; les jetons de sortie représentent la réponse du modèle. Chaque modèle Gemini a un tarif différent, et les fonctionnalités optionnelles telles que les fenêtres de contexte plus grandes ajoutent des coûts supplémentaires. L’ancrage avec Google Search, par exemple, ajoute une surcharge par requête de 35 $ pour 1 000 invites pour les modèles Gemini 2.5 et 2.0 au-delà des limites quotidiennes gratuites, et de 14 $ pour 1 000 pour les modèles Gemini 3.
Google a également restructuré ses niveaux d’abonnement grand public. Le nouveau niveau d’entrée Google AI Plus, introduit en juillet 2026, offre 400 gigaoctets de stockage et le double des limites d’utilisation du niveau gratuit pour 7,99 $ par mois. Au-dessus, Google AI Pro coûte 19,99 $ par mois (anciennement Google One AI Premium, désormais avec 5 téraoctets de stockage) et Google AI Ultra commence à 99,99 $ par mois avec 20 téraoctets de stockage et un accès aux capacités Deep Think. Un niveau premium à 200 $ par mois au sein d’Ultra offre une capacité supplémentaire.
Pour les développeurs, l’API Gemini reste à l’utilisation. Gemini 3.5 Flash coûte 1,50 $ par million de jetons d’entrée et 9 $ par million de jetons de sortie. Gemini 2.5 Pro coûte respectivement 1,25 $ et 10 $. Une SKU de tarification agent appelée AlphaEvolve, ajoutée en juillet 2026, applique une majoration transparente de 2x par rapport au tarif de base du modèle, ce qui rend le coût total exactement trois fois supérieur au prix du modèle sous-jacent.
L’impact sur la facturation est facile à sous-estimer. Dix mille requêtes avec 2 000 jetons d’entrée et 1 000 jetons de sortie chacune consomment 30 millions de jetons. Même à des tarifs par jeton peu élevés, le total s’accumule rapidement. Utiliser un modèle premium inutilement, ce qu’un analyste a décrit comme « prendre un taxi au lieu d’un bus », amplifie l’effet.
Google propose plusieurs outils pour suivre l’utilisation. La console de facturation affiche les dépenses par projet et par modèle. Les pages d’utilisation détaillent le nombre de jetons d’entrée et de sortie. Les journaux d’API offrent une granularité par requête. Il est recommandé de définir des alertes de budget à 50, 80 et 100 pour cent des plafonds mensuels, ainsi que d’étiqueter les projets par cas d’utilisation, assistance par chatbot, encadrement de code, recherche de documents, afin d’identifier la fonctionnalité qui génère la plus forte consommation.
De petites modifications dans la structure des invites peuvent générer des économies significatives. Réduire chaque invite de 25 pour cent dans un système traitant 25 000 conversations quotidiennes avec une moyenne de 800 jetons d’entrée et 500 jetons de sortie permet d’économiser des millions de jetons par mois sans réduire le volume de chat. Adapter la puissance du modèle à la complexité de la tâche, en utilisant des modèles moins chers pour la classification et l’étiquetage tout en réservant les modèles premium pour le raisonnement complexe, constitue un autre levier.
« La tarification de l’IA de Google est gérable si vous la mesurez de près, choisissez le bon modèle et définissez des alertes de dépenses strictes », conseille l’entreprise.
Sources : How Google’s New Gemini Rates Work and How to Track Your Usage (Wired, juillet 2026) ; Google Gemini Pricing (UsagePricing, juillet 2026)
Traduit par Lydie

