Google construit une puce dédiée à Gemini qui pourrait diviser par dix les coûts d’inférence IA

Alphabet développe une puce serveur qui fait ce qu’aucun processeur Google n’a fait auparavant : elle intègre l’architecture de Gemini directement dans le silicium. La puce, désignée en interne sous le nom Frozen v2, est conçue exclusivement pour la famille phare de modèles d’IA de Google, sacrifiant la flexibilité polyvalente d’une TPU au profit d’un gain d’efficacité considérable.

The Information a rapporté le 20 juillet que le projet vise un déploiement en 2028 et pourrait offrir six à dix fois plus de tokens par unité de puissance que la dernière génération de TPU de Google, les TPU 8t pour l’entraînement et TPU 8i pour l’inférence lancées plus tôt cette année. L’action Alphabet a grimpé d’environ 3 % à la nouvelle.

Le nom emprunte un concept de la terminologie d’apprentissage : le « gel » des paramètres d’un modèle pour qu’ils cessent d’évoluer. Appliqué à la conception de puces, cela signifie câbler certaines parties du processus décisionnel de Gemini dans le silicium physique plutôt que de les calculer à chaque fois. Le résultat est moins de travail électrique par réponse, ce qui réduit le coût du déploiement de l’IA à grande échelle, l’une des tensions centrales d’un secteur où chaque nouvelle génération de modèle devient plus coûteuse à faire fonctionner.

« Le coût du déploiement de l’IA à grande échelle est devenu l’une des tensions centrales du secteur », a noté CNBC dans son propre article sur le sujet, citant des analystes selon lesquels la course à l’efficacité pourrait compter plus que la course aux capacités au cours des deux prochaines années.

Google a refusé de confirmer les spécificités du projet mais a fourni une déclaration : « Nos équipes effectuent constamment des recherches et expérimentent de nouvelles innovations pour offrir des performances et une efficacité maximales à nos utilisateurs et clients. Bien que tous les projets n’aboutissent pas en production, cette exploration rigoureuse est au cœur de notre approche intégrée. »

Frozen v2 s’inscrit dans une tendance plus large du secteur. OpenAI a annoncé sa première puce d’inférence sur mesure, nom de code Jalapeño, en juin. Anthropic serait en pourparlers préliminaires avec Samsung pour la fabrication de puces. Le point commun : à mesure que les modèles d’IA deviennent plus performants, la dépendance au silicium standard de Nvidia et d’autres devient à la fois un fardeau financier et un risque pour la chaîne d’approvisionnement. Google construit déjà ses propres TPU, mais Frozen v2 va plus loin en mariant la conception de la puce à une seule famille de modèles, un pari que l’architecture de Gemini est suffisamment stable pour justifier l’investissement.

Une amélioration de 6 à 10 fois du nombre de tokens par watt, si elle se concrétise, rendrait Gemini considérablement moins cher à exploiter à grande échelle. Dans un monde où les coûts d’inférence déterminent quelles fonctionnalités sont déployées et lesquelles restent expérimentales, un tel écart d’efficacité peut devenir un avantage stratégique, ou une vulnérabilité si les hypothèses architecturales s’avèrent erronées.

Sources : Google is working on a new AI chip designed to make Gemini more efficient (TechCrunch, juillet 2026) ; Google’s Frozen v2 chip targets Gemini efficiency (NoWrap.ai, juillet 2026)

Traduit par Lydie

Scroll to Top