AMD et Cerebras, habituellement rivaux, s’associent autour d’un système d’inférence IA désagrégé

AMD et Cerebras Systems, deux entreprises plus habituées à se faire concurrence pour séduire les clients d’accélérateurs IA qu’à collaborer, annoncent le 23 juillet un partenariat technique qui répartit une charge de travail d’inférence IA entre leurs matériels respectifs. La conception désagrégée combine le système rackscale Helios d’AMD, bâti autour de ses GPU Instinct, avec le Wafer-Scale Engine de Cerebras, chacun prenant en charge l’étape d’inférence qu’il maîtrise le mieux.

L’architecture sépare l’inférence en deux phases. Helios d’AMD assure le traitement des prompts et le calcul en grand contexte, l’étape à haut débit où le modèle digère l’entrée de l’utilisateur et assemble le contexte pertinent. Le Wafer-Scale Engine de Cerebras prend ensuite le relais pour la génération de tokens, la phase de décodage où la faible latence et la grande bande passante mémoire sont primordiales. Les deux moteurs fonctionnent comme un seul flux de travail d’inférence via une API unifiée.

AMD et Cerebras affirment que le système combiné offre jusqu’à cinq fois plus de tokens par seconde par watt par rapport à une configuration Cerebras seule, sur la base de modélisations internes avec le modèle Kimi 2,6 à 1 000 milliards de paramètres. Cette métrique compte : à mesure que l’inférence IA passe des chatbots aux agents en temps réel, à la robotique et aux copilotes, l’efficacité énergétique par token détermine directement le coût et la faisabilité du déploiement.

« L’inférence IA devient l’une des plus grandes opportunités d’infrastructure dans le domaine de l’IA, et sa diversité croissante nécessite une approche plus flexible », déclare Lisa Su, PDG d’AMD, dans un communiqué. Andrew Feldman, PDG de Cerebras, présente le partenariat comme une initiative d’accès : « Un partenariat avec AMD nous offre une opportunité incroyable d’apporter cette performance à encore plus de clients. »

If you value careful, fact-driven reporting, consider supporting 1ban.news.

Contribute today

Ce partenariat est remarquable car les deux entreprises vendent du matériel conçu pour le même cas d’usage général. Les GPU Instinct d’AMD sont directement en concurrence avec la gamme pour centres de données de Nvidia, tandis que Cerebras positionne ses puces à l’échelle d’une tranche de silicium comme une alternative aux deux, offrant des performances extrêmes sur une seule puce en construisant une puce de la taille d’une tranche de silicium plutôt qu’en la découpant en dies individuels. L’approche désagrégée reconnaît qu’aucune architecture unique n’est optimale à la fois pour l’étape de traitement des prompts, gourmande en bande passante mémoire, et pour l’étape de décodage de l’inférence moderne, sensible à la latence.

Cerebras prévoit de déployer les systèmes Helios d’AMD dans ses propres centres de données, la solution conjointe étant disponible d’abord via Cerebras Cloud au second semestre 2026. L’annonce fait partie de l’événement Advancing AI 2026 d’AMD, qui a également vu le lancement du système rackscale Helios et de la série de GPU Instinct MI400.

Sources : AMD and Cerebras announce ultra-low-latency AI inference solution (AMD Newsroom, 23 juil. 2026) ; AMD partners with Cerebras for AI inference system (DCD, 23 juil. 2026) ; Cerebras press release (Cerebras, 23 juil. 2026)

Traduit par Lydie

Scroll to Top