
AMD y Cerebras Systems, dos empresas más acostumbradas a competir por los clientes de aceleradores de IA que a colaborar, anunciaron el 23 de julio una asociación técnica que divide una carga de trabajo de inferencia de IA entre sus respectivos hardwares. El diseño desagregado combina el sistema rackscale Helios de AMD, construido alrededor de sus GPUs Instinct, con el Wafer-Scale Engine de Cerebras, manejando cada uno la etapa de inferencia que mejor realiza.
La arquitectura separa la inferencia en dos fases. AMD Helios maneja el procesamiento de prompts y el cómputo de contexto amplio: la etapa de alto rendimiento donde el modelo digiere la entrada del usuario y ensambla el contexto relevante. Luego, el Wafer-Scale Engine de Cerebras toma el control para la generación de tokens, la fase de decodificación donde la baja latencia y el alto ancho de banda de memoria son más importantes. Ambos motores operan como un único flujo de trabajo de inferencia a través de una API unificada.
AMD y Cerebras afirman que el sistema combinado ofrece hasta cinco veces más tokens por segundo por vatio en comparación con una configuración solo de Cerebras, basándose en modelos internos con el modelo Kimi 2.6 de 1 billón de parámetros. La métrica importa: a medida que la inferencia de IA escala desde chatbots hasta agentes en tiempo real, robótica y copilotos, la eficiencia energética por token determina directamente el costo de implementación y la viabilidad.
“La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura en la IA, y su creciente diversidad requiere un enfoque más flexible”, dijo la CEO de AMD, Lisa Su, en un comunicado. El CEO de Cerebras, Andrew Feldman, enmarcó la asociación como una jugada de acceso: “Asociarnos con AMD nos da una oportunidad increíble de llevar ese rendimiento a aún más clientes.”
La asociación es notable porque ambas empresas venden hardware diseñado para el mismo caso de uso general. Las GPUs Instinct de AMD compiten directamente con la línea de centros de datos de Nvidia, mientras que Cerebras ha posicionado sus chips a escala de oblea como una alternativa a ambos, ofreciendo rendimiento extremo en un solo dado al fabricar un chip del tamaño de una oblea de silicio en lugar de cortarlo en dados individuales. El enfoque desagregado reconoce que ninguna arquitectura única es óptima tanto para la etapa de procesamiento de prompts, intensiva en ancho de banda de memoria, como para la etapa de decodificación sensible a la latencia de la inferencia moderna.
Cerebras planea desplegar sistemas AMD Helios en sus propios centros de datos, con la solución conjunta disponible primero a través de Cerebras Cloud en la segunda mitad de 2026. El anuncio fue parte del evento Advancing AI 2026 de AMD, que también vio el lanzamiento del sistema rackscale Helios y la serie de GPUs Instinct MI400.
Sources: AMD and Cerebras announce ultra-low-latency AI inference solution (AMD Newsroom, Jul 23, 2026); AMD partners with Cerebras for AI inference system (DCD, Jul 23, 2026); Cerebras press release (Cerebras, Jul 23, 2026)
Traducido por Alessandra

