Google construye un chip exclusivo para Gemini que podría reducir drásticamente los costos de inferencia de IA

Alphabet está desarrollando un chip para servidores que hace algo que ningún procesador de Google ha hecho antes: integra la arquitectura de Gemini directamente en el silicio. El chip, denominado internamente Frozen v2, está diseñado exclusivamente para la familia insignia de modelos de IA de Google, sacrificando la flexibilidad polivalente de una TPU a cambio de una ganancia sustancial en eficiencia.

The Information informó el 20 de julio que el proyecto apunta a un despliegue en 2028 y podría ofrecer de seis a diez veces más tokens por unidad de potencia que la última generación de TPU de Google, las TPU 8t para entrenamiento y TPU 8i para inferencia lanzadas a principios de este año. Las acciones de Alphabet subieron aproximadamente un 3 % con la noticia.

El nombre toma prestado un concepto de la terminología de entrenamiento: «congelar» los parámetros de un modelo para que dejen de cambiar. Aplicado al diseño de chips, significa cablear partes de la toma de decisiones de Gemini directamente en el silicio físico en lugar de calcularlas cada vez. El resultado es menos trabajo eléctrico por respuesta, lo que reduce el costo de servir IA a escala, una de las tensiones centrales en una industria donde cada nueva generación de modelos es más costosa de operar.

«El costo de servir IA a escala se ha convertido en una de las tensiones centrales de la industria», señaló CNBC en su propio reportaje sobre la historia, citando comentarios de analistas de que la carrera por la eficiencia puede importar más que la carrera por la capacidad en los próximos dos años.

Google se negó a confirmar los detalles del proyecto pero ofreció una declaración: «Nuestros equipos investigan y experimentan constantemente con nuevas innovaciones para ofrecer el máximo rendimiento y eficiencia a nuestros usuarios y clientes. Aunque no todos los proyectos llegan a producción, esta rigurosa exploración es central en nuestro enfoque integral».

Frozen v2 es parte de un cambio más amplio en la industria. OpenAI anunció su primer chip de inferencia personalizado, nombre clave Jalapeño, en junio. Según se informa, Anthropic está en conversaciones iniciales con Samsung sobre la fabricación de chips. El denominador común: a medida que los modelos de IA se vuelven más capaces, la dependencia del silicio estándar de Nvidia y otros se convierte tanto en una carga de costos como en un riesgo para la cadena de suministro. Google ya construye sus propias TPU, pero Frozen v2 va un paso más allá al vincular el diseño del chip a una sola familia de modelos, una apuesta a que la arquitectura de Gemini es lo suficientemente estable como para justificar la inversión.

Una mejora de 6 a 10 veces en tokens por vatio, de concretarse, haría que Gemini sea sustancialmente más barato de operar a escala. En un mundo donde los costos de inferencia determinan qué funciones se lanzan y cuáles permanecen experimentales, esa brecha de eficiencia puede convertirse en una ventaja estratégica, o en una vulnerabilidad si las suposiciones arquitectónicas resultan equivocadas.

Sources: Google is working on a new AI chip designed to make Gemini more efficient (TechCrunch, July 2026); Google’s Frozen v2 chip targets Gemini efficiency (NoWrap.ai, July 2026)

Traducido por Alessandra

Scroll to Top