
Moonshot AI ha lanzado Kimi K3, un modelo de peso abierto de 2,8 billones de parámetros, el más grande jamás publicado bajo una licencia abierta — pero el llamativo número de parámetros es engañoso. Lo que hace significativo a K3 es la estrategia arquitectónica que lo respalda: una apuesta deliberada por la memoria en lugar de la computación, moldeada directamente por las restricciones de hardware impuestas a las empresas chinas de IA por los controles de exportación estadounidenses.
K3 utiliza una arquitectura Mixture-of-Experts con 896 subredes especializadas, de las cuales solo 16 se activan por token. Esto reduce drásticamente la computación requerida por token, pero los 2,8 billones de parámetros deben permanecer cargados en memoria, listos para ser convocados. El modelo fue entrenado con precisión de 4 bits desde la etapa de fine-tuning, reduciendo su huella de memoria de un estimado de 5,6 terabytes a aproximadamente 1,4 terabytes — una decisión tomada, según Moonshot, “para una amplia compatibilidad de hardware”, protegiéndose contra silicio que no sea de Nvidia.
La idea clave, como señaló AI News, es que “la memoria puede acumularse a través de una gran cantidad de chips individualmente comunes. La potencia de cómputo de entrenamiento no puede ensamblarse de la misma manera.” Los controles de exportación que se dirigen a la memoria de alto ancho de banda han forzado a las empresas chinas de IA a innovar en torno a una restricción diferente a la que enfrentan sus contrapartes estadounidenses, y la arquitectura de K3 refleja directamente esa realidad.
El modelo introduce Kimi Delta Attention, una optimización que ofrece una decodificación hasta 6,3 veces más rápida en contextos de millones de tokens al abordar el creciente caché de clave-valor que se convierte en el consumidor dominante de memoria en el procesamiento de documentos largos. Moonshot ha contribuido con el código de almacenamiento en caché al proyecto de servidor open-source vLLM.
En la evaluación Arena Frontend Code, K3 obtuvo 1.679 puntos — primer lugar, por delante de Fable 5 de Anthropic. Pero Moonshot reconoce abiertamente que el rendimiento general “todavía va por detrás” de Claude Fable 5 y GPT 5.6 Sol, y que la calidad de generación puede ser “altamente inestable” si el arnés de servicio no logra devolver el contenido de pensamiento histórico. La compañía también señala que K3 puede tomar “decisiones inesperadas en nombre del usuario” cuando la intención es ambigua, y que existe una “brecha UX notable” en comparación con los modelos estadounidenses líderes.
El servicio recomendado requiere 64 o más aceleradores cableados como un único grupo de memoria, y las herramientas de servidor open-source estándar aún no admiten las nuevas arquitecturas de K3 — Moonshot está trabajando con socios de inferencia para cerrar la brecha. Los pesos están programados para su lanzamiento público el 27 de julio de 2026.
Los precios se fijan en 3 $ por millón de tokens de entrada y 15 $ por millón de tokens de salida, con entradas en caché a 0,30 $ — muy por debajo de los 50 $ de salida de Fable 5 pero por encima de los 0,87 $ de DeepSeek V4 y los 4,40 $ de z.ai GLM-5.2.
Fuentes: Kimi K3 modelo de peso abierto: la mayor IA de China apuesta por la memoria, no por la computación (AI News, julio de 2026)
Traducido por Alessandra

