
Moonshot AI a publié Kimi K3, un modèle open-weight de 2,8 billions de paramètres — le plus grand jamais publié sous licence ouverte — mais le chiffre phare du nombre de paramètres est trompeur. Ce qui rend K3 significatif, c’est la stratégie architecturale qui le sous-tend : un pari délibéré sur la mémoire plutôt que sur le calcul, façonné directement par les contraintes matérielles imposées aux entreprises chinoises d’IA par les contrôles à l’exportation américains.
K3 utilise une architecture Mixture-of-Experts avec 896 sous-réseaux spécialisés, dont seulement 16 sont activés par token. Cela réduit considérablement le calcul requis par token, mais les 2,8 billions de paramètres doivent rester chargés en mémoire, prêts à être sollicités. Le modèle a été entraîné en précision 4 bits à partir de l’étape de fine-tuning, réduisant son empreinte mémoire d’environ 5,6 téraoctets à environ 1,4 téraoctet — un choix fait, selon Moonshot, « pour une large compatibilité matérielle », en se prémunissant contre les puces non-Nvidia.
L’idée clé, comme l’a noté AI News, est que « la mémoire peut être rassemblée sur un grand nombre de puces individuellement banales. La puissance de calcul d’entraînement ne peut pas être assemblée de la même manière. » Les contrôles à l’exportation qui ciblent la mémoire à large bande passante ont forcé les entreprises chinoises d’IA à innover autour d’une contrainte différente de celle à laquelle sont confrontées leurs homologues américaines, et l’architecture de K3 reflète directement cette réalité.
Le modèle introduit Kimi Delta Attention, une optimisation qui permet un décodage jusqu’à 6,3 fois plus rapide dans des contextes de millions de tokens en traitant le cache croissant de clés-valeurs qui devient le principal consommateur de mémoire dans le traitement de longs documents. Moonshot a contribué le code de mise en cache au projet open-source vLLM.
Sur l’évaluation Arena Frontend Code, K3 a obtenu 1 679 points — première place, devant le Fable 5 d’Anthropic. Mais Moonshot reconnaît ouvertement que la performance globale « reste en retrait » par rapport à Claude Fable 5 et GPT 5.6 Sol, et que la qualité de génération peut être « hautement instable » si le serveur d’inférence ne parvient pas à retransmettre le contenu de réflexion historique. L’entreprise note également que K3 peut prendre « des décisions inattendues au nom de l’utilisateur » lorsque l’intention est ambiguë, et qu’il existe un « écart UX notable » par rapport aux principaux modèles américains.
Le déploiement recommandé nécessite 64 accélérateurs ou plus câblés en un seul pool de mémoire, et les outils de déploiement open-source standards ne supportent pas encore les nouvelles architectures de K3 — Moonshot travaille avec des partenaires d’inférence pour combler le fossé. Les poids sont prévus pour une publication publique le 27 juillet 2026.
Les prix sont fixés à 3 $ par million de tokens d’entrée et 15 $ par million de tokens de sortie, avec les entrées en cache à 0,30 $ — bien en dessous du tarif de sortie de 50 $ de Fable 5 mais au-dessus des 0,87 $ de DeepSeek V4 et des 4,40 $ de z.ai GLM-5.2.
Sources : Kimi K3 open-weight model : le plus grand IA de Chine mise sur la mémoire, pas le calcul (AI News, juillet 2026)
Traduit par Lydie

