
Moonshot AI发布了Kimi K3,这是一个拥有2.8万亿参数的开放权重模型,是迄今为止在开放许可下发布的最大模型——但这一引人注目的参数数量具有误导性。K3的重要意义在于其背后的架构策略:刻意押注于内存而非算力,这一策略直接由美国出口管制对中国AI企业施加的硬件限制所塑造。
K3采用了专家混合架构,拥有896个专门化的子网络,每个token仅激活其中16个。这大幅降低了每个token所需的计算量,但全部2.8万亿参数必须保持在内存中加载,随时准备被调用。该模型从微调阶段起就以4位精度进行训练,将其内存占用从估计的5.6TB减少到约1.4TB——Moonshot表示,这一选择是”为了广泛的硬件兼容性”,以对冲非Nvidia芯片的风险。
正如AI News所指出的,关键洞察在于:”内存可以跨大量个体上并不出众的芯片收集起来。而训练级别的算力无法以同样的方式组合。”瞄准高带宽内存的出口管制迫使中国AI企业在与美国同行不同的约束下进行创新,K3的架构直接反映了这一现实。
该模型引入了Kimi Delta Attention,这是一种优化技术,通过处理在长文档处理中成为主要内存消耗者的不断增长的键值缓存,在百万token上下文中实现高达6.3倍的解码加速。Moonshot已将缓存代码贡献给开源vLLM推理服务项目。
在Arena Frontend Code评估中,K3获得了1,679分,排名第一,领先于Anthropic的Fable 5。但Moonshot公开承认,整体性能”仍落后于”Claude Fable 5和GPT 5.6 Sol,并且如果推理服务框架未能正确传递历史思维内容,生成质量可能”高度不稳定”。该公司还指出,当意图不明确时,K3可能”代表用户做出意外决定”,并且与领先的美国模型相比存在”显著的UX差距”。
推荐的推理服务配置需要64个或更多加速器连接为单一内存池,标准的开源推理服务工具尚不支持K3的新架构——Moonshot正在与推理合作伙伴合作以缩小这一差距。权重计划于2026年7月27日公开发布。
定价为每百万输入token 3美元,每百万输出token 15美元,缓存输入为0.30美元——远低于Fable 5的50美元输出定价,但高于DeepSeek V4的0.87美元和z.ai GLM-5.2的4.40美元。
来源:Kimi K3开放权重模型:中国最大AI押注内存而非算力(AI News,2026年7月)
婷 翻译

