AMD与Cerebras化敌为友,联合打造解聚式AI推理系统

AMD与Cerebras Systems这两家更习惯于在AI加速器客户争夺中相互竞争的企业,于7月23日宣布了一项技术合作,将AI推理工作负载分配至各自的硬件。这一解聚式设计将AMD围绕其Instinct GPU打造的Helios机架级系统与Cerebras的Wafer-Scale Engine相结合,各自处理其最擅长的推理阶段。

该架构将推理分为两个阶段。AMD Helios负责提示处理和大上下文计算,即模型消化用户输入并组装相关上下文的高吞吐阶段。随后Cerebras的Wafer-Scale Engine接管Token生成,即低延迟和高内存带宽至关重要的解码阶段。两个引擎通过统一API作为单一推理工作流运行。

AMD与Cerebras声称,基于使用Kimi 2.6万亿参数模型的内部建模,该组合系统相比仅使用Cerebras的配置,每瓦每秒Token数可提升高达5倍。这一指标至关重要:随着AI推理从聊天机器人扩展至实时代理、机器人和副驾驶,每个Token的能效直接决定了部署成本和可行性。

AMD首席执行官苏姿丰在声明中表示:「AI推理正成为AI领域最大的基础设施机遇之一,其日益增长的多样性需要更灵活的方法。」Cerebras首席执行官Andrew Feldman将此次合作定位为一场准入之战:「与AMD合作使我们拥有绝佳机会,将这种性能带给更多客户。」

Our mission is simple: reliable news backed by careful research. Help us continue that mission.

Help us grow

此次合作引人注目,因为两家公司销售面向相同通用用例的硬件。AMD的Instinct GPU直接与Nvidia的数据中心产品线竞争,而Cerebras则将其晶圆级芯片定位为两者的替代方案,通过制造硅晶圆大小的芯片而非将其切割成单个Die,提供极致的单芯片性能。这种解聚式方法承认,对于现代推理中内存带宽密集的提示处理阶段和对延迟敏感的解码阶段,没有任何单一架构能够同时达到最优。

Cerebras计划在其自有数据中心部署AMD Helios系统,联合解决方案将于2026年下半年首先通过Cerebras Cloud提供。该公告是AMD「Advancing AI 2026」活动的一部分,该活动还推出了Helios机架级系统和Instinct MI400系列GPU。

Sources: AMD and Cerebras announce ultra-low-latency AI inference solution (AMD Newsroom, Jul 23, 2026); AMD partners with Cerebras for AI inference system (DCD, Jul 23, 2026); Cerebras press release (Cerebras, Jul 23, 2026)

婷 翻译

Scroll to Top