AMD让AI模型优化AMD硬件,削弱CUDA的开发者生态系统优势

AMD试图解决其最持久的竞争问题,即CUDA生态系统差距,其方法是将AI模型本身作为桥梁。在旧金山举办的Advancing AI活动上,该公司发布了ROCm.AI,这是一个利用前沿大语言模型在AMD Instinct硬件上自动部署、调试和优化AI模型的平台,有效绕过了历来有利于Nvidia CUDA堆栈的手动低级编程。

该平台可接入现有的代码助手(Claude Code、OpenAI Codex、Google的Antigravity和Cursor),并为它们提供AMD的硬件文档和工具链。当开发者提示助手针对AMD硬件优化模型时,ROCm.AI可以在容器中启动推理服务器,运行基准测试以建立基线性能,分析工作负载以识别瓶颈,并动态调整配置设置或生成自定义内核代码。AMD声称,这一由名为Hyperloom的工具驱动的过程,在其新推出的Helios机架系统测试中,使模型性能相比基线提升了38%。

ROCm.AI背后的核心洞察在于,前沿模型越来越能够读取机器可读的指令集架构规范并编写优化的GPU内核,而这一任务此前需要专业 expertise。AMD AI软件企业副总裁Anush Elangovan指出,AMD为每一代GPU发布了机器可读的ISA规范,这意味着前沿模型能够直接针对AMD硬件进行编程。

AMD还与OpenAI、Anthropic及其他模型开发方合作,确保他们的模型经过训练能够原生理解AMD的硬件和软件架构,而无需翻译层。这种方法将优化的负担从开发者专业技能转移到模型能力上,这是一场豪赌,赌的是AI模型质量的提升轨迹将比人类开发者管线的扩展速度更快。

If you found this article useful, please consider helping us keep 1ban.news independent.

Keep quality journalism alive

更广泛的竞争背景解释了其紧迫性。PyTorch和JAX等框架已经侵蚀了CUDA的终端用户锁定优势,使代码能够在任一平台上运行而只需极少的修改。但性能优化仍然是一个差异化因素:手动调优的CUDA内核通常比通用的ROCm兼容内核能提取更高的吞吐量。ROCm.AI旨在缩小这一性能差距,不是通过雇佣更多的人类内核工程师(考虑到GPU编程人才的集中度,这是一个困难的提议),而是让AI来进行调优。

该平台可作为命令行工具和主流编码助手的插件使用。这些性能提升能否在广泛的模型架构和部署场景中保持,以及开发者是否信任生产环境中AI生成的内核代码,将决定ROCm.AI能否兑现其真正削弱CUDA护城河的承诺。

来源:The Register(2026年7月24日);AMD新闻材料(2026年7月24日);The Next Platform(2026年7月)

婷 翻译

Scroll to Top