AMD发布机器可读ISA,让前沿模型为其编写GPU内核
AMD在旧金山举行的Advancing AI活动中发布了ROCm.AI,利用前沿AI模型自动优化GPU内核和推理性能,通过发布机器可读ISA使模型能够原生编程AMD硬件,从而绕过CUDA护城河。
尽管AMD的GPU在性能上日益具有竞争力,但AMD一直难以摆脱其芯片因不支持CUDA而能力不足的认知。在本周于旧金山举行的Advancing AI活动中,AMD发布了ROCm.AI,承诺让用户通过“氛围编码”(vibe code)的方式获得更快的推理性能。
实际上,所谓的CUDA护城河在过去几年中已显著变浅。PyTorch和JAX等框架让开发者能够一次编写代码,并在大多数情况下随处运行,而无需接触CUDA或AMD的ROCm和HIP库。然而,代码能运行并不代表性能最优。像CUDA和ROCm这样的低级编程接口仍然是释放芯片真正潜力的关键。
手动调整GPU内核和通用矩阵乘法(GEMM)例程以充分利用芯片,并非所有人都具备所需经验。但事实证明,开发者试图优化的许多模型本身在这方面出奇地擅长。AMD企业副总裁兼AI软件和解决方案负责人Anush Elangovan表示:“对于每一代AMD GPU,我们不仅发布了ISA规范,还发布了机器可读的ISA。这使得前沿模型非常擅长为AMD硬件编程。”
借助ROCm.AI,AMD希望简化这一过程。该平台连接到运行在前沿模型上的现有代码助手,并提供部署、调试和优化AMD Instinct硬件模型及服务框架所需的工具和文档。其中一个工具是名为Hyperloom的自动化工作负载性能优化系统。当通过提示代码助手如“使用Hyperloom优化MiniMax M3”调用该工具时,它可能会在Docker容器中启动推理服务器,运行基准测试建立基线性能,分析工作负载以识别瓶颈,并动态调整配置甚至生成自定义CPU内核。在AMD新推出的Helios机架测试中,Elangovan声称该流程将模型性能提升了38%。
“我们希望让您能够发挥最大性能,”他说,“这让任何人都能极其轻松地消费、调试、分析和部署。”为进一步改进这一过程,AMD表示正利用与OpenAI和Anthropic等AI模型公司的密切关系,确保它们的模型经过训练,能更好地理解AMD硬件和软件的内部运作。Elangovan补充道:“我们不仅仅是使用前沿模型生成内核,我们正与前沿模型公司深度合作,使它们能够原生使用AMD编程。”
除了内置的命令行界面,ROCm.AI还将作为插件提供给流行的代码助手,包括Anthropic的Claude Code、OpenAI的Codex、Google的Antigravity和Cursor。