AMD發佈機器可讀ISA,讓前沿模型為其編寫GPU內核
AMD在舊金山舉行的Advancing AI活動中發佈了ROCm.AI,利用前沿AI模型自動優化GPU內核和推理性能,通過發佈機器可讀ISA使模型能夠原生編程AMD硬件,從而繞過CUDA護城河。
儘管AMD的GPU在性能上日益具有競爭力,但AMD一直難以擺脱其芯片因不支持CUDA而能力不足的認知。在本週於舊金山舉行的Advancing AI活動中,AMD發佈了ROCm.AI,承諾讓用户通過“氛圍編碼”(vibe code)的方式獲得更快的推理性能。
實際上,所謂的CUDA護城河在過去幾年中已顯著變淺。PyTorch和JAX等框架讓開發者能夠一次編寫代碼,並在大多數情況下隨處運行,而無需接觸CUDA或AMD的ROCm和HIP庫。然而,代碼能運行並不代表性能最優。像CUDA和ROCm這樣的低級編程接口仍然是釋放芯片真正潛力的關鍵。
手動調整GPU內核和通用矩陣乘法(GEMM)例程以充分利用芯片,並非所有人都具備所需經驗。但事實證明,開發者試圖優化的許多模型本身在這方面出奇地擅長。AMD企業副總裁兼AI軟件和解決方案負責人Anush Elangovan表示:“對於每一代AMD GPU,我們不僅發佈了ISA規範,還發布了機器可讀的ISA。這使得前沿模型非常擅長為AMD硬件編程。”
藉助ROCm.AI,AMD希望簡化這一過程。該平台連接到運行在前沿模型上的現有代碼助手,並提供部署、調試和優化AMD Instinct硬件模型及服務框架所需的工具和文檔。其中一個工具是名為Hyperloom的自動化工作負載性能優化系統。當通過提示代碼助手如“使用Hyperloom優化MiniMax M3”調用該工具時,它可能會在Docker容器中啓動推理服務器,運行基準測試建立基線性能,分析工作負載以識別瓶頸,並動態調整配置甚至生成自定義CPU內核。在AMD新推出的Helios機架測試中,Elangovan聲稱該流程將模型性能提升了38%。
“我們希望讓您能夠發揮最大性能,”他説,“這讓任何人都能極其輕鬆地消費、調試、分析和部署。”為進一步改進這一過程,AMD表示正利用與OpenAI和Anthropic等AI模型公司的密切關係,確保它們的模型經過訓練,能更好地理解AMD硬件和軟件的內部運作。Elangovan補充道:“我們不僅僅是使用前沿模型生成內核,我們正與前沿模型公司深度合作,使它們能夠原生使用AMD編程。”
除了內置的命令行界面,ROCm.AI還將作為插件提供給流行的代碼助手,包括Anthropic的Claude Code、OpenAI的Codex、Google的Antigravity和Cursor。