AI News HubLIVE
站內改寫2 分鐘閱讀

AMD釋出機器可讀ISA,讓前沿模型為其編寫GPU核心

AMD在舊金山舉行的Advancing AI活動中釋出了ROCm.AI,利用前沿AI模型自動最佳化GPU核心和推理效能,透過釋出機器可讀ISA使模型能夠原生程式設計AMD硬體,從而繞過CUDA護城河。

來源Hacker News AI作者: logickkk1

儘管AMD的GPU在效能上日益具有競爭力,但AMD一直難以擺脫其晶片因不支援CUDA而能力不足的認知。在本週於舊金山舉行的Advancing AI活動中,AMD釋出了ROCm.AI,承諾讓使用者透過“氛圍編碼”(vibe code)的方式獲得更快的推理效能。

實際上,所謂的CUDA護城河在過去幾年中已顯著變淺。PyTorch和JAX等框架讓開發者能夠一次編寫程式碼,並在大多數情況下隨處執行,而無需接觸CUDA或AMD的ROCm和HIP庫。然而,程式碼能執行並不代表效能最優。像CUDA和ROCm這樣的低階程式設計介面仍然是釋放晶片真正潛力的關鍵。

手動調整GPU核心和通用矩陣乘法(GEMM)例程以充分利用晶片,並非所有人都具備所需經驗。但事實證明,開發者試圖最佳化的許多模型本身在這方面出奇地擅長。AMD企業副總裁兼AI軟體和解決方案負責人Anush Elangovan表示:“對於每一代AMD GPU,我們不僅釋出了ISA規範,還發布了機器可讀的ISA。這使得前沿模型非常擅長為AMD硬體程式設計。”

藉助ROCm.AI,AMD希望簡化這一過程。該平臺連線到執行在前沿模型上的現有程式碼助手,並提供部署、除錯和最佳化AMD Instinct硬體模型及服務框架所需的工具和文件。其中一個工具是名為Hyperloom的自動化工作負載效能最佳化系統。當透過提示程式碼助手如“使用Hyperloom最佳化MiniMax M3”呼叫該工具時,它可能會在Docker容器中啟動推理伺服器,執行基準測試建立基線效能,分析工作負載以識別瓶頸,並動態調整配置甚至生成自定義CPU核心。在AMD新推出的Helios機架測試中,Elangovan聲稱該流程將模型效能提升了38%。

“我們希望讓您能夠發揮最大效能,”他說,“這讓任何人都能極其輕鬆地消費、除錯、分析和部署。”為進一步改進這一過程,AMD表示正利用與OpenAI和Anthropic等AI模型公司的密切關係,確保它們的模型經過訓練,能更好地理解AMD硬體和軟體的內部運作。Elangovan補充道:“我們不僅僅是使用前沿模型生成核心,我們正與前沿模型公司深度合作,使它們能夠原生使用AMD程式設計。”

除了內建的命令列介面,ROCm.AI還將作為外掛提供給流行的程式碼助手,包括Anthropic的Claude Code、OpenAI的Codex、Google的Antigravity和Cursor。