AMD Advancing AI 2026:與AMD的Alan Smith探討CDNA5架構
在AMD Advancing AI 2026活動上,AMD公司研究員兼資料中心GPU首席架構師Alan Smith詳細介紹了全新CDNA5架構。該架構從傳統的GCN基礎遷移至RDNA,採用分離式計算小晶片設計,分別最佳化HPC(雙精度)和AI(張量)工作負載。此外,CDNA5淘汰了Wave64支援,轉而使用四個SIMD32單元執行Wave32指令,並將每波前可訪問的向量暫存器(VGPR)數量從256提升至1024。快取系統也進行了重構,採用每基礎晶片的客戶端L2快取,替代了此前的Infinity Cache,以提升全域性原子操作頻寬和能效。
在AMD Advancing AI 2026大會上,AMD公司研究員兼資料中心GPU首席架構師Alan Smith接受了Chips and Cheese的專訪,全面解讀了全新CDNA5架構的技術革新。CDNA5是AMD Instinct GPU系列(包括新發布的MI455和Helios)的核心架構,相比前代CDNA架構,實現了從底層到上層的徹底重構。
從GCN到RDNA的架構遷移
最顯著的變化是CDNA5放棄了自2012年Tahiti時代延續的GCN架構基礎,轉而基於RDNA架構重新設計。Alan Smith指出,這一決策源於對現代架構的需求:GCN遺留的快取系統和執行引擎(如工作排程、波前排序、指令發射等)已無法滿足效率提升要求。透過融合RDNA的先進特性,AMD得以整合GPU產品線路線圖,使遊戲(RDNA)和資料中心(CDNA)架構在AI計算方面實現協同最佳化——例如,遊戲中的神經渲染和超解析度技術正越來越多地依賴AI,而資料中心AI工作負載也能受益於統一的底層設計。
HPC與AI的雙晶片策略
針對HPC(高效能運算)和AI工作負載的差異,CDNA5採用了創新的計算小晶片(Compute Chiplet)分拆方案。兩種小晶片共享相同的WGP(工作組處理器)基礎架構,包括向量暫存器檔案、LDS、快取、前端排程器和向量ALU,唯一區別在於數值計算單元:HPC小晶片保留完整的IEEE 754雙精度浮點單元,滿足傳統模擬需求;AI小晶片則透過最大化向量和張量操作吞吐量來最佳化AI推理與訓練。這種設計利用了AMD的chiplet架構優勢,無需在單一晶片上妥協,同時保持軟體和矽片層面的高度複用。
SIMD與波前模型的進化
CDNA5將每個計算單元(CU)的SIMD單元從四個SIMD16(執行Wave64指令,每四周期一條)改為四個SIMD32(執行Wave32指令,每週期一條),並徹底淘汰了Wave64支援。Alan解釋,Wave64雖在某些場景能提升指令效率,但帶來的分支分歧和暫存器壓力更大;根據AMD的工作負載追蹤,Wave32在絕大多數情況下效能更優。放棄Wave64後,晶片面積和功耗得以用於改善常見場景效能。此外,CDNA5的SIMD內部仍保留了用於提高VOP2雙發射速率的額外ALU單元,確保單週期指令吞吐量達到32次操作。
暫存器與快取體系的重構
為緩解暫存器壓力,CDNA5將每個波前可定址的向量暫存器(VGPR)數量從256提升至1024,使波前能夠更充分地利用大暫存器檔案,減少溢位。物理暫存器檔案總量為每WGP 1024個VGPR,相比RDNA3/4有所減少,但Alan表示這一容量是根據CDNA5目標工作負載的暫存器行為精確定製的。
快取架構的變革更為徹底。CDNA5不再使用CDNA3/4中的私有L1、每XCD的L2以及作為粘合劑的Infinity Cache。取而代之的是在每個基礎晶片(Base Die,稱為FCD)上整合一個大容量全域性L2(GL2)快取,作為客戶端側快取(client-side cache)。每個基礎晶片上的GL2可快取所有全域性地址,而同一基礎晶片內的所有著色引擎(Shader Engine)共享該GL2,實現了跨8個著色引擎的L2資料複用。雙基礎晶片之間透過14 TB/s雙向的片間互聯(die-to-die)保持快取一致性,頻寬足以支援各晶片獨立訪問全部HBM記憶體頻寬(NPS1模式)。這一設計顯著降低了跨晶片訪問延遲,並提升了全域性原子操作的吞吐量。
總結
CDNA5代表了AMD資料中心GPU架構的一次根本性革新。透過擁抱RDNA基礎、引入計算晶片分拆、廢棄Wave64、擴大暫存器並重構快取層次,AMD在AI和HPC工作負載上實現了更高的效率與效能。隨著MI455和Helios的推出,CDNA5將為下一代AI基礎設施提供強勁動力。