隨著人工智慧改變產業與國家安全,掌握最新硬體能力對維持技術優勢十分關鍵。AI 加速器是專門為神經網路、深度學習和機器學習等任務提速的系統,近十年來一直是研發熱點。自 2018 年起,MIT 林肯實驗室超級計算中心(LLSC)的一個團隊開始開展林肯 AI 計算調查(Lincoln AI Computing Survey,簡稱 LAICS,讀作“lace”)。如今六篇論文之後,LAICS 仍在持續彙總市面上的商用 AI 加速器,並比較它們的峰值效能和峰值功耗。
LLSC 的 Albert Reuther 表示,大約八年前,他們看到研究論文中描述的研究型 AI 加速器以及廠商宣佈的商用加速器數量急劇上升,實驗室的政府資助方也開始詢問相關問題。這促使團隊啟動這項調查。LLSC 負責執行和最佳化實驗室數千名研究人員使用的高效能運算系統。
雖然 AI 加速器常用於機器學習,但它們也能支援其他並行應用,例如分子功能建模和流體動力學模擬加速,這些過程計算成本很高。
AI 加速器有多種形態:中央處理器(CPU)、圖形處理器(GPU)、專用積體電路(ASIC)、現場可程式設計門陣列(FPGA)和資料流加速器。不同型別的加速器能力略有差異。CPU 適合通用計算,而 ASIC 只能執行非常特定的任務。資料流加速器、FPGA 和 GPU 更靈活,可針對多種工作負載進行配置。由於設計方式不同,各類加速器的效率和效能也各不相同。LAICS 的目標是調查當前市場上的技術並進行比較,以便為特定需求找到最合適的加速器。
該調查由 Reuther 領導,團隊成員包括 LLSC 的 Michael Jones、Peter Michaleas、Jeremy Kepner 和 Vijay Gadepally。團隊還與林肯實驗室多個部門的研究人員合作,包括先進技術部以及情報、監視與偵察和戰術系統部,以瞭解加速器如何支援其任務的研發工作。
系列論文的第一篇研究了 57 款加速器,而最新一篇考察了 120 多款。團隊用於比較加速器的主要指標是峰值效能和功耗,然後按晶片、板卡或系統進行分類。論文中的所有資料都來自公開來源,這可能具有挑戰性,因為一些公司傾向於不公開其效能和功耗資料。為了跟上領域最新進展,Reuther 每天進行新聞和引用檢索,彙總新的技術媒體報道、公司公告和行業演示。
Reuther 說,每年都有另外 5 到 10 家初創公司獲得融資並對外宣佈,然後釋出新的 AI 加速器,這繼續令他感到驚訝。人們可能認為這一領域已經足夠飽和,但隨後又會出現一批創新加速器。
除了總結當前加速器的效能與峰值功耗,每篇論文還會探討該領域的一個新方面。例如,2022 年發表的論文調查了效能提升的來源,發現它們來自更小、更密集的電晶體設計,以及使用更低的數值精度(即計算更少的有效數字)。最新論文考察了可用的不同架構選擇,分析增加某些元件(例如每個處理器更多核心或並行效能)會如何改變系統。
Reuther 計劃在可預見的未來繼續這項調查。他指出,僅在過去幾個月裡,就有六家初創公司宣佈了他們的首款 AI 加速器。
Reuther 表示,AI 及其執行的硬體是非常熱門的話題,林肯實驗室作為無偏的技術顧問,在選擇和推進正確技術方面發揮重要作用。他們的 AI 加速器調查幫助許多資助方和政府同事更好地理解 AI 加速器格局,並在相關研究和採購決策上做出更佳選擇。這項調查對於確定 LLSC 未來系統採購應考慮哪些 GPU 也很有價值,因此它不僅使資助方和任務專案受益,也使所有 LLSC 使用者受益。
完整的系列論文和配套資料集可在此處找到。