AI News HubLIVE
站內改寫1 分鐘閱讀

Kernel Forge:用於基於LLM的CUDA核心生成與最佳化的智慧體工具

Kernel Forge是一個開源端到端智慧體框架,可接受任何未經修改的PyTorch模型,利用蒙特卡洛樹搜尋探索多個最佳化路徑,並配備圖形使用者介面。在NVIDIA DGX Spark上對四個模型進行測試,僅需50次最佳化迭代,即可在14個核心上超越PyTorch eager模式,最高加速2.83倍。

來源arXiv AI作者: Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

隨著機器學習模型越來越多地嵌入日常軟體,其大部分執行時間都花在少量計算核心上,如矩陣乘法、卷積和歸一化。最佳化這些核心是減少延遲和成本的最直接方法之一,但傳統上需要專家工程師手動編寫底層GPU程式碼。基於大型語言模型(LLM)的智慧體系統現在能夠以更少的人力生成和最佳化核心,但現有工具大多在隨機生成的張量和孤立核心上進行評估,輸出需要開發者手動重新整合的獨立CUDA程式碼,主要針對LLM PyTorch模型,並且對檢查與除錯結果的支援有限。

針對這些不足,研究團隊提出了Kernel Forge,這是一個開源、端到端的智慧體工具,能夠接受任何未經修改的PyTorch模型。與現有工具不同,Kernel Forge支援視覺、擴散和LLM工作負載,採用蒙特卡洛樹搜尋(MCTS)探索多條最佳化路徑,而不是單一的精煉鏈。它還附帶圖形使用者介面,用於監控進度、檢查候選核心和除錯失敗。

研究團隊在搭載GB10 GPU的NVIDIA DGX Spark上,對涵蓋視覺、擴散和LLM工作負載的四個PyTorch模型進行了評估。每個核心僅進行50次最佳化迭代,Kernel Forge最佳化了14個核心,使其效能超越PyTorch eager模式:在ResNet-50上,adaptive_avgpool2d加速1.52倍;在Stable Diffusion 3.5 Medium上,group_norm加速1.70倍;在Gemma 4 E2B上,softmax加速2.83倍;在Qwen 3.5 35B-A3B上,softmax加速1.54倍。這些結果表明,Kernel Forge能夠有效降低核心最佳化的門檻,為AI部署帶來顯著的效能提升。Kernel Forge的程式碼已開源,可供研究者和開發者使用。