跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

ParallelKernelBench:前沿LLM尚無法編寫快速的多GPU內核

文章摘要

ParallelKernelBench是一個新的基準測試,評估LLM編寫多GPU CUDA內核的能力。在87個真實問題中,最佳模型僅能正確解決不到三分之一,且只有不到四分之一的解決方案優於基線。文章分析了模型失敗的原因,並展示了幾個意外生成的高性能內核案例。

ParallelKernelBench:前沿LLM尚無法編寫快速的多GPU內核
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

ParallelKernelBench(PKB)是一個新的基準測試和評估框架,旨在測試大型語言模型(LLM)編寫多GPU CUDA內核的能力。該基準包含87個來自實際代碼庫的問題,任務是將PyTorch + NCCL實現替換為直接通過NVLink傳輸數據的CUDA內核。研究人員測試了GPT-5.5、Gemini 3 Pro、Opus 4.7等前沿編碼模型,結果顯示整體性能差距顯著:最佳模型僅能正確解決不到三分之一的問題,且只有不到四分之一的解決方案優於樸素的PyTorch + NCCL基線。

與單GPU內核生成不同,多GPU內核生成面臨三個獨特挑戰:設計空間呈組合式擴展(需要結合張量並行、專家並行等多種並行策略)、性能模型改變(瓶頸往往在於互連帶寬而非計算或內存帶寬),以及引入關鍵設計選擇(如何通過複製引擎、TMA、SM加載/存儲或NVLS在GPU間傳輸數據,以及是否將傳輸與計算融合)。

PKB的設計覆蓋了生產環境中常見的並行類型,包括張量並行、上下文並行、數據並行、專家並行、FSDP/ZeRO等,問題來源於Megatron-LM、DeepSpeed、TensorRT-LLM、NeMo-RL等系統代碼庫,以及GNN路由、分佈式FFT、高斯濺射等非LLM工作負載。

評估結果表明,模型在多GPU內核生成方面存在根本性侷限。在零次學習設置中,GPT-5.5最佳成績為28個正確解(其中22個快於基線),通過三次嘗試可提升至36個正確解(27個快於基線),但fast1@3指標最高僅31%。成功案例主要集中在常見模式,如集合原語、張量並行GEMM和Ulysses風格上下文並行。失敗原因包括編譯錯誤、輸出不正確和死鎖,更深層次的問題在於模型難以推理排名協調、數據分區和集合排序。

研究人員還嘗試將模型包裝在代理框架中,提供編譯、測試和性能反饋,使模型可以迭代改進。Gemini 3 Pro通過代理循環將正確解從24個提升至35個,其中26個快於基線。然而,經過約20次迭代後性能達到平台期,表明反饋雖有助於調試語法和形狀錯誤,但無法解決對排名協調和傳輸機制選擇等高級推理的缺失。

儘管存在侷限性,模型在單次生成中偶爾會產生真正新穎的高性能內核,例如用於NeMo-RL GRPO訓練循環的詞彙並行log-prob內核、Hyena前向上下文並行內核以及SAM 3全收集內核。這些內核在4塊H100 GPU上經過驗證,性能顯著優於PyTorch + NCCL基線。這些案例展示了AI驅動優化的潛力,尤其是在缺乏優化公共參考的工作負載領域。

展開要點與分析

文章情報

工程師進階

要點

  • ParallelKernelBench(PKB)包含87個來自真實代碼庫的多GPU內核生成問題。
  • 最佳前沿模型(GPT-5.5)在零次學習設置中僅解決28個問題,其中22個快於基線。
  • 模型生成的失敗主要源於對排名協調、通信排序和傳輸機制選擇的推理不足。
  • 儘管存在侷限性,模型仍生成了幾個比現有公開實現更快的內核,例如用於NeMo-RL GRPO訓練的內核。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。