AI News HubLIVE
站内改写1 分钟阅读

Kernel Forge:用于基于LLM的CUDA内核生成与优化的智能体工具

Kernel Forge是一个开源端到端智能体框架,可接受任何未经修改的PyTorch模型,利用蒙特卡洛树搜索探索多个优化路径,并配备图形用户界面。在NVIDIA DGX Spark上对四个模型进行测试,仅需50次优化迭代,即可在14个内核上超越PyTorch eager模式,最高加速2.83倍。

来源arXiv AI作者: Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

随着机器学习模型越来越多地嵌入日常软件,其大部分运行时间都花在少量计算内核上,如矩阵乘法、卷积和归一化。优化这些内核是减少延迟和成本的最直接方法之一,但传统上需要专家工程师手动编写底层GPU代码。基于大型语言模型(LLM)的智能体系统现在能够以更少的人力生成和优化内核,但现有工具大多在随机生成的张量和孤立内核上进行评估,输出需要开发者手动重新集成的独立CUDA代码,主要针对LLM PyTorch模型,并且对检查与调试结果的支持有限。

针对这些不足,研究团队提出了Kernel Forge,这是一个开源、端到端的智能体工具,能够接受任何未经修改的PyTorch模型。与现有工具不同,Kernel Forge支持视觉、扩散和LLM工作负载,采用蒙特卡洛树搜索(MCTS)探索多条优化路径,而不是单一的精炼链。它还附带图形用户界面,用于监控进度、检查候选内核和调试失败。

研究团队在搭载GB10 GPU的NVIDIA DGX Spark上,对涵盖视觉、扩散和LLM工作负载的四个PyTorch模型进行了评估。每个内核仅进行50次优化迭代,Kernel Forge优化了14个内核,使其性能超越PyTorch eager模式:在ResNet-50上,adaptive_avgpool2d加速1.52倍;在Stable Diffusion 3.5 Medium上,group_norm加速1.70倍;在Gemma 4 E2B上,softmax加速2.83倍;在Qwen 3.5 35B-A3B上,softmax加速1.54倍。这些结果表明,Kernel Forge能够有效降低内核优化的门槛,为AI部署带来显著的性能提升。Kernel Forge的代码已开源,可供研究者和开发者使用。