AI News HubLIVE
站內改寫2 分鐘閱讀

H100 與 H200 GPU 對比

本文對比了H100和H200 GPU在AI推理中的表現。H100適合中小模型和低流量場景,價效比高;H200憑藉更大的HBM3e視訊記憶體和更高頻寬,更適合大模型、長上下文推理和高KV快取需求。文章還介紹了MIG分割槽和非同步程式設計等技術。

在AI推理領域,GPU的選擇直接影響模型效能、成本和延遲。H100和H200是當前主流的兩款GPU,它們在硬體規格、適用場景上各有優劣。本文將從實際應用角度出發,對比兩者的差異,並介紹MIG和非同步程式設計等最佳化技術,幫助您做出合適的選擇。

硬體規格對比

我們主要比較SXM版本的GPU,因為它們透過NVLink直連,頻寬高達約900 GB/s,顯著快於PCIe版本。H200的最大優勢在於其HBM3e視訊記憶體:容量從H100的80GB提升至141GB,總節點視訊記憶體從640GB增至1128GB,同時記憶體頻寬也從3.35 TB/s提升至4.8 TB/s。這意味著H200能容納更大模型,併為KV快取和啟用值留出更多空間。具體而言,H100節點(8×80GB)適合中小模型,而H200節點(8×141GB)足以執行如GLM 5.2(744B引數)這樣的大模型,且仍有富餘。

MIG:讓小模型也能用上高階GPU

H100和H200支援MIG(多例項GPU),可將一塊GPU物理分割為最多7個獨立例項,每個擁有獨立的視訊記憶體和計算資源。這使得你可以在一張GPU上並行執行多個小模型(如嵌入模型或語音模型),成本遠低於使用整張GPU。MIG尤其適合引數低於30億的模型,但大模型(如Mixtral 8x7B及以上)或需要大批次的訓練任務仍需要完整GPU。

非同步程式設計:消除GPU空閒等待

傳統推理中,GPU在載入資料時常處於空閒狀態。非同步程式設計透過重疊資料載入與計算,讓GPU持續工作。H100和H200的Hopper架構內建Tensor Memory Accelerator,專門負責資料傳輸,使計算執行緒可專注於運算。這一技術能顯著提升吞吐量,尤其適用於跨多GPU的大型模型。

場景建議

  • H100:適用於嵌入模型、語音轉文字/合成、中小模型、流量波動大的場景,以及需要MIG多租戶部署的情況。
  • H200:適合訓練超大模型、執行大型語言模型、需要長上下文視窗或極高吞吐量的應用。

常見問題

  • 為什麼GPU記憶體頻寬重要? 它決定了資料從HBM傳輸到計算核心的速度。H200更高的頻寬能減少大模型推理中的瓶頸。
  • GPU記憶體如何影響大模型? 記憶體決定模型能否完整裝入節點,以及KV快取的餘量。大模型常受限於記憶體。
  • H100還是H200更適合推理? 取決於模型大小:小模型選H100,大模型選H200。

總之,H100以其高價效比和MIG特性,是中小規模部署的理想選擇;而H200憑藉更大的視訊記憶體和頻寬,為大型模型和長上下文場景提供了強大支援。