AI News HubLIVE
站內改寫2 分鐘閱讀

H100 vs H200 vs B200:您應該使用哪款GPU?

H100、H200和B200 GPU在內存、計算和成本方面各有不同的權衡。本文幫助您根據模型大小、流量和預算選擇最合適的GPU。

在AI推理中,GPU的選擇直接影響模型的延遲、吞吐量和成本。NVIDIA的H100、H200和B200是當前主流的三種GPU,它們在內存、計算能力和成本上各有側重。本文將詳細對比這三款GPU,幫助您根據具體需求做出最佳選擇。

首先,從硬件規格來看,我們通常使用SXM版本的GPU,因為它們通過NVLink提供更高的內存帶寬(約900 GB/s),從而加速推理。相比之下,PCIe版本的GPU間通信速度慢約10倍,且功耗更低,可能降低吞吐量,特別是對於跨多個GPU的大型模型。

內存容量是決定模型能否在單節點上運行的關鍵。一個標準節點通常配備8塊GPU,總VRAM決定了可容納的模型大小。H100 SXM節點(8x)提供640 GB,適合中大型模型;H200 SXM節點(8x)提供1,128 GB,可運行超大型模型,併為長上下文預留更多空間;B200 SXM節點(8x)提供1,440 GB,是三者中容量最大的。例如,GLM 5.2模型(7440億參數)在FP8精度下需要約755 GB權重,僅H200和B200節點能容納,並留有空間給KV緩存和激活值。

對於較小的模型,多實例GPU(MIG)技術可將一塊GPU物理劃分為最多7個隔離的切片,每個擁有獨立內存和計算資源。這意味着可以在單塊GPU上並行服務多個小模型,或將一塊GPU分租給多個租户。例如,一個分區的H100性能可媲美甚至超越完整的A100,但成本更低。MIG特別適合小於3B參數的嵌入模型和語音輸入/輸出模型,但不適用於Mixtral 8x7B規模以上的大模型或需要大批量的訓練任務。

Blackwell架構引入了FP4精度(NVFP4),相比FP8更節省內存且速度更快。Blackwell的第二代Transformer Engine能在每層自動切換FP4、FP8和FP16,確保精度關鍵部分不受影響。FP4可將權重內存減少約3.5倍(相比FP16),釋放的內存可用於KV緩存和更長上下文。這意味着B200可以用更少的GPU運行更大的模型,或為現有模型提供更多上下文。

除了精度優化,異步編程也能提高吞吐量。Hopper架構中的張量內存加速器(TMA)負責加載數據,讓計算線程專注於計算;Blackwell進一步引入張量內存(TMEM),減少等待時間。TensorRT-LLM會根據架構自動選擇最佳內核和異步策略。

根據使用場景,建議如下:

  • H100:適合嵌入、語音轉文本、文本轉語音模型;中小模型或多租户服務(利用MIG);低流量或間歇性流量場景,此時成本比吞吐量更重要。
  • H200:適合需要最大內存的大型模型訓練;中等規模的大型模型推理。
  • B200:適合高吞吐量的生產推理,特別是結合TensorRT-LLM使用時;圖像和視頻生成;在不犧牲輸出質量的情況下運行FP4模型。

常見問題:

  • B200的溢價何時值得?當GPU持續高負載運行在高流量生產環境中時,其更高的內存帶寬和FP4支持可降低每token成本。
  • MIG是什麼?MIG將一塊GPU分區為最多7個獨立實例,適用於不需要完整GPU的小模型或低流量部署。
  • FP4會降低模型質量嗎?這取決於模型和任務。Blackwell的Transformer Engine通過逐層切換精度來緩解影響,大多數生產推理任務可以接受。
  • 應該選擇多節點還是升級到H200/B200?如果模型能單節點運行,後者通常更簡單且成本更低。僅在模型完全無法單節點容納時考慮多節點。

總之,H100、H200和B200各有優勢,選擇時需綜合考慮模型大小、流量和預算。