H100 vs H200 vs B200:您應該使用哪款GPU?
H100、H200和B200 GPU在記憶體、計算和成本方面各有不同的權衡。本文幫助您根據模型大小、流量和預算選擇最合適的GPU。
在AI推理中,GPU的選擇直接影響模型的延遲、吞吐量和成本。NVIDIA的H100、H200和B200是當前主流的三種GPU,它們在記憶體、計算能力和成本上各有側重。本文將詳細對比這三款GPU,幫助您根據具體需求做出最佳選擇。
首先,從硬體規格來看,我們通常使用SXM版本的GPU,因為它們透過NVLink提供更高的記憶體頻寬(約900 GB/s),從而加速推理。相比之下,PCIe版本的GPU間通訊速度慢約10倍,且功耗更低,可能降低吞吐量,特別是對於跨多個GPU的大型模型。
記憶體容量是決定模型能否在單節點上執行的關鍵。一個標準節點通常配備8塊GPU,總VRAM決定了可容納的模型大小。H100 SXM節點(8x)提供640 GB,適合中大型模型;H200 SXM節點(8x)提供1,128 GB,可執行超大型模型,併為長上下文預留更多空間;B200 SXM節點(8x)提供1,440 GB,是三者中容量最大的。例如,GLM 5.2模型(7440億引數)在FP8精度下需要約755 GB權重,僅H200和B200節點能容納,並留有空間給KV快取和啟用值。
對於較小的模型,多例項GPU(MIG)技術可將一塊GPU物理劃分為最多7個隔離的切片,每個擁有獨立記憶體和計算資源。這意味著可以在單塊GPU上並行服務多個小模型,或將一塊GPU分租給多個租戶。例如,一個分割槽的H100效能可媲美甚至超越完整的A100,但成本更低。MIG特別適合小於3B引數的嵌入模型和語音輸入/輸出模型,但不適用於Mixtral 8x7B規模以上的大模型或需要大批次的訓練任務。
Blackwell架構引入了FP4精度(NVFP4),相比FP8更節省記憶體且速度更快。Blackwell的第二代Transformer Engine能在每層自動切換FP4、FP8和FP16,確保精度關鍵部分不受影響。FP4可將權重記憶體減少約3.5倍(相比FP16),釋放的記憶體可用於KV快取和更長上下文。這意味著B200可以用更少的GPU執行更大的模型,或為現有模型提供更多上下文。
除了精度最佳化,非同步程式設計也能提高吞吐量。Hopper架構中的張量記憶體加速器(TMA)負責載入資料,讓計算執行緒專注於計算;Blackwell進一步引入張量記憶體(TMEM),減少等待時間。TensorRT-LLM會根據架構自動選擇最佳核心和非同步策略。
根據使用場景,建議如下:
- H100:適合嵌入、語音轉文本、文本轉語音模型;中小模型或多租戶服務(利用MIG);低流量或間歇性流量場景,此時成本比吞吐量更重要。
- H200:適合需要最大記憶體的大型模型訓練;中等規模的大型模型推理。
- B200:適合高吞吐量的生產推理,特別是結合TensorRT-LLM使用時;影像和影片生成;在不犧牲輸出質量的情況下執行FP4模型。
常見問題:
- B200的溢價何時值得?當GPU持續高負載執行在高流量生產環境中時,其更高的記憶體頻寬和FP4支援可降低每token成本。
- MIG是什麼?MIG將一塊GPU分割槽為最多7個獨立例項,適用於不需要完整GPU的小模型或低流量部署。
- FP4會降低模型質量嗎?這取決於模型和任務。Blackwell的Transformer Engine透過逐層切換精度來緩解影響,大多數生產推理任務可以接受。
- 應該選擇多節點還是升級到H200/B200?如果模型能單節點執行,後者通常更簡單且成本更低。僅在模型完全無法單節點容納時考慮多節點。
總之,H100、H200和B200各有優勢,選擇時需綜合考慮模型大小、流量和預算。