AI News HubLIVE
站内改写2 分钟阅读

H100 vs H200 vs B200:您应该使用哪款GPU?

H100、H200和B200 GPU在内存、计算和成本方面各有不同的权衡。本文帮助您根据模型大小、流量和预算选择最合适的GPU。

在AI推理中,GPU的选择直接影响模型的延迟、吞吐量和成本。NVIDIA的H100、H200和B200是当前主流的三种GPU,它们在内存、计算能力和成本上各有侧重。本文将详细对比这三款GPU,帮助您根据具体需求做出最佳选择。

首先,从硬件规格来看,我们通常使用SXM版本的GPU,因为它们通过NVLink提供更高的内存带宽(约900 GB/s),从而加速推理。相比之下,PCIe版本的GPU间通信速度慢约10倍,且功耗更低,可能降低吞吐量,特别是对于跨多个GPU的大型模型。

内存容量是决定模型能否在单节点上运行的关键。一个标准节点通常配备8块GPU,总VRAM决定了可容纳的模型大小。H100 SXM节点(8x)提供640 GB,适合中大型模型;H200 SXM节点(8x)提供1,128 GB,可运行超大型模型,并为长上下文预留更多空间;B200 SXM节点(8x)提供1,440 GB,是三者中容量最大的。例如,GLM 5.2模型(7440亿参数)在FP8精度下需要约755 GB权重,仅H200和B200节点能容纳,并留有空间给KV缓存和激活值。

对于较小的模型,多实例GPU(MIG)技术可将一块GPU物理划分为最多7个隔离的切片,每个拥有独立内存和计算资源。这意味着可以在单块GPU上并行服务多个小模型,或将一块GPU分租给多个租户。例如,一个分区的H100性能可媲美甚至超越完整的A100,但成本更低。MIG特别适合小于3B参数的嵌入模型和语音输入/输出模型,但不适用于Mixtral 8x7B规模以上的大模型或需要大批量的训练任务。

Blackwell架构引入了FP4精度(NVFP4),相比FP8更节省内存且速度更快。Blackwell的第二代Transformer Engine能在每层自动切换FP4、FP8和FP16,确保精度关键部分不受影响。FP4可将权重内存减少约3.5倍(相比FP16),释放的内存可用于KV缓存和更长上下文。这意味着B200可以用更少的GPU运行更大的模型,或为现有模型提供更多上下文。

除了精度优化,异步编程也能提高吞吐量。Hopper架构中的张量内存加速器(TMA)负责加载数据,让计算线程专注于计算;Blackwell进一步引入张量内存(TMEM),减少等待时间。TensorRT-LLM会根据架构自动选择最佳内核和异步策略。

根据使用场景,建议如下:

  • H100:适合嵌入、语音转文本、文本转语音模型;中小模型或多租户服务(利用MIG);低流量或间歇性流量场景,此时成本比吞吐量更重要。
  • H200:适合需要最大内存的大型模型训练;中等规模的大型模型推理。
  • B200:适合高吞吐量的生产推理,特别是结合TensorRT-LLM使用时;图像和视频生成;在不牺牲输出质量的情况下运行FP4模型。

常见问题:

  • B200的溢价何时值得?当GPU持续高负载运行在高流量生产环境中时,其更高的内存带宽和FP4支持可降低每token成本。
  • MIG是什么?MIG将一块GPU分区为最多7个独立实例,适用于不需要完整GPU的小模型或低流量部署。
  • FP4会降低模型质量吗?这取决于模型和任务。Blackwell的Transformer Engine通过逐层切换精度来缓解影响,大多数生产推理任务可以接受。
  • 应该选择多节点还是升级到H200/B200?如果模型能单节点运行,后者通常更简单且成本更低。仅在模型完全无法单节点容纳时考虑多节点。

总之,H100、H200和B200各有优势,选择时需综合考虑模型大小、流量和预算。