基于Intel TDX的NVIDIA H100机密GPU推理性能基准测试
一项新研究评估了在NVIDIA H100 GPU上启用机密计算对大型语言模型推理性能的影响。测试使用Mistral-7B和Qwen3-30B-A3B模型,发现机密模式使首令牌延迟平均增加21.8%-27.8%,全局令牌吞吐量下降17.7%-21.1%,且较大模型更早达到饱和。结果表明机密GPU推理在负载下仍可保持可用吞吐量,但容量规划需考虑性能损失和早期饱和现象。
机密计算正逐渐成为处理敏感输入或保护专有模型资产的AI推理工作负载的实际部署要求。然而,启用机密执行对GPU加速的大语言模型服务所带来的性能代价仍然依赖于具体工作负载,且对运营至关重要。近日,一篇发表于arXiv的论文(编号2607.19353)对这一问题进行了系统性的基准测试研究。该论文由Wei Wang等人撰写,于2026年5月20日提交,旨在量化Intel TDX机密实例中NVIDIA H100 GPU的机密计算性能开销。
实验在单个配备Intel TDX机密实例的NVIDIA H100 80GB GPU上进行,比较了标准非机密执行模式与机密计算模式的性能差异。研究选用了两个具有代表性的大语言模型:Mistral-7B v0.1(70亿参数)和Qwen3-30B-A3B(300亿参数,采用混合专家架构)。Mistral-7B代表了中等规模的开源模型,而Qwen3-30B-A3B则展示了更大规模、更复杂的MoE架构在机密环境下的行为。研究人员测量了多个关键指标,包括首令牌时间(TTFT)、端到端请求延迟、每请求令牌生成吞吐量、全局令牌吞吐量以及闭环请求吞吐量,并分析了不同并发度下的表现。这些指标全面反映了用户感知的响应速度和系统整体效率。
在固定请求速率实验中,机密模式使得Mistral-7B的平均首令牌时间增加了21.8%,Qwen3-30B-A3B增加了27.8%。同时,全局令牌吞吐量分别下降了17.7%和21.1%。这表明机密执行在首次响应和持续生成方面都引入了显著开销。在闭环并发实验中,吞吐量差距保持在11.5%至20.2%之间,但值得注意的是,较大的模型(Qwen3-30B-A3B)在机密模式下更早地达到了其饱和拐点,即随着并发请求增加,吞吐量增长减缓的点。这暗示了模型规模对性能退化的放大效应。
这些结果表明,机密GPU推理在负载下仍然可以保持可用的吞吐量,但容量规划必须同时考虑稳态吞吐量损失以及大型模型观察到的早期饱和行为。对于采用Qwen3-30B-A3B这类大模型的应用,运维人员需要预留更多的资源余量。该研究为计划部署机密AI推理服务的组织提供了重要的性能参考,强调了在性能与安全之间进行权衡的必要性。未来工作可能会探索优化机密执行环境或硬件加速方案,以缩小这一性能差距,例如改进Intel TDX与NVIDIA GPU的协同或开发针对机密推理的编译优化。