基於Intel TDX的NVIDIA H100機密GPU推理效能基準測試
一項新研究評估了在NVIDIA H100 GPU上啟用機密計算對大型語言模型推理效能的影響。測試使用Mistral-7B和Qwen3-30B-A3B模型,發現機密模式使首令牌延遲平均增加21.8%-27.8%,全域性令牌吞吐量下降17.7%-21.1%,且較大模型更早達到飽和。結果表明機密GPU推理在負載下仍可保持可用吞吐量,但容量規劃需考慮效能損失和早期飽和現象。
機密計算正逐漸成為處理敏感輸入或保護專有模型資產的AI推理工作負載的實際部署要求。然而,啟用機密執行對GPU加速的大語言模型服務所帶來的效能代價仍然依賴於具體工作負載,且對運營至關重要。近日,一篇發表於arXiv的論文(編號2607.19353)對這一問題進行了系統性的基準測試研究。該論文由Wei Wang等人撰寫,於2026年5月20日提交,旨在量化Intel TDX機密例項中NVIDIA H100 GPU的機密計算效能開銷。
實驗在單個配備Intel TDX機密例項的NVIDIA H100 80GB GPU上進行,比較了標準非機密執行模式與機密計算模式的效能差異。研究選用了兩個具有代表性的大語言模型:Mistral-7B v0.1(70億引數)和Qwen3-30B-A3B(300億引數,採用混合專家架構)。Mistral-7B代表了中等規模的開源模型,而Qwen3-30B-A3B則展示了更大規模、更復雜的MoE架構在機密環境下的行為。研究人員測量了多個關鍵指標,包括首令牌時間(TTFT)、端到端請求延遲、每請求令牌生成吞吐量、全域性令牌吞吐量以及閉環請求吞吐量,並分析了不同併發度下的表現。這些指標全面反映了使用者感知的響應速度和系統整體效率。
在固定請求速率實驗中,機密模式使得Mistral-7B的平均首令牌時間增加了21.8%,Qwen3-30B-A3B增加了27.8%。同時,全域性令牌吞吐量分別下降了17.7%和21.1%。這表明機密執行在首次響應和持續生成方面都引入了顯著開銷。在閉環併發實驗中,吞吐量差距保持在11.5%至20.2%之間,但值得注意的是,較大的模型(Qwen3-30B-A3B)在機密模式下更早地達到了其飽和拐點,即隨著併發請求增加,吞吐量增長減緩的點。這暗示了模型規模對效能退化的放大效應。
這些結果表明,機密GPU推理在負載下仍然可以保持可用的吞吐量,但容量規劃必須同時考慮穩態吞吐量損失以及大型模型觀察到的早期飽和行為。對於採用Qwen3-30B-A3B這類大模型的應用,運維人員需要預留更多的資源餘量。該研究為計劃部署機密AI推理服務的組織提供了重要的效能參考,強調了在效能與安全之間進行權衡的必要性。未來工作可能會探索最佳化機密執行環境或硬體加速方案,以縮小這一效能差距,例如改進Intel TDX與NVIDIA GPU的協同或開發針對機密推理的編譯最佳化。