NVIDIA srt-slurm、SLURMレシピ、パラメータスイープ、パレート分析を用いた分散LLMサービングベンチマークの検証
このチュートリアルでは、NVIDIAのsrt-slurmフレームワークを探求し、srtctlを使って宣言型YAML設定を再現可能なSLURMベンチマークワークフローに変換する方法を学びます。Google Colabでプロジェクトをセットアップし、内部アーキテクチャを調べ、クラスタ設定を定義し、組み込みおよびカスタムレシピをドライラン実行し、DeepSeek-R1用の分離型プリフィル・デコードデプロイメントをモデル化します。また、パラメータスイープを生成し、型付きPython APIと対話し、拡張設定を検証し、スループット対レイテンシのパレートフロンティアを通じてシミュレートされたベンチマーク結果を分析します。
このチュートリアルでは、NVIDIAのsrt-slurmフレームワークを深く掘り下げ、srtctlを使用して宣言型YAML設定を再現可能なSLURMベンチマークワークフローに変換し、分散LLMサービングを行う方法を学びます。Google Colabでプロジェクトをセットアップし、内部アーキテクチャを調査し、クラスタ設定を定義し、組み込みおよびカスタムレシピをドライラン実行し、DeepSeek-R1用の分離型プリフィル・デコードデプロイメントをモデル化します。また、パラメータスイープを生成し、型付きPython APIと対話し、拡張設定を検証し、スループット対レイテンシのパレートフロンティアを通じてシミュレートされたベンチマーク結果を分析します。Colabは実際のSLURM環境を提供しませんが、実用的な開発ワークスペースとして使用し、本番グレードのベンチマークレシピを理解、検証、準備してから実際のGPUクラスタに送信します。
まず、必要なモジュールをインポートし、コマンド実行とセクション書式設定のための再利用可能なヘルパー関数を定義してColab環境を準備します。NVIDIA srt-slurmリポジトリをクローンし、編集可能モードでインストールし、そのソースディレクトリをアクティブなPythonランタイムに公開します。次にリポジトリディレクトリに切り替え、srtctlコマンドラインインターフェースが正しくインストールされていることを確認します。
次に、リポジトリ構造を調査し、srtctlがコマンドラインツール、スキーマ、バックエンド、テンプレート、レシピ、分析コンポーネントをどのように整理しているかを理解します。その後、シミュレートされたクラスタデフォルト、コンテナエイリアス、GPU設定、モデルパスを含むローカルsrtslurm.yamlファイルを作成します。この設定を使用して、実際のSLURMクラスタにアクセスせずにColabでレシピ参照を解決します。
組み込みのモッカーレシピをドライラン実行して、srtctlが実際のベンチマークを実行せずに設定を検証しSLURM提出アーティファクトを生成する方法を調べます。次に、プリフィルとデコードのワークロードを独立したノードとワーカープールに分離する高度なDeepSeek-R1レシピを定義します。この分離型SGLang設定を別のドライランで検証し、サービングパラメータがジョブスクリプトにどのように変換されるかを調べます。
サンプルパラメータスイープを実行し、そのデカルト探索空間から作成された個々のジョブ設定を検査します。型付きPython APIを介してカスタムレシピをロードし、そのモデル、精度、GPUトポロジ、ベンチマーク設定、サポートされている列挙値を調べます。また、プログラムでスイープテンプレートを展開し、各パラメータの組み合わせが生成されるバックエンド設定にどのように影響するかを検証します。
増加する同時実行レベルにわたって、2つのチャンク化プリフィルバリアントのベンチマーク観測をシミュレートします。分散サービングシステムで一般的に見られる飽和とレイテンシの成長をモデル化するために、GPUあたりの代表的なスループットとトークン間レイテンシ値を計算します。次に、これらの結果をパレートスタイルのプロットで可視化し、設定間のスループットと応答性を比較します。
最後に、検証済みのレシピをColabから実際のSLURMベースのGPUクラスタに転送するための本番ワークフローを概説します。環境セットアップ、プリフライト検証、ジョブ提出、スイープ実行、モニタリング、ダッシュボード分析、実験比較に使用されるコマンドを確認します。また、各ベンチマークレシピ内でモデルリビジョン、コンテナID、フレームワークバージョンを宣言することで再現性を強調します。
結論として、srtctlがSLURMインフラストラクチャ上で実行する分散LLMサービングベンチマークをどのように構造化、検証、拡張、準備するかについて完全な理解を構築しました。基本的なインストールとリポジトリ検査から、高度な分離型サービング設定、デカルトパラメータスイープ、プログラムスキーマアクセス、ベンチマーク結果分析に進みました。また、ドライランが生成されたジョブアーティファクトを公開し、高価なクラスタリソースが割り当てられる前に設定の問題を検出するのに役立つことも確認しました。このワークフローを整えることで、検証済みのレシピを実際のNVIDIA GPUクラスタに自信を持って転送し、プリフライトチェックを実行し、ベンチマークジョブを提出し、実行を監視し、実験指紋を比較し、再現可能な方法でパフォーマンストレードオフを分析できます。
完全なコードは元の記事を参照してください。Twitterでフォローし、150k+ ML SubRedditに参加してニュースレターを購読することを忘れないでください。Telegramにも参加できます。GitHubリポジトリ、Hugging Faceページ、製品リリース、ウェビナーなどのプロモーションでパートナーになりたい場合は、お問い合わせください。