Vera Rubin向けに構築、NVIDIA Spectrum-6がギガスケールAIファクトリーに登場
NVIDIAは、Vera Rubinプラットフォームの一部として、前世代の2倍の容量を持つ102.4テラビット/秒のイーサネットスイッチシステム「Spectrum-6」の出荷を開始した。CoreWeave、Microsoft、Nebiusなどの主要AIインフラ構築企業が初めて導入する。Spectrum-6はSpectrum-Xイーサネットプラットフォームの次世代の中核であり、最大1.6倍のAIネットワーク性能向上と95%のネットワーク効率を実現する。
AIはギガスケール時代に突入しました。世界最先端のAIファクトリーは、数十万のGPUとCPUを統合し、フロンティアモデルのトレーニング、エージェンティックAIの駆動、そして前例のない規模でのインテリジェンス生成を行っています。このレベルでは、ネットワーキングがトークン生成を促進する重要なコンピューティングパワー増倍器となります。
ネットワーキングのマイルストーンとして、NVIDIA Spectrum-6 — 102.4テラビット/秒のイーサネットスイッチシステムで、前世代の2倍の容量を提供し、NVIDIA Vera Rubinプラットフォームの一部として構築 — が世界中のギガスケールAIファクトリーに導入されています。Spectrum-6はNVIDIA Spectrum-Xイーサネットプラットフォームの次世代を支え、AIファクトリーをエンドツーエンドのコンピューティングシステムとして運用するために必要な帯域幅、規模、知能を提供します。
世界有数のAIインフラ構築企業 — CoreWeave、Microsoft、Nebius、SpaceXAI、Tesla — がSpectrum-6を最初に導入し、AIファクトリーを加速します。クラウドプロバイダーにとっては、より多くのコンピューティング容量が統一的で高性能なリソースとして動作し、顧客がモデルのトレーニングと推論サービスのデプロイをより迅速に行えるようになります。
CoreWeaveの製品ディレクターMin Jun氏は、「CoreWeaveは最も要求の厳しいAIワークロードのために構築されており、ネットワーキングはその性能をスケールで提供するための中心です。NVIDIA Spectrum-6と液体冷却対応のSpectrum-Xイーサネットインフラを当社のAIファクトリーに導入することで、顧客がフロンティアモデルをトレーニングし、推論をより迅速にデプロイするために必要な帯域幅、回復力、効率を提供できるようになります」と述べています。Nebiusのグローバルパートナーシップ担当バイスプレジデントLaurelle Roseman氏は、「ギガスケールでは、パフォーマンスは調整にかかっています。すべてのGPUを同期させ、1つの遅いリンクがジョブ全体を停止させないようにすることです。これこそNVIDIA Spectrum-6が目指すものであり、当社が早期に導入した理由です。顧客の最も要求の厳しいワークロードがスケールするにつれて、高速で回復力のあるファブリックを維持するためです」と補足しました。
ハードウェアに加えて、Spectrum-Xイーサネットはインテリジェントな負荷分散、高速障害バイパス、および正確な回復技術によりトラフィックを最適化します。標準イーサネットと比較して、最大1.6倍のAIネットワーク性能を提供し、10万GPUを超えるデプロイメントで最大95%のネットワーク効率を維持します。ハードウェアアクセラレーションされたSpectrum-Xマルチプレーントポロジは、データセンターに必要なスイッチの数を1.7倍削減し、ネットワーク効率をさらに加速します。Spectrum-Xイーサネットフォトニクスと組み合わせることで、5倍の電力効率向上と10倍の平均故障間隔改善を実現します。
Spectrum-6スイッチチップはNVIDIA ConnectX-9 SuperNICと組み合わせてSpectrum-Xイーサネットの次世代を形成し、Vera Rubinプラットフォーム(Vera CPU、Rubin GPU、NVLink 6スイッチ、BlueField-4 DPU)の一部としてエンジニアリングされています。プラガブルおよびコパッケージドオプティクスのフォームファクターをサポートし、液体冷却も可能で、AIファクトリー全体の包括的なエンドツーエンド冷却アプローチを実現しつつ、ネットワーク電力効率を向上させます。
このように、NVIDIAは垂直統合、水平開放のアプローチを提供しています。標準イーサネット、オープンネットワークOS、幅広いエコシステムをサポートしながら、シリコン、システム、ソフトウェアを共同設計します。顧客は部品を組み立てて後で最適化する必要がなく、最速のトレーニング時間と最低のトークンあたりコストを実現する完全なAIファクトリープラットフォームを得ることができます。