Nvidiaは、クラウドサービスプロバイダー(CSP)とスーパーコンピューティングセンターの双方で高まる、性能、セキュリティー、人工知能(AI)、データ分析、高性能コンピューティング(HPC)といった現代的なワークロードを実行する能力への要件に対応するため、InfiniBandネットワーキングプラットフォームの機能を強化している。
同社の創業者兼CEOであるJensen Huang氏は、同社のバーチャルGTCイベントでQuantum-2を発表した。これは400ギガビットEthernet対応のInfiniBandネットワーキングプラットフォームで、NvidiaのQuantum-2スイッチだけでなく、それをサポートするソフトウェアと、同社のConnectX-7ネットワークインターフェースコントローラー(NIC)または近日発売予定のBlueField-3データ処理ユニット(DPU)のいずれかを搭載する。
Nvidia関係者によると、この新たなネットワーキングプラットフォームは、スーパーコンピューティング施設が組織外を含む、より多くのユーザーから利用されるようになる一方、Amazon Web Services(AWS)、Microsoft Azure、Google CloudなどのCSPが組織向けにスーパーコンピューティングサービスをさらに提供するようになる中で登場した。
「Quantum-2は、スーパーコンピューターの性能とクラウドコンピューティングの共有性を提供する初のネットワーキングプラットフォームだ」とHuang氏はGTC基調講演で述べた。「これはこれまで不可能だった。Quantum-2以前は、ベアメタルの高性能か、安全なマルチテナンシーのどちらか一方しか得られず、両方を同時に実現することはできなかった。Quantum-2により、貴重なスーパーコンピューターをクラウドネイティブにし、はるかに有効活用できる」
コンピューティングの分散化が進む
オンプレミスのデータセンター、複数のパブリッククラウド、急速に成長するエッジへとコンピューティングが分散するなか、ネットワークはデータを移動させるだけでなく、データの管理と保護においても重要な接続手段となる。
「分散コンピューティングにおいて、ネットワークはコンピューターの中枢神経系に当たる重要な存在だ」とHuang氏は述べた。「ネットワークは数千基のGPUを巨大なスーパーコンピューターへと接続し、そのスケーラビリティーと最終的な性能を決定する」
Quantum-2には、NvidiaのA100 GPUほどの大きさの新しい7ナノメートルInfiniBandスイッチチップと、400Gb/sで64ポート、または200Gb/sで128ポートを備えると、同CEOは述べた。最大2,048ポートを接続でき、Quantum-1の800ポートから大幅に増加し、スイッチング容量は5倍以上になる。さらにQuantum-2は、3ホップのDragonflyインターコネクトトポロジー内で最大100万のエンドポイントに拡張でき、現行世代の6.5倍に相当するという。
「ナノ秒単位のタイミング制御により、クラウドデータセンターを通信ネットワークの一部にし、ソフトウェア定義の5G無線サービスをホストすることも可能になる」とHuang氏は述べた。「NvidiaのSelene DGXスーパーコンピューターが今日Quantum-2を搭載していたなら、総帯域幅は毎秒224,000ギガバイト、つまりインターネット上を流れる総トラフィックのおよそ1.5倍になる」
Quantum-2は400Gb/sでネットワーク速度を2倍にし、ネットワークポート数を3倍にする。同氏によると、性能を3倍にし、データセンターファブリックスイッチの必要性を6分の1に抑えるほか、データセンターの消費電力と設置スペースをそれぞれ7%削減する。
関連記事:データセンターインフラ管理に最適なDCIMソフトウェア
Quantum-2の新機能
主な新機能の1つは、あるテナントの活動が他のテナントに影響を与えないようにする性能分離だ。また、クラウドネイティブでテレメトリーを基盤とする輻輳制御システムにより、高データレートの送信元がネットワークを過負荷状態にしてトラフィックを詰まらせるのを防ぐ。AIアプリケーションのトレーニングを高速化するため、アクセラレーションエンジンを32倍に増やしたスイッチ内処理のSHARPv3を提供するほか、ナノ秒精度のタイミングシステムによって、データベース処理を含む分散アプリケーションを同期できる。これにより、ネットワーク内での待機やハンドシェイクに伴うオーバーヘッドを低減する。
このシステムは、NvidiaのUFM Cyber-AIプラットフォームを通じて予測メンテナンス機能を提供する。

NvidiaはQuantum-2向けに、ネットワークとエンドポイントに関する2つの選択肢を提供する。Nvidia関係者によると、ConnectX-7は80億個のトランジスタを搭載し、ConnectX-6の速度を2倍にするとともに、リモートダイレクトメモリアクセス(RDMA)、GPUDirect Storage、GPUDirect RDMA、ネットワーク内コンピューティングの性能を2倍にする。このNICは1月にサンプル出荷される。
一方、BlueField-3 InfiniBandは、220億個のトランジスタと16基の64ビットArm CPUを搭載し、データセンターインフラストラクチャースタックの処理をオフロードして分離する。2022年5月にサンプル出荷される予定だ。
データ処理ユニット(DPU)の台頭
半導体ベンダー各社は、Nvidiaだけでなく、Intel、Broadcom、Marvell、Hewlett Packard EnterpriseのAruba Networks、そしてAMDが350億ドルでの買収を試みているXilinxも、フィールドプログラマブルゲートアレイ(FPGA)などの技術を活用してDPUを開発している。DPUはネットワーク、ストレージなどの処理をCPUからオフロードし、性能を高速化する。
2019年にインターコネクトベンダーのMellanoxを買収したことでネットワーク機能を広げたNvidiaは、BlueField DPUを、コンピューティングチップの容量の最大30%を消費していると同社関係者が説明するさまざまな処理をCPUから移行する手段と見ている。Huang氏によると、BlueField DPUに取り組む開発者は約1,400人いる。
同イベントでNvidiaは、BlueField DOCA 1.2も発表した。これはインフラストラクチャーソフトウェアをオフロードすることで、企業がゼロトラストアーキテクチャーをより迅速に構築できるようにする、サイバーセキュリティー機能群だ。
「境界での保護やワークグループのセグメンテーションでは、もはや十分ではない」とHuang氏は述べた。「アプリケーション、データ、ユーザー、デバイスのあらゆる接点が、潜在的な攻撃対象領域になる。BlueFieldはネットワークのエンドポイントであるため、事実上あらゆる接点でデータセンターを保護できる」
関連記事:ゼロトラストネットワーク構築の手順
高まるセキュリティー上の懸念
同氏は、クラウドコンピューティングと機械学習の双方がデータセンターの性質を変えており、コンテナベースのアプリケーションによってハイパースケーラーは環境を迅速にスケールアウトし、数百万人のユーザーを同時にサービスへ呼び込めるようになっていると指摘した。
「スケールアウトとオーケストレーションの容易さには代償がある。機械間のメッセージ交換によって東西方向のネットワークトラフィックが大幅に増加し、こうした分散アプリケーションはデータセンター内部に多数のポートを開くため、サイバー攻撃から保護する必要がある」と同氏は述べた。
月末に早期アクセスが開始されるBlueField DOC 1.2は、より大規模なゼロトラストセキュリティープラットフォームの一部であり、同プラットフォームにはNvidiaのMorpheusも含まれる。Morpheusは、ネットワーク内の異常を検出して対応するためのデジタルフィンガープリント作成に向けた新しいワークフローを提供するディープラーニングフレームワークだ
Quantum-2スイッチは、Dell Technologies、HPE、Lenovo、IBM DataDirect Networks、Inspurを含む幅広いインフラベンダーおよびシステムメーカーから提供される。