フルイド コンピューティングを支えるGoogle Cloudの4構成と選び方
公開:
Google Cloudは米国時間2026年9月25日、AIワークロードを支えるネットワーク構成と、アクセラレータ選択時の考慮事項を紹介しました。構成は、標準ネットワーキング、高速GPUネットワーキング、TPUネットワーキング、Cloud Runの4つです。[1]
アクセラレータの可用性は業界全体の課題になる可能性があり、特定のタイプを前提にするとデプロイが遅れる場合があります。フルイド コンピューティングは、ユースケースに合う利用可能なリソースに基づき、複数のオプションでAIデプロイを設計するコンセプトです。[1]
目次
フルイド コンピューティングのリソース オプション
例えば、プライベートLLMの推論をA4 VM(a4-highgpu-8g)のNVIDIA B200 GPUで実行する場合、そのGPUを本当に使えるかが課題です。リソースにアクセスする方法は、以下の通りです。[1]
Flex Start VMは、必要なアクセラレータ ノードがすべてそろうまでワークロードをキューに入れ、まとめてプロビジョニングして最大7日間プリエンプト不可で実行します。カレンダー モードでは1~90日前にアクセラレータ容量を予約でき、開始時間と終了時間が保証されます。Google Cloudは、カレンダー モードをスケジュールされた事前トレーニングの実行やベンチマークに最適としています。[1]
将来の予約は、将来の特定の日付から、指定したゾーンで確約されたハードウェアへのアクセスを保証します。フレックス予約では、短期契約によって、複数年のロックインなしで希少なアクセラレータ ノードを確保できます。[1]
GKEのComputeClassesでは、マルチファミリー フォールバック リストを定義できます。プライマリ プールがリージョンの制約に直面すると、クラスタは代替アクセラレータ タイプのプロビジョニングを自動で試行します。Spot VMは、フォールト トレラントなチェックポイント付きバッチジョブ向けに、余剰コンピューティングを大幅な割引価格で提供します。[1]
フルイド コンピューティングを支えるネットワーク構成
Google Cloudのネットワーキング オプションは、さまざまなアクセラレータ タイプをサポートしています。コンポーネントはアクセラレータの選択で異なり、対応関係は以下の通りです。[1]
| 構成 | 対応アクセラレータ |
|---|---|
| 標準ネットワーキング(GPU) | NVIDIA T4(N1)、L4(G2)、A100(A2のシングルノードとマルチノード) |
| 標準ネットワーキング(TPU) | Cloud TPU v3、v5e(単一ホスト / スタンドアロン スライス) |
| GPUDirect-TCPX / TCPXO | NVIDIA H100(4レールのA3 High VM)、H100 Mega(8レールのA3 Mega VM) |
| RoCEv2(VM) | NVIDIA H200(A3 Ultra VM)、B200(A4 VM)、GB200 NVL72(A4X VM) |
| RoCEv2(ベアメタル) | NVIDIA GB300(A4X Max ベアメタル) |
| TPUネットワーキング | v4、v5p、v5e(マルチホスト Pod スライス)、v6e(Trillium)、TPU7x(Ironwood) |
| Cloud Run | GPUサービスのNVIDIA L4(G2)、RTX PRO 6000(Blackwell)[1] |
標準ネットワーキング
標準ネットワーキングでは、ノードがGoogle Virtual NIC(gVNIC)と標準のTCP / IPを使い、プライマリVPCネットワーク経由で通信します。Google Cloudのコンピューティング環境間で移植しやすく、標準のVPCルーティングとネットワーク ポリシーを使います。[1]
高速GPUネットワーキング
GPUDirect-TCPX(4つの専用VPC)とGPUDirect-TCPXO(8つの専用VPC)は、カスタムのオフロード エンジンを使います。ネイティブのRDMAハードウェアなしで、標準のイーサネット上に高スループットのマルチレールGPU通信を実現します。[1]
RoCEv2は、専用のゾーン ネットワーク プロファイルに接続された専用のRDMA VPC上で動作します。VMインスタンス(A3 Ultra、A4、A4X)はZONE-vpc-roce、ベアメタル インスタンス(A4X Maxなど)はZONE-vpc-roce-metalを使います。[1]
TPUネットワーキング
Cloud TPU v6e(Trillium)とTPU7xには、ネイティブのマルチNICアーキテクチャが導入されました。ワーカーノードは標準のKubernetes管理トラフィックをプライマリVPCに分け、TPUデータとクロススライス通信にはセカンダリの専用VPCを使います。[1]
Cloud RunのダイレクトVPC下り
ダイレクトVPC下りは1分未満でIPを割り当て、サーバーレス コンテナをプライベートVPCネットワークに直接バインドします。公共のインターネットやレガシー コネクタVMなしで、内部データレイクやデータベース、プライベートAPIへセキュアかつ低レイテンシでアクセスできます。[1]
フルイド コンピューティングのネットワーク設定
Google Cloudは、フルイド コンピューティングを使う場合、ワークロードの性能が最適化される設計に合わせてネットワーク設定を調整できるとしています。RoCEv2のスタックは、Cluster Toolkitの自動化されたブループリントでデプロイできます。[1]
Cluster Toolkit
RDMA VPCやMTUチューニング、DRAドライバを含むRoCEv2のスタック全体は、Cluster Toolkitの自動化されたブループリントでデプロイできます。GPUDirect-TCPX / TCPXOのマルチVPCトポロジも、事前構築済みのブループリントなどでデプロイできます。[1]
GKE マネージド DRANET
RoCEv2対象のGPUやTPUネットワーキング対象のTPUをGKEにデプロイする場合は、GKE マネージド DRANETで追加のネットワークを自動的にプロビジョニングできます。GPUにはRDMAネットワーク インターフェースをマッピングするドライバ、TPUには通信用のドライバを割り当てられます。これらは標準のKubernetesリソース クレームでPodに直接割り当てられます。[1]
GKE Dataplane V2を使うGKE Standardクラスタの作成コマンドは以下の通りです。[2]
gcloud container clusters create CLUSTER_NAME \
--enable-dataplane-v2 \
--region=CONTROL_PLANE_LOCATION \
--project=PROJECT_ID \
--cluster-version=CLUSTER_VERSION
公式資料からの抜粋:GKE マネージド DRANET を使用してネットワーク リソースを割り当てる(クラスタを作成する)。対象版・範囲:GKEドキュメント(2026年10月4日取得時点)。[2]
上記のコードでは、--enable-dataplane-v2でGKE Dataplane V2を有効にしています。CLUSTER_VERSIONには、1.34.1-gke.1829001以降を指定します。[2]
GKE DRANETを使うには、まずGPUまたはTPUのノードプールでドライバを有効にします。次にResourceClaimTemplateでDeviceClassと割り当てモードを指定し、Pod仕様のresourceClaimsから参照します。[2]
フルイド コンピューティングのネットワークの選び方
編集部では、使うアクセラレータとワークロードの種類を手がかりに、ネットワーク構成を選ぶことをおすすめします。分散データの前処理やパイプライン ステージの分離、独立した推論レプリカ、コンピュータ ビジョンは、標準ネットワーキングがサポートするワークロードです。[1]
分散トレーニングとマルチノード推論には、膨大なパラメータ交換と集団通信を処理する特殊なマルチレール ネットワーク ファブリックが必要です。個々のTPUスライスを超えてスケールするモデルでは、Cloud TPUマルチスライスがJupiterデータセンター ネットワークで複数のICIメッシュを接続します。[1]
ComputeClassesのフォールバックで代替のアクセラレータへ切り替わると、使うネットワーク構成も変わる場合があります。例えば、A4 VMはRoCEv2、A3 High VMとA3 Mega VMはGPUDirect-TCPX / TCPXOの対象です。編集部では、フォールバック先の構成で必要なネットワークも事前に確かめることをおすすめします。[1]
フルイド コンピューティングの選択肢の条件
編集部では、利用前にRDMA ネットワーク プロファイルとカレンダー モード、Cloud Run GPUの条件を確かめることをおすすめします。条件は以下の通りです。[3][4][5]
RDMA ネットワーク プロファイル
RDMA ネットワーク プロファイルは、一部のゾーンでのみ使用できます。RoCE VPCネットワークがサポートするのは、A3 Ultra、A4、A4Xマシンシリーズでのみ使えるMRDMA NICだけです。[3]
VMのRDMA以外のNICは、通常のVPCネットワークに接続します。ベアメタル インスタンスは、別のZONE-vpc-roce-metalプロファイルを使います。[1][3]
承認後のカレンダー モード予約の条件
Google Cloudがリクエストを承認した場合、カレンダー モードの将来の予約リクエストは作成後にキャンセルや削除、変更ができません。容量を使うかどうかに関係なく、リクエストした容量の料金はリクエストの開始時に支払います。[4]
Cloud Run GPUのリージョン
確認日時点で、Cloud Run GPUサービスがサポートするアジアのリージョンは、RTX PRO 6000がシンガポールとデリー、L4がシンガポールとムンバイ(完全招待制)です。東京と大阪のリージョンは、どちらの一覧にも含まれていません。[1][5]
出典
- ^ Google Cloud. 「AI ワークロードのコンピューティングを柔軟に選択できるよう Google Cloud ネットワーキングがサポート」. https://cloud.google.com/blog/ja/topics/developers-practitioners/how-google-cloud-networking-supports-your-fluid-compute-choices-for-ai-workloads, (参照 26-10-04).
- ^ Google Cloud. 「GKE マネージド DRANET を使用してネットワーク リソースを割り当てる」. https://docs.cloud.google.com/kubernetes-engine/docs/how-to/allocate-network-resources-dra?hl=ja, (参照 26-10-04).
- ^ Google Cloud. 「RDMA ネットワーク プロファイル」. https://docs.cloud.google.com/vpc/docs/rdma-network-profiles?hl=ja, (参照 26-10-04).
- ^ Google Cloud. 「カレンダー モードでの将来の予約リクエストについて」. https://docs.cloud.google.com/compute/docs/instances/future-reservations-calendar-mode-overview?hl=ja, (参照 26-10-04).
- ^ Google Cloud. 「サービスの GPU サポート」. https://docs.cloud.google.com/run/docs/configuring/services/gpu?hl=ja, (参照 26-10-04).
※本記事は公式の一次情報を基に編集しています。内容はAIで確認していますが、誤りや最新情報との差異がある場合は、以下フォームよりご報告ください。
修正・削除・掲載などの依頼はこちら
















