フルイド コンピューティングを支えるGoogle Cloudの4構成と選び方

フルイド コンピューティングを支えるGoogle Cloudの4構成と選び方

公開:
CodeCampが提供するDX人材育成が可能なプログラミングやITが学べる公開講座

Google Cloudは米国時間2026年9月25日、AIワークロードを支えるネットワーク構成と、アクセラレータ選択時の考慮事項を紹介しました。構成は、標準ネットワーキング、高速GPUネットワーキング、TPUネットワーキング、Cloud Runの4つです。[1]

アクセラレータの可用性は業界全体の課題になる可能性があり、特定のタイプを前提にするとデプロイが遅れる場合があります。フルイド コンピューティングは、ユースケースに合う利用可能なリソースに基づき、複数のオプションでAIデプロイを設計するコンセプトです。[1]

目次
  1. フルイド コンピューティングのリソース オプション
  2. フルイド コンピューティングを支えるネットワーク構成
  3. フルイド コンピューティングのネットワーク設定
  4. フルイド コンピューティングのネットワークの選び方
  5. フルイド コンピューティングの選択肢の条件

フルイド コンピューティングのリソース オプション

例えば、プライベートLLMの推論をA4 VM(a4-highgpu-8g)のNVIDIA B200 GPUで実行する場合、そのGPUを本当に使えるかが課題です。リソースにアクセスする方法は、以下の通りです。[1]

Flex Start VMは、必要なアクセラレータ ノードがすべてそろうまでワークロードをキューに入れ、まとめてプロビジョニングして最大7日間プリエンプト不可で実行します。カレンダー モードでは1~90日前にアクセラレータ容量を予約でき、開始時間と終了時間が保証されます。Google Cloudは、カレンダー モードをスケジュールされた事前トレーニングの実行やベンチマークに最適としています。[1]

将来の予約は、将来の特定の日付から、指定したゾーンで確約されたハードウェアへのアクセスを保証します。フレックス予約では、短期契約によって、複数年のロックインなしで希少なアクセラレータ ノードを確保できます。[1]

GKEのComputeClassesでは、マルチファミリー フォールバック リストを定義できます。プライマリ プールがリージョンの制約に直面すると、クラスタは代替アクセラレータ タイプのプロビジョニングを自動で試行します。Spot VMは、フォールト トレラントなチェックポイント付きバッチジョブ向けに、余剰コンピューティングを大幅な割引価格で提供します。[1]

予約とVMで選ぶリソース オプション

図1 予約とVMで選ぶリソース オプション

フルイド コンピューティングを支えるネットワーク構成

Google Cloudのネットワーキング オプションは、さまざまなアクセラレータ タイプをサポートしています。コンポーネントはアクセラレータの選択で異なり、対応関係は以下の通りです。[1]

構成 対応アクセラレータ
標準ネットワーキング(GPU) NVIDIA T4(N1)、L4(G2)、A100(A2のシングルノードとマルチノード)
標準ネットワーキング(TPU) Cloud TPU v3、v5e(単一ホスト / スタンドアロン スライス)
GPUDirect-TCPX / TCPXO NVIDIA H100(4レールのA3 High VM)、H100 Mega(8レールのA3 Mega VM)
RoCEv2(VM) NVIDIA H200(A3 Ultra VM)、B200(A4 VM)、GB200 NVL72(A4X VM)
RoCEv2(ベアメタル) NVIDIA GB300(A4X Max ベアメタル)
TPUネットワーキング v4、v5p、v5e(マルチホスト Pod スライス)、v6e(Trillium)、TPU7x(Ironwood)
Cloud Run GPUサービスのNVIDIA L4(G2)、RTX PRO 6000(Blackwell)[1]

Python研修一覧はこちら

目的に合うPython研修を一覧形式から探したい方は、ぜひご利用ください。

Python研修を比較する

Java研修一覧はこちら

目的に合うJava研修を一覧形式から探したい方は、ぜひご利用ください。

Java研修を比較する

PHP研修一覧はこちら

目的に合うPHP研修を一覧形式から探したい方は、ぜひご利用ください。

PHP研修を比較する

新入社員研修

目的に合う新入社員研修を一覧形式から探したい方は、ぜひご利用ください。

新入社員研修を比較する

全ての研修からも探したい方はこちら

標準ネットワーキング

標準ネットワーキングでは、ノードがGoogle Virtual NIC(gVNIC)と標準のTCP / IPを使い、プライマリVPCネットワーク経由で通信します。Google Cloudのコンピューティング環境間で移植しやすく、標準のVPCルーティングとネットワーク ポリシーを使います。[1]

高速GPUネットワーキング

GPUDirect-TCPX(4つの専用VPC)とGPUDirect-TCPXO(8つの専用VPC)は、カスタムのオフロード エンジンを使います。ネイティブのRDMAハードウェアなしで、標準のイーサネット上に高スループットのマルチレールGPU通信を実現します。[1]

RoCEv2は、専用のゾーン ネットワーク プロファイルに接続された専用のRDMA VPC上で動作します。VMインスタンス(A3 Ultra、A4、A4X)はZONE-vpc-roce、ベアメタル インスタンス(A4X Maxなど)はZONE-vpc-roce-metalを使います。[1]

高速GPUネットワーキングの方式と専用VPC

図2 高速GPUネットワーキングの方式と専用VPC

TPUネットワーキング

Cloud TPU v6e(Trillium)とTPU7xには、ネイティブのマルチNICアーキテクチャが導入されました。ワーカーノードは標準のKubernetes管理トラフィックをプライマリVPCに分け、TPUデータとクロススライス通信にはセカンダリの専用VPCを使います。[1]

TPU v6e以降のマルチNIC構成

図3 TPU v6e以降のマルチNIC構成

Cloud RunのダイレクトVPC下り

ダイレクトVPC下りは1分未満でIPを割り当て、サーバーレス コンテナをプライベートVPCネットワークに直接バインドします。公共のインターネットやレガシー コネクタVMなしで、内部データレイクやデータベース、プライベートAPIへセキュアかつ低レイテンシでアクセスできます。[1]

Cloud RunのダイレクトVPC下り

図4 Cloud RunのダイレクトVPC下り

フルイド コンピューティングのネットワーク設定

Google Cloudは、フルイド コンピューティングを使う場合、ワークロードの性能が最適化される設計に合わせてネットワーク設定を調整できるとしています。RoCEv2のスタックは、Cluster Toolkitの自動化されたブループリントでデプロイできます。[1]

Cluster Toolkit

RDMA VPCやMTUチューニング、DRAドライバを含むRoCEv2のスタック全体は、Cluster Toolkitの自動化されたブループリントでデプロイできます。GPUDirect-TCPX / TCPXOのマルチVPCトポロジも、事前構築済みのブループリントなどでデプロイできます。[1]


Python基礎・実践(Django)

企業・法人向けのPython研修では、基礎から応用まで体系的に学べます。

Python研修の詳細

DX社員研修

企業・法人向けのDX研修では、実務に繋がるリスキリングでITレベルを向上させます。

DX研修の詳細

Javaエンジニア育成研修

企業・法人向けのJavaエンジニア育成研修では、Javaの基礎から応用まで確実に習得できます。

Java研修の詳細

新卒・新入社員向け研修

企業・法人に新入社員・新卒社員に向けたプログラミング研修を提供しています。

新入社員研修の詳細

コードキャンプのIT研修を全て見る

GKE マネージド DRANET

RoCEv2対象のGPUやTPUネットワーキング対象のTPUをGKEにデプロイする場合は、GKE マネージド DRANETで追加のネットワークを自動的にプロビジョニングできます。GPUにはRDMAネットワーク インターフェースをマッピングするドライバ、TPUには通信用のドライバを割り当てられます。これらは標準のKubernetesリソース クレームでPodに直接割り当てられます。[1]

GKE Dataplane V2を使うGKE Standardクラスタの作成コマンドは以下の通りです。[2]

gcloud container clusters create CLUSTER_NAME \
    --enable-dataplane-v2 \
    --region=CONTROL_PLANE_LOCATION \
    --project=PROJECT_ID \
    --cluster-version=CLUSTER_VERSION

公式資料からの抜粋:GKE マネージド DRANET を使用してネットワーク リソースを割り当てる(クラスタを作成する)。対象版・範囲:GKEドキュメント(2026年10月4日取得時点)。[2]

上記のコードでは、--enable-dataplane-v2でGKE Dataplane V2を有効にしています。CLUSTER_VERSIONには、1.34.1-gke.1829001以降を指定します。[2]

GKE DRANETを使うには、まずGPUまたはTPUのノードプールでドライバを有効にします。次にResourceClaimTemplateでDeviceClassと割り当てモードを指定し、Pod仕様のresourceClaimsから参照します。[2]

GKE DRANETでネットワークデバイスを要求する流れ

図5 GKE DRANETでネットワークデバイスを要求する流れ

フルイド コンピューティングのネットワークの選び方

編集部では、使うアクセラレータとワークロードの種類を手がかりに、ネットワーク構成を選ぶことをおすすめします。分散データの前処理やパイプライン ステージの分離、独立した推論レプリカ、コンピュータ ビジョンは、標準ネットワーキングがサポートするワークロードです。[1]

分散トレーニングとマルチノード推論には、膨大なパラメータ交換と集団通信を処理する特殊なマルチレール ネットワーク ファブリックが必要です。個々のTPUスライスを超えてスケールするモデルでは、Cloud TPUマルチスライスがJupiterデータセンター ネットワークで複数のICIメッシュを接続します。[1]

ワークロード別のネットワーク構成の目安

図6 ワークロード別のネットワーク構成の目安

ComputeClassesのフォールバックで代替のアクセラレータへ切り替わると、使うネットワーク構成も変わる場合があります。例えば、A4 VMはRoCEv2、A3 High VMとA3 Mega VMはGPUDirect-TCPX / TCPXOの対象です。編集部では、フォールバック先の構成で必要なネットワークも事前に確かめることをおすすめします。[1]

フルイド コンピューティングの選択肢の条件

編集部では、利用前にRDMA ネットワーク プロファイルとカレンダー モード、Cloud Run GPUの条件を確かめることをおすすめします。条件は以下の通りです。[3][4][5]

利用前に確かめる条件

図7 利用前に確かめる条件

RDMA ネットワーク プロファイル

RDMA ネットワーク プロファイルは、一部のゾーンでのみ使用できます。RoCE VPCネットワークがサポートするのは、A3 Ultra、A4、A4Xマシンシリーズでのみ使えるMRDMA NICだけです。[3]

VMのRDMA以外のNICは、通常のVPCネットワークに接続します。ベアメタル インスタンスは、別のZONE-vpc-roce-metalプロファイルを使います。[1][3]

RoCE VPCを使うVMのNICの接続先

図8 RoCE VPCを使うVMのNICの接続先

承認後のカレンダー モード予約の条件

Google Cloudがリクエストを承認した場合、カレンダー モードの将来の予約リクエストは作成後にキャンセルや削除、変更ができません。容量を使うかどうかに関係なく、リクエストした容量の料金はリクエストの開始時に支払います。[4]

Cloud Run GPUのリージョン

確認日時点で、Cloud Run GPUサービスがサポートするアジアのリージョンは、RTX PRO 6000がシンガポールとデリー、L4がシンガポールとムンバイ(完全招待制)です。東京と大阪のリージョンは、どちらの一覧にも含まれていません。[1][5]

出典

  1. ^ Google Cloud. 「AI ワークロードのコンピューティングを柔軟に選択できるよう Google Cloud ネットワーキングがサポート」. https://cloud.google.com/blog/ja/topics/developers-practitioners/how-google-cloud-networking-supports-your-fluid-compute-choices-for-ai-workloads, (参照 26-10-04).
  2. ^ Google Cloud. 「GKE マネージド DRANET を使用してネットワーク リソースを割り当てる」. https://docs.cloud.google.com/kubernetes-engine/docs/how-to/allocate-network-resources-dra?hl=ja, (参照 26-10-04).
  3. ^ Google Cloud. 「RDMA ネットワーク プロファイル」. https://docs.cloud.google.com/vpc/docs/rdma-network-profiles?hl=ja, (参照 26-10-04).
  4. ^ Google Cloud. 「カレンダー モードでの将来の予約リクエストについて」. https://docs.cloud.google.com/compute/docs/instances/future-reservations-calendar-mode-overview?hl=ja, (参照 26-10-04).
  5. ^ Google Cloud. 「サービスの GPU サポート」. https://docs.cloud.google.com/run/docs/configuring/services/gpu?hl=ja, (参照 26-10-04).

※本記事は公式の一次情報を基に編集しています。内容はAIで確認していますが、誤りや最新情報との差異がある場合は、以下フォームよりご報告ください。

修正・削除・掲載などの依頼はこちら
ブログに戻る

コメントを残す

コメントは公開前に承認される必要があることにご注意ください。

企業・法人向けのIT・プログラミング・生成AI研修を探す、比較する - IT・プログラミングを知って学べるコネクトメディア CodeCampが提供するDX人材育成が可能なプログラミングやITが学べる公開講座 - IT・プログラミングを知って学べるコネクトメディア コードキャンプが提供する無料で学べるプログラミングスクール講座 - IT・プログラミングを知って学べるコネクトメディア コードキャンプDX人材育成研修 - IT・プログラミングを知って学べるコネクトメディア 3.5日の研修で、年間1,600時間の削減効果が見込まれる。東京きらぼしフィナンシャルグループのDX人材育成事例 - IT・プログラミングを知って学べるコネクトメディア 配属3ヶ月で30%の生産性向上を実現するいよぎんコンピュータサービスの新人研修に迫る - IT・プログラミングを知って学べるコネクトメディア 金融業界の業務効率化を加速するニッセイアセットマネジメントの生成AI×GAS活用研修事例 - IT・プログラミングを知って学べるコネクトメディア 【製造業のDX人材育成事例】デジタル人材の即戦力化を実現する、日本ガイシ株式会社の異動者向オンボーディング研修 - ITやプログラミングを知って学べるコネクトメディア フューチャーアーキテクト株式会社が実現した新入社員向けIT研修プログラムでタスクフォース制度が主体的な学びと成長を生み出す - IT・プログラミングを知って学べるコネクトメディア コードキャンプDX人材育成研修 - IT・プログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/【IT新入社員研修】オンラインとオフラインの最適バランスを実現したFutureOneの導入事例 - IT・プログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/【新入社員研修】柔軟なハイブリッド型Java研修で実現した新卒20名の成長と成果|サークレイス株式会社 - ITやプログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/現場により近いところにデジタルを根付かせるDX基礎講座研修|株式会社ブリヂストン - ITやプログラミングを知って学べるコネクトメディア コードキャンプIT・プログラミング研修事例/業務の効率化・DX推進に向けたIT人材育成への第一歩|株式会社カナエ - ITやプログラミングを知って学べるコネクトメディア 企業・法人向けのIT・プログラミング研修 - ITやプログラミングを知って学べるコネクトメディア

What's New

新着記事

対象者別で探す

子供(小学生・中学生・高校生)向け
プログラミング教室検索する

子供(小学生・中学生・高校生)がロボットやプログラミング言語を学ぶことができるオフラインからオンラインスクールを検索、比較することが可能です。

子供(小学生・中学生・高校生)
プログラミング教室検索する

ITやプログラムなどの
最新情報を検索する

日々、新しいITやプログラミング言語の情報が流れていきますが、特定の情報を時系列でニュースやコラムを確認することができます。

ITやプログラムなどの
最新情報を検索する