Advanced Compute Images 總覽

人工智慧 (AI)、機器學習 (ML) 和高效能運算 (HPC) 工作負載通常需要建立自訂映像檔,其中包含額外的軟體套件,並經過調整以達到最佳效能。您現在可以使用進階運算映像檔,為 AI/機器學習或 HPC 工作負載設定最佳化環境。

進階運算映像檔提供 AI/機器學習和 HPC 基礎架構的標準化映像檔堆疊。您不必再手動為 AI/機器學習和 HPC 工作負載建構自訂映像檔。

優點

Advanced Compute Images 具有下列優點:

  • 預設提供適用於 AI/機器學習或 HPC 工作負載的運算執行個體。無須手動調整效能、管理執行個體重新啟動、安裝 Slurm 代理程式,或掌握緊密耦合的 AI/機器學習或 HPC 工作負載的最新 Cloud de Confiance 更新。
  • 一致且可重現的效能。圖片標準化可讓您獲得一致且可重現的應用程式層級效能。

Advanced Compute Images 類型

進階運算映像檔包含多個設定層,可支援執行 AI/機器學習和 HPC 工作負載。

  • 作業系統設定:包括停用自動更新、設定 HPC 最佳化 ulimit、調整核心 sysctl 參數,以及設定 SELinux 等安全性設定。
  • 網路調整:包含網路調整所需的指令碼,例如啟用多佇列服務。
  • Cloud de Confiance by S3NS 整合:安裝及設定 Google Cloud CLI 和 Ops Agent
  • 容器工具:安裝及設定所有容器相關軟體,包括:
  • NVIDIA:安裝下列工具:
  • MPI:安裝訊息傳遞介面 (MPI) 程式庫。 在 Ubuntu 和 Rocky Linux 架構的映像檔上安裝 Open MPI。如果是以 Rocky Linux 為基礎的映像檔,您也可以使用預先安裝的指令碼安裝及設定 Intel MPI 程式庫:

    sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
    
  • Slurm:安裝建立 Slurm 叢集節點所需的核心元件,包括:

  • 檔案系統用戶端:安裝用戶端工具,存取各種檔案系統,例如 Cloud Storage FUSE、NFS 公用程式 (nfs-utils) 和 Lustre 用戶端。

  • 開發人員工具:安裝常見的開發和偵錯工具鍊與公用程式,例如:

  • 環境管理:安裝及設定環境管理工具 (主要是 Lmod),並設定必要的設定檔指令碼,讓使用者可使用模組指令。

  • RDMA:在 CPU (以 Rocky Linux 為基礎) 映像檔上安裝遠端直接記憶體存取 (RDMA) 驅動程式和套件,包括:

    • rdma-core和開發程式庫
    • libfabric
    • perftest
    • kmod-idpf-irdma - 適用於支援的運算最佳化機器類型的 Intel Ethernet RDMA 驅動程式
    • infiniband-diagslibibverbslibrdmacm 公用程式

支援的硬體和映像檔系列

ACI 支援兩種主要硬體平台:

  • CPU (HPC):支援 CPU 工作負載,並具備下列特徵:

    • 經過最佳化調整,適合會耗用大量運算資源的工作負載
    • 支援 Rocky Linux 9
    • 隨附 RDMA 驅動程式和公用程式
    • 預先整合 MPI 程式庫,包括 Open MPI 和可設定的 Intel MPI
  • GPU (AI/機器學習/HPC):支援 GPU 工作負載,並具備下列特徵:

    • 已針對 NVIDIA 加速器進行最佳化
    • 支援 Ubuntu LTS 22.04 和 Ubuntu LTS 24.04
    • 預先整合 CUDA 和 NVIDIA 驅動程式
    • 適合用於 AI、機器學習或 HPC 工作負載
    • 在 Cluster Toolkit 中為 A4X、A4 和 A3 Ultra 機型部署 Slurm 叢集藍圖時,是否會安裝預設映像檔
硬體 作業系統 自動調度管理工具 功能與特色 架構 支援的機器系列 映像檔系列
CPU Rocky Linux 9
  • RDMA
  • OpenMPI、IntelMPI
AMD x86_64 C2D、H3、H4D aci-cpu-rocky-linux-9-amd64
CPU Rocky Linux 9 Slurm 25.11
  • RDMA
  • MPI
AMD x86_64 C2D、H3、H4D aci-cpu-rocky-linux-9-slurm-2511-amd64
GPU Ubuntu LTS 22.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A4 aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
Arm64 A4X aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64
GPU Ubuntu LTS 22.04
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2204-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2404-cuda-130-nvidia-580-amd64

預先安裝的套件 (或 RPM)

Advanced Compute Images 預先安裝了各種工具、程式庫、驅動程式和套件,如要查看任何映像檔安裝的項目清單,請參閱該映像檔的資訊清單檔案。

您可以在 /usr/share/google/manifest.txt 找到資訊清單檔案。

映像檔系列生命週期階段和支援

所有 Advanced Compute Images 系列都遵循標準化生命週期,確保安全性、穩定性及可預測的維護時間表。在生命週期的每個階段,映像檔系列都會有下列其中一種支援狀態:

  • 支援
    • 接收重大安全性更新和錯誤修正
    • 透過 Cloud Customer Care 取得支援。
    • 可用於建立運算執行個體。
  • 不支援
    • 無法再接收重大安全性更新或錯誤修正。
    • 這個版本並未推出新功能。
    • Cloud Customer Care 不提供相關支援。
    • 無法用於建立運算執行個體。

Advanced Compute Images 系列的生命週期分為四個階段:

生命週期階段 支援狀態 說明和影響
已啟用 支援 建議用於新部署作業。映像檔系列在發布日後 12 個月內,可獲得完整支援。接收重大安全性更新和錯誤修正。
已淘汰 (EOS 日期) 不支援 建議您遷移至支援的映像檔系列。在「有效」階段結束後約六個月,映像檔系列就會遭到淘汰。未發布任何新功能或修補程式。 Cloud de Confiance 使用這個映像檔系列建立執行個體時,控制台和 Google Cloud CLI 會顯示警告。
已淘汰 不支援 淘汰階段結束後,映像檔系列就會過時。您無法再使用這個映像檔系列建立運算執行個體。現有運算執行個體會繼續執行,但可能與 Slurm 控制器不相容。
刪除 不支援 映像檔系列淘汰三個月後,系統會永久刪除基礎的 Advanced Compute Images 映像檔資源。現有運算執行個體會繼續執行,但可能與 Slurm 控制器不相容,且有安全漏洞。

如要瞭解映像檔系列的確切支援終止日期,請參閱「支援的硬體和映像檔系列」。

定價

使用 Advanced Compute Images 不須支付額外費用。由於 Advanced Compute Images 是在 Compute Engine 上執行,因此您可能需要支付 Compute Engine 資源的費用,例如 vCPU、GPU、TPU、磁碟和記憶體。詳情請參閱 Compute Engine 定價

後續步驟