人工智慧 (AI)、機器學習 (ML) 和高效能運算 (HPC) 工作負載通常需要建立自訂映像檔,其中包含額外的軟體套件,並經過調整以達到最佳效能。您現在可以使用進階運算映像檔,為 AI/機器學習或 HPC 工作負載設定最佳化環境。
進階運算映像檔提供 AI/機器學習和 HPC 基礎架構的標準化映像檔堆疊。您不必再手動為 AI/機器學習和 HPC 工作負載建構自訂映像檔。
優點
Advanced Compute Images 具有下列優點:
- 預設提供適用於 AI/機器學習或 HPC 工作負載的運算執行個體。無須手動調整效能、管理執行個體重新啟動、安裝 Slurm 代理程式,或掌握緊密耦合的 AI/機器學習或 HPC 工作負載的最新 Cloud de Confiance 更新。
- 一致且可重現的效能。圖片標準化可讓您獲得一致且可重現的應用程式層級效能。
Advanced Compute Images 類型
進階運算映像檔包含多個設定層,可支援執行 AI/機器學習和 HPC 工作負載。
- 作業系統設定:包括停用自動更新、設定 HPC 最佳化 ulimit、調整核心 sysctl 參數,以及設定 SELinux 等安全性設定。
- 網路調整:包含網路調整所需的指令碼,例如啟用多佇列服務。
- Cloud de Confiance by S3NS 整合:安裝及設定 Google Cloud CLI 和 Ops Agent。
- 容器工具:安裝及設定所有容器相關軟體,包括:
- Docker
- NVIDIA Container Toolkit (版本 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA:安裝下列工具:
MPI:安裝訊息傳遞介面 (MPI) 程式庫。 在 Ubuntu 和 Rocky Linux 架構的映像檔上安裝 Open MPI。如果是以 Rocky Linux 為基礎的映像檔,您也可以使用預先安裝的指令碼安裝及設定 Intel MPI 程式庫:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm:安裝建立 Slurm 叢集節點所需的核心元件,包括:
- Slurm 二進位檔 (25.11 版)
- Munge 進行驗證
- PMIx:程序管理
- JSON Web Token (JWT) 程式庫 (
libjwt)
檔案系統用戶端:安裝用戶端工具,存取各種檔案系統,例如 Cloud Storage FUSE、NFS 公用程式 (
nfs-utils) 和 Lustre 用戶端。開發人員工具:安裝常見的開發和偵錯工具鍊與公用程式,例如:
環境管理:安裝及設定環境管理工具 (主要是 Lmod),並設定必要的設定檔指令碼,讓使用者可使用模組指令。
RDMA:在 CPU (以 Rocky Linux 為基礎) 映像檔上安裝遠端直接記憶體存取 (RDMA) 驅動程式和套件,包括:
rdma-core和開發程式庫libfabricperftestkmod-idpf-irdma- 適用於支援的運算最佳化機器類型的 Intel Ethernet RDMA 驅動程式infiniband-diags、libibverbs和librdmacm公用程式
支援的硬體和映像檔系列
ACI 支援兩種主要硬體平台:
CPU (HPC):支援 CPU 工作負載,並具備下列特徵:
- 經過最佳化調整,適合會耗用大量運算資源的工作負載
- 支援 Rocky Linux 9
- 隨附 RDMA 驅動程式和公用程式
- 預先整合 MPI 程式庫,包括 Open MPI 和可設定的 Intel MPI
GPU (AI/機器學習/HPC):支援 GPU 工作負載,並具備下列特徵:
- 已針對 NVIDIA 加速器進行最佳化
- 支援 Ubuntu LTS 22.04 和 Ubuntu LTS 24.04
- 預先整合 CUDA 和 NVIDIA 驅動程式
- 適合用於 AI、機器學習或 HPC 工作負載
- 在 Cluster Toolkit 中為 A4X、A4 和 A3 Ultra 機型部署 Slurm 叢集藍圖時,是否會安裝預設映像檔
| 硬體 | 作業系統 | 自動調度管理工具 | 功能與特色 | 架構 | 支援的機器系列 | 映像檔系列 |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | 無 |
|
AMD x86_64 | C2D、H3、H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D、H3、H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 22.04 | 無 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | 無 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
預先安裝的套件 (或 RPM)
Advanced Compute Images 預先安裝了各種工具、程式庫、驅動程式和套件,如要查看任何映像檔安裝的項目清單,請參閱該映像檔的資訊清單檔案。
您可以在 /usr/share/google/manifest.txt 找到資訊清單檔案。
映像檔系列生命週期階段和支援
所有 Advanced Compute Images 系列都遵循標準化生命週期,確保安全性、穩定性及可預測的維護時間表。在生命週期的每個階段,映像檔系列都會有下列其中一種支援狀態:
- 支援:
- 接收重大安全性更新和錯誤修正
- 透過 Cloud Customer Care 取得支援。
- 可用於建立運算執行個體。
- 不支援:
- 無法再接收重大安全性更新或錯誤修正。
- 這個版本並未推出新功能。
- Cloud Customer Care 不提供相關支援。
- 無法用於建立運算執行個體。
Advanced Compute Images 系列的生命週期分為四個階段:
| 生命週期階段 | 支援狀態 | 說明和影響 |
|---|---|---|
| 已啟用 | 支援 | 建議用於新部署作業。映像檔系列在發布日後 12 個月內,可獲得完整支援。接收重大安全性更新和錯誤修正。 |
| 已淘汰 (EOS 日期) | 不支援 | 建議您遷移至支援的映像檔系列。在「有效」階段結束後約六個月,映像檔系列就會遭到淘汰。未發布任何新功能或修補程式。 Cloud de Confiance 使用這個映像檔系列建立執行個體時,控制台和 Google Cloud CLI 會顯示警告。 |
| 已淘汰 | 不支援 | 淘汰階段結束後,映像檔系列就會過時。您無法再使用這個映像檔系列建立運算執行個體。現有運算執行個體會繼續執行,但可能與 Slurm 控制器不相容。 |
| 刪除 | 不支援 | 映像檔系列淘汰三個月後,系統會永久刪除基礎的 Advanced Compute Images 映像檔資源。現有運算執行個體會繼續執行,但可能與 Slurm 控制器不相容,且有安全漏洞。 |
如要瞭解映像檔系列的確切支援終止日期,請參閱「支援的硬體和映像檔系列」。
定價
使用 Advanced Compute Images 不須支付額外費用。由於 Advanced Compute Images 是在 Compute Engine 上執行,因此您可能需要支付 Compute Engine 資源的費用,例如 vCPU、GPU、TPU、磁碟和記憶體。詳情請參閱 Compute Engine 定價。
後續步驟
- 使用 Advanced Compute Images 建立執行個體
瞭解如何使用 Advanced Compute Images 部署一鍵式 Slurm 叢集藍圖: