I workload di intelligenza artificiale (AI), machine learning (ML) e computing ad alte prestazioni (HPC) spesso richiedono la creazione di un'immagine personalizzata che includa pacchetti software aggiuntivi e sia ottimizzata per prestazioni ottimali. Ora puoi utilizzare le Advanced Compute Images per configurare un ambiente ottimizzato per i tuoi workload AI/ML o HPC.
Le immagini Advanced Compute forniscono uno stack di immagini standardizzato per l'infrastruttura AI/ML e HPC. Queste immagini possono eliminare la necessità di creare manualmente immagini personalizzate per i workload AI/ML e HPC.
Vantaggi
Advanced Compute Images offre i seguenti vantaggi:
- Istanze di calcolo pronte per i workload AI/ML o HPC per impostazione predefinita. Non è necessario ottimizzare manualmente le prestazioni, gestire i riavvii delle istanze, installare gli agenti Slurm o rimanere al passo con gli ultimi aggiornamenti di Cloud de Confiance per i workload AI/ML o HPC ad alto accoppiamento.
- Prestazioni coerenti e riproducibili. La standardizzazione delle immagini ti offre prestazioni a livello di applicazione coerenti e riproducibili.
Funzionalità di Advanced Compute Images
Le immagini di Advanced Compute contengono più livelli di configurazioni per supportare l'esecuzione di workload AI/ML e HPC.
- Configurazioni del sistema operativo: include la disattivazione degli aggiornamenti automatici, l'impostazione di ulimit ottimizzati per HPC, la regolazione dei parametri sysctl del kernel e la configurazione delle impostazioni di sicurezza come SELinux.
- Ottimizzazione della rete: contiene gli script necessari per l'ottimizzazione della rete, ad esempio l'attivazione del servizio multi-queue.
- IntegrazioneCloud de Confiance by S3NS : installa e configura Google Cloud CLI e l'Ops Agent.
- Strumenti container: installa e configura tutto il software correlato ai container, tra cui:
- Docker
- NVIDIA Container Toolkit (versione 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA: installa i seguenti strumenti:
- NVIDIA CUDA Toolkit versione 13.0,
- NVIDIA Data Center GPU Manager (DCGM) versione 4
- NVIDIA Fabric Manager
- Plug-in NCCL/gIB
MPI: installa le librerie Message Passing Interface (MPI). Installa Open MPI su immagini basate su Ubuntu e Rocky Linux. Per le immagini basate su Rocky Linux, puoi anche installare e configurare la libreria Intel MPI utilizzando uno script preinstallato:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm: installa i componenti principali necessari per creare un nodo cluster Slurm, tra cui:
- File binari Slurm (versione 25.11)
- Munge per l'autenticazione
- PMIx per la gestione dei processi
- Libreria JSON Web Token (JWT) (
libjwt)
Client file system: installa strumenti lato client per accedere a vari file system, come Cloud Storage FUSE, utilità NFS (
nfs-utils) e il client Lustre.Strumenti per sviluppatori: installa catene di strumenti di sviluppo e debug comuni e utilità, ad esempio:
Gestione dell'ambiente: installa e configura gli strumenti di gestione dell'ambiente, principalmente Lmod, e configura gli script del profilo necessari per rendere disponibile il comando del modulo agli utenti.
RDMA: installa i driver e i pacchetti RDMA (Remote Direct Memory Access) sulle immagini della CPU (basate su Rocky Linux), tra cui:
rdma-coree librerie di sviluppolibfabricperftestkmod-idpf-irdma- Driver Intel Ethernet RDMA per i tipi di macchine ottimizzate per il calcolo supportatiinfiniband-diags,libibverbselibrdmacm
Hardware e famiglie di immagini supportati
ACI supporta due piattaforme hardware principali:
CPU (HPC): supporta i carichi di lavoro della CPU e presenta le seguenti caratteristiche:
- Sono ottimizzate per i workload ad alta intensità di calcolo
- Supporto di Rocky Linux 9
- Vengono forniti con driver e utilità RDMA per supportare Cloud RDMA
- Sono dotate di librerie MPI preintegrate, tra cui Open MPI e Intel MPI configurabile
GPU (AI/ML/HPC): supportano i workload GPU e hanno le seguenti caratteristiche:
- Sono ottimizzate per gli acceleratori NVIDIA
- Supporto di Ubuntu LTS 22.04 e Ubuntu LTS 24.04
- Sono dotate di driver CUDA e NVIDIA preintegrati
- Includi driver e utilità RDMA per supportare MRDMA per la comunicazione da GPU a GPU
- Sono adatti a workload AI, ML o HPC
- Le immagini predefinite vengono installate quando esegui il deployment dei blueprint del cluster Slurm per i tipi di macchine A4X, A4 e A3 Ultra in Cluster Toolkit
| Hardware | Sistema operativo | Orchestratore | Funzionalità | Architettura | Serie di macchine supportate | Famiglia di immagini |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | nessuno |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 8 | nessuno |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-8-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | nessuno |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | nessuno |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
Pacchetti (o RPM) preinstallati
Le immagini di calcolo avanzato sono dotate di una serie di strumenti, librerie, driver e pacchetti preinstallati. Per visualizzare un elenco di ciò che è installato per un'immagine, consulta il file manifest dell'immagine.
Puoi trovare il file manifest in /usr/share/google/manifest.txt.
Fasi del ciclo di vita e supporto delle famiglie di immagini
Tutte le famiglie di immagini di Compute avanzate seguono un ciclo di vita standardizzato per garantire sicurezza, stabilità e pianificazioni di manutenzione prevedibili. Durante ogni fase del ciclo di vita, una famiglia di immagini ha uno dei seguenti stati di supporto:
- Supportati:
- Riceve aggiornamenti critici della sicurezza e correzioni di bug
- Supportato tramite l'assistenza clienti Google Cloud.
- Può essere utilizzato per creare istanze di computing.
- Non supportato:
- Non riceve più aggiornamenti critici della sicurezza o correzioni di bug.
- Nessuna nuova funzionalità.
- Non supportato tramite l'assistenza clienti Google Cloud.
- Non può essere utilizzato per creare istanze di computing.
Il ciclo di vita di una famiglia di Advanced Compute Images è composto da quattro fasi:
| Fase del ciclo di vita | Stato del supporto | Descrizione e impatto |
|---|---|---|
| Attivo | Supportato | Consigliato per i nuovi deployment. Per 12 mesi dopo la data di rilascio, la famiglia di immagini è completamente supportata. Riceve aggiornamenti critici della sicurezza e correzioni di bug. |
| Deprecato (data di fine del supporto) | Non supportato | Ti consigliamo di eseguire la migrazione a una famiglia di immagini supportata. Per circa sei mesi dopo la fine della fase attiva, la famiglia di immagini viene ritirata. Non vengono rilasciate nuove funzionalità o patch. Gli avvisi della console Cloud de Confiance e di Google Cloud CLI vengono visualizzati quando crei istanze che utilizzano questa famiglia di immagini. |
| Obsoleto | Non supportato | Al termine della fase di deprecazione, la famiglia di immagini diventa obsoleta. Non puoi più creare istanze di Compute utilizzando questa famiglia di immagini. Le istanze di computing esistenti continuano a essere eseguite, ma rischiano l'incompatibilità con il controller Slurm. |
| Eliminazione | Non supportato | Tre mesi dopo che una famiglia di immagini diventa obsoleta, la risorsa immagine Advanced Compute Images sottostante viene eliminata definitivamente. Le istanze di calcolo esistenti continuano a essere eseguite, ma rischiano l'incompatibilità con il controller Slurm e le vulnerabilità. |
Per informazioni sulle date esatte di fine del supporto per una famiglia di immagini, consulta Hardware e famiglie di immagini supportati.
Prezzi
Le Advanced Compute Images sono disponibili senza costi aggiuntivi. Poiché le immagini di calcolo avanzato vengono eseguite su Compute Engine, potresti dover sostenere dei costi relativi alle risorse di Compute Engine, come vCPU, GPU, TPU, dischi e memoria. Per saperne di più, consulta la pagina relativa ai prezzi di Compute Engine.
Passaggi successivi
- Crea un'istanza con Advanced Compute Images
Scopri come eseguire il deployment di progetti di cluster Slurm chiavi in mano con le immagini di Advanced Compute: