Für Arbeitslasten aus den Bereichen künstliche Intelligenz (KI), maschinelles Lernen (ML) und Hochleistungs-Computing (HPC) ist es oft erforderlich, ein benutzerdefiniertes Image zu erstellen, das zusätzliche Softwarepakete enthält und für optimale Leistung optimiert ist. Sie können jetzt Advanced Compute Images verwenden, um eine optimierte Umgebung für Ihre KI-/ML- oder HPC-Arbeitslasten einzurichten.
Advanced Compute Images bieten einen standardisierten Imagestack für KI/ML- und HPC-Infrastruktur. Mit diesen Images müssen Sie nicht mehr manuell eigene benutzerdefinierte Images für KI-/ML- und HPC-Arbeitslasten erstellen.
Vorteile
Advanced Compute Images bieten folgende Vorteile:
- Compute-Instanzen, die standardmäßig für KI-/ML- oder HPC-Arbeitslasten bereit sind: Sie müssen die Leistung nicht manuell optimieren, Instanzneustarts verwalten, Slurm-Agents installieren oder sich über die neuesten Cloud de Confiance Updates für eng gekoppelte KI/ML- oder HPC-Workloads auf dem Laufenden halten.
- Konstante, reproduzierbare Leistung: Die Bildstandardisierung sorgt für eine konsistente, reproduzierbare Leistung auf Anwendungsebene.
Funktionen von Advanced Compute Images
Advanced Compute-Images enthalten mehrere Konfigurationsebenen zur Unterstützung von KI-/ML- und HPC-Arbeitslasten.
- Betriebssystemkonfigurationen: Dazu gehören das Deaktivieren automatischer Updates, das Festlegen von HPC-optimierten ulimits, das Anpassen von Kernel-Sysctl-Parametern und das Konfigurieren von Sicherheitseinstellungen wie SELinux.
- Netzwerkoptimierung: Enthält die erforderlichen Skripts für die Netzwerkoptimierung, z. B. zum Aktivieren des Multi-Queue-Dienstes.
- Cloud de Confiance by S3NS integration: Installiert und konfiguriert die Google Cloud CLI und den Ops-Agenten.
- Container-Tools: Installiert und konfiguriert alle containerbezogenen Softwarekomponenten, darunter:
- Docker
- NVIDIA Container Toolkit (Version 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA: Installiert die folgenden Tools:
- NVIDIA CUDA Toolkit Version 13.0,
- NVIDIA Data Center GPU Manager (DCGM) Version 4
- NVIDIA Fabric Manager
- NCCL-/gIB-Plug-in
MPI: Installiert die MPI-Bibliotheken (Message Passing Interface). Installiert Open MPI auf Ubuntu-basierten und Rocky Linux-basierten Images. Bei auf Rocky Linux basierenden Images können Sie die Intel MPI-Bibliothek auch mit einem vorinstallierten Skript installieren und konfigurieren:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm: Installiert die erforderlichen Kernkomponenten zum Erstellen eines Slurm-Clusterknotens, einschließlich:
- Slurm-Binärdateien (Version 25.11)
- Munge für die Authentifizierung
- PMIx für die Prozessverwaltung
- JSON-Webtoken (JWT)-Bibliothek (
libjwt)
Dateisystemclients: Installiert clientseitige Tools für den Zugriff auf verschiedene Dateisysteme wie Cloud Storage FUSE, NFS-Dienstprogramme (
nfs-utils) und den Lustre-Client.Entwicklertools: Installiert gängige Toolchains für die Entwicklung und Fehlerbehebung sowie Dienstprogramme wie:
Umgebungsverwaltung: Installiert und konfiguriert Tools zur Umgebungsverwaltung, hauptsächlich Lmod, und richtet die erforderlichen Profilskripts ein, damit der Modulbefehl für Nutzer verfügbar ist.
RDMA: Installiert RDMA-Treiber (Remote Direct Memory Access) und -Pakete auf CPU-Images (auf Rocky Linux basierend), darunter:
rdma-coreund Entwicklungsbibliothekenlibfabricperftestkmod-idpf-irdma– Intel Ethernet RDMA-Treiber für unterstützte computing-optimierte Maschinentypeninfiniband-diags-,libibverbs- undlibrdmacm-Dienstprogramme
Unterstützte Hardware- und Image-Familien
ACI unterstützt zwei primäre Hardwareplattformen:
CPU (HPC): Unterstützt CPU-Arbeitslasten und hat die folgenden Merkmale:
- Für rechenintensive Arbeitslasten optimiert
- Unterstützung von Rocky Linux 9
- RDMA-Treiber und ‑Dienstprogramme zur Unterstützung von Cloud RDMA
- Sie enthalten vorintegrierte MPI-Bibliotheken, darunter Open MPI und konfigurierbares Intel MPI.
GPU (KI/ML/HPC): Unterstützen GPU-Arbeitslasten und haben die folgenden Merkmale:
- Sind für NVIDIA-Beschleuniger optimiert
- Unterstützung von Ubuntu LTS 22.04 und Ubuntu LTS 24.04
- Mit vorintegrierten CUDA- und NVIDIA-Treibern
- RDMA-Treiber und ‑Dienstprogramme zur Unterstützung von MRDMA für die GPU-zu-GPU-Kommunikation einschließen
- Sie eignen sich für KI-, ML- oder HPC-Arbeitslasten.
- Werden die Standard-Images installiert, wenn Sie Slurm-Cluster-Blueprints für A4X-, A4- und A3-Ultra-Maschinentypen im Cluster Toolkit bereitstellen?
| Hardware | Betriebssystem | Orchestrator | Features | Architektur | Unterstützte Maschinenserien | Image-Familie |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | Keine |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 8 | Keine |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-8-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | Keine |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Keine |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
Vorinstallierte Pakete (oder RPMs)
Advanced Compute-Images enthalten eine Vielzahl von vorinstallierten Tools, Bibliotheken, Treibern und Paketen. Eine Liste der für ein Image installierten Komponenten finden Sie in der Manifestdatei für dieses Image.
Die Manifestdatei finden Sie unter /usr/share/google/manifest.txt.
Lebenszyklusphasen und Support für Image-Familien
Alle Familien von Advanced Compute Images folgen einem standardisierten Lebenszyklus, um Sicherheit, Stabilität und vorhersehbare Wartungspläne zu gewährleisten. In jeder Phase des Lebenszyklus hat eine Bildfamilie einen der folgenden Supportstatus:
- Unterstützt:
- Das Gerät erhält wichtige Sicherheitsupdates und Fehlerkorrekturen.
- Wird von Cloud Customer Care unterstützt.
- Kann zum Erstellen von Compute-Instanzen verwendet werden.
- Nicht unterstützt:
- Das Gerät erhält keine wichtigen Sicherheitsupdates oder Fehlerkorrekturen mehr.
- Keine neuen Funktionen.
- Wird von Cloud Customer Care nicht unterstützt.
- Kann nicht zum Erstellen von Compute-Instanzen verwendet werden.
Der Lebenszyklus einer Advanced Compute Images-Familie besteht aus vier Phasen:
| Lebenszyklus-Phase | Unterstützt? | Beschreibung und Auswirkungen |
|---|---|---|
| Aktiv | Unterstützt | Für neue Bereitstellungen empfohlen. Die Image-Familie wird ab dem Releasedatum 12 Monate lang vollständig unterstützt. Das Gerät erhält wichtige Sicherheitsupdates und Fehlerkorrekturen. |
| Eingestellt (Datum des End of Support) | Nicht unterstützt | Wir empfehlen, zu einer unterstützten Image-Familie zu migrieren. Ungefähr sechs Monate nach Ende der aktiven Phase wird die Image-Familie eingestellt. Es werden keine neuen Funktionen oder Patches veröffentlicht. In der Cloud de Confiance -Konsole und der Google Cloud CLI werden Warnungen angezeigt, wenn Sie Instanzen erstellen, die diese Image-Familie verwenden. |
| Veraltet | Nicht unterstützt | Nach Ablauf der Phase, in der die Verwendung der Image-Familie eingestellt wird, ist sie nicht mehr verfügbar. Sie können mit dieser Image-Familie keine Compute-Instanzen mehr erstellen. Vorhandene Compute-Instanzen werden weiterhin ausgeführt, es besteht jedoch das Risiko einer Inkompatibilität mit dem Slurm-Controller. |
| Löschen | Nicht unterstützt | Drei Monate nach dem Veralten einer Imagefamilie wird die zugrunde liegende Advanced Compute Images-Bildressource endgültig gelöscht. Vorhandene Compute-Instanzen werden weiterhin ausgeführt, es besteht jedoch das Risiko von Inkompatibilitäten mit dem Slurm-Controller und von Sicherheitslücken. |
Informationen zum genauen Ende des Supports für eine Image-Familie finden Sie unter Unterstützte Hardware und Image-Familien.
Preise
Advanced Compute Images sind ohne zusätzliche Kosten verfügbar. Da Advanced Compute Images in Compute Engine ausgeführt werden, können Gebühren für Compute Engine-Ressourcen wie vCPUs, GPUs, TPUs, Festplatten und Arbeitsspeicher anfallen. Weitere Informationen finden Sie unter Preise für Compute Engine.
Nächste Schritte
- Instanz mit Advanced Compute Images erstellen
So stellen Sie schlüsselfertige Slurm-Cluster-Blueprints mit Advanced Compute Images bereit: