Übersicht über Advanced Compute Images

Für Arbeitslasten aus den Bereichen künstliche Intelligenz (KI), maschinelles Lernen (ML) und Hochleistungs-Computing (HPC) ist es oft erforderlich, ein benutzerdefiniertes Image zu erstellen, das zusätzliche Softwarepakete enthält und für optimale Leistung optimiert ist. Sie können jetzt Advanced Compute Images verwenden, um eine optimierte Umgebung für Ihre KI-/ML- oder HPC-Arbeitslasten einzurichten.

Advanced Compute Images bieten einen standardisierten Imagestack für KI/ML- und HPC-Infrastruktur. Mit diesen Images müssen Sie nicht mehr manuell eigene benutzerdefinierte Images für KI-/ML- und HPC-Arbeitslasten erstellen.

Vorteile

Advanced Compute Images bieten folgende Vorteile:

  • Compute-Instanzen, die standardmäßig für KI-/ML- oder HPC-Arbeitslasten bereit sind: Sie müssen die Leistung nicht manuell optimieren, Instanzneustarts verwalten, Slurm-Agents installieren oder sich über die neuesten Cloud de Confiance Updates für eng gekoppelte KI/ML- oder HPC-Workloads auf dem Laufenden halten.
  • Konstante, reproduzierbare Leistung: Die Bildstandardisierung sorgt für eine konsistente, reproduzierbare Leistung auf Anwendungsebene.

Funktionen von Advanced Compute Images

Advanced Compute-Images enthalten mehrere Konfigurationsebenen zur Unterstützung von KI-/ML- und HPC-Arbeitslasten.

  • Betriebssystemkonfigurationen: Dazu gehören das Deaktivieren automatischer Updates, das Festlegen von HPC-optimierten ulimits, das Anpassen von Kernel-Sysctl-Parametern und das Konfigurieren von Sicherheitseinstellungen wie SELinux.
  • Netzwerkoptimierung: Enthält die erforderlichen Skripts für die Netzwerkoptimierung, z. B. zum Aktivieren des Multi-Queue-Dienstes.
  • Cloud de Confiance by S3NS integration: Installiert und konfiguriert die Google Cloud CLI und den Ops-Agenten.
  • Container-Tools: Installiert und konfiguriert alle containerbezogenen Softwarekomponenten, darunter:
  • NVIDIA: Installiert die folgenden Tools:
  • MPI: Installiert die MPI-Bibliotheken (Message Passing Interface). Installiert Open MPI auf Ubuntu-basierten und Rocky Linux-basierten Images. Bei auf Rocky Linux basierenden Images können Sie die Intel MPI-Bibliothek auch mit einem vorinstallierten Skript installieren und konfigurieren:

    sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
    
  • Slurm: Installiert die erforderlichen Kernkomponenten zum Erstellen eines Slurm-Clusterknotens, einschließlich:

    • Slurm-Binärdateien (Version 25.11)
    • Munge für die Authentifizierung
    • PMIx für die Prozessverwaltung
    • JSON-Webtoken (JWT)-Bibliothek (libjwt)
  • Dateisystemclients: Installiert clientseitige Tools für den Zugriff auf verschiedene Dateisysteme wie Cloud Storage FUSE, NFS-Dienstprogramme (nfs-utils) und den Lustre-Client.

  • Entwicklertools: Installiert gängige Toolchains für die Entwicklung und Fehlerbehebung sowie Dienstprogramme wie:

  • Umgebungsverwaltung: Installiert und konfiguriert Tools zur Umgebungsverwaltung, hauptsächlich Lmod, und richtet die erforderlichen Profilskripts ein, damit der Modulbefehl für Nutzer verfügbar ist.

  • RDMA: Installiert RDMA-Treiber (Remote Direct Memory Access) und -Pakete auf CPU-Images (auf Rocky Linux basierend), darunter:

    • rdma-core und Entwicklungsbibliotheken
    • libfabric
    • perftest
    • kmod-idpf-irdma – Intel Ethernet RDMA-Treiber für unterstützte computing-optimierte Maschinentypen
    • infiniband-diags-, libibverbs- und librdmacm-Dienstprogramme

Unterstützte Hardware- und Image-Familien

ACI unterstützt zwei primäre Hardwareplattformen:

  • CPU (HPC): Unterstützt CPU-Arbeitslasten und hat die folgenden Merkmale:

    • Für rechenintensive Arbeitslasten optimiert
    • Unterstützung von Rocky Linux 9
    • RDMA-Treiber und ‑Dienstprogramme zur Unterstützung von Cloud RDMA
    • Sie enthalten vorintegrierte MPI-Bibliotheken, darunter Open MPI und konfigurierbares Intel MPI.
  • GPU (KI/ML/HPC): Unterstützen GPU-Arbeitslasten und haben die folgenden Merkmale:

    • Sind für NVIDIA-Beschleuniger optimiert
    • Unterstützung von Ubuntu LTS 22.04 und Ubuntu LTS 24.04
    • Mit vorintegrierten CUDA- und NVIDIA-Treibern
    • RDMA-Treiber und ‑Dienstprogramme zur Unterstützung von MRDMA für die GPU-zu-GPU-Kommunikation einschließen
    • Sie eignen sich für KI-, ML- oder HPC-Arbeitslasten.
    • Werden die Standard-Images installiert, wenn Sie Slurm-Cluster-Blueprints für A4X-, A4- und A3-Ultra-Maschinentypen im Cluster Toolkit bereitstellen?
Hardware Betriebssystem Orchestrator Features Architektur Unterstützte Maschinenserien Image-Familie
CPU Rocky Linux 9 Keine
  • RDMA
  • OpenMPI,IntelMPI
AMD x86_64 C2D, H3, H4D aci-cpu-rocky-linux-9-amd64
CPU Rocky Linux 8 Keine
  • RDMA
  • OpenMPI,IntelMPI
AMD x86_64 C2D, H3, H4D aci-cpu-rocky-linux-8-amd64
CPU Rocky Linux 9 Slurm 25.11
  • RDMA
  • MPI
AMD x86_64 C2D, H3, H4D aci-cpu-rocky-linux-9-slurm-2511-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra, A4 aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
Arm64 A4X aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64
GPU Ubuntu LTS 24.04 Slurm 26.05
  • CUDA 13.2
  • NVIDIA 595
AMD x86_64 A3 Ultra, A4 aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64
GPU Ubuntu LTS 24.04 Slurm 26.05
  • CUDA 13.2
  • NVIDIA 595
Arm64 A4X aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64
GPU Ubuntu LTS 24.04 Keine
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra, A4 aci-gpu-u2404-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 22.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra, A4 aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 22.04 Keine
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra, A4 aci-gpu-u2204-cuda-130-nvidia-580-amd64

Vorinstallierte Pakete (oder RPMs)

Advanced Compute-Images enthalten eine Vielzahl von vorinstallierten Tools, Bibliotheken, Treibern und Paketen. Eine Liste der für ein Image installierten Komponenten finden Sie in der Manifestdatei für dieses Image.

Die Manifestdatei finden Sie unter /usr/share/google/manifest.txt.

Lebenszyklusphasen und Support für Image-Familien

Alle Familien von Advanced Compute Images folgen einem standardisierten Lebenszyklus, um Sicherheit, Stabilität und vorhersehbare Wartungspläne zu gewährleisten. In jeder Phase des Lebenszyklus hat eine Bildfamilie einen der folgenden Supportstatus:

  • Unterstützt:
    • Das Gerät erhält wichtige Sicherheitsupdates und Fehlerkorrekturen.
    • Wird von Cloud Customer Care unterstützt.
    • Kann zum Erstellen von Compute-Instanzen verwendet werden.
  • Nicht unterstützt:
    • Das Gerät erhält keine wichtigen Sicherheitsupdates oder Fehlerkorrekturen mehr.
    • Keine neuen Funktionen.
    • Wird von Cloud Customer Care nicht unterstützt.
    • Kann nicht zum Erstellen von Compute-Instanzen verwendet werden.

Der Lebenszyklus einer Advanced Compute Images-Familie besteht aus vier Phasen:

Lebenszyklus-Phase Unterstützt? Beschreibung und Auswirkungen
Aktiv Unterstützt Für neue Bereitstellungen empfohlen. Die Image-Familie wird ab dem Releasedatum 12 Monate lang vollständig unterstützt. Das Gerät erhält wichtige Sicherheitsupdates und Fehlerkorrekturen.
Eingestellt (Datum des End of Support) Nicht unterstützt Wir empfehlen, zu einer unterstützten Image-Familie zu migrieren. Ungefähr sechs Monate nach Ende der aktiven Phase wird die Image-Familie eingestellt. Es werden keine neuen Funktionen oder Patches veröffentlicht. In der Cloud de Confiance -Konsole und der Google Cloud CLI werden Warnungen angezeigt, wenn Sie Instanzen erstellen, die diese Image-Familie verwenden.
Veraltet Nicht unterstützt Nach Ablauf der Phase, in der die Verwendung der Image-Familie eingestellt wird, ist sie nicht mehr verfügbar. Sie können mit dieser Image-Familie keine Compute-Instanzen mehr erstellen. Vorhandene Compute-Instanzen werden weiterhin ausgeführt, es besteht jedoch das Risiko einer Inkompatibilität mit dem Slurm-Controller.
Löschen Nicht unterstützt Drei Monate nach dem Veralten einer Imagefamilie wird die zugrunde liegende Advanced Compute Images-Bildressource endgültig gelöscht. Vorhandene Compute-Instanzen werden weiterhin ausgeführt, es besteht jedoch das Risiko von Inkompatibilitäten mit dem Slurm-Controller und von Sicherheitslücken.

Informationen zum genauen Ende des Supports für eine Image-Familie finden Sie unter Unterstützte Hardware und Image-Familien.

Preise

Advanced Compute Images sind ohne zusätzliche Kosten verfügbar. Da Advanced Compute Images in Compute Engine ausgeführt werden, können Gebühren für Compute Engine-Ressourcen wie vCPUs, GPUs, TPUs, Festplatten und Arbeitsspeicher anfallen. Weitere Informationen finden Sie unter Preise für Compute Engine.

Nächste Schritte