Esegui il deployment dei carichi di lavoro GPU in Autopilot

Puoi richiedere GPU per accelerare le attività nei tuoi workload Autopilot di Google Kubernetes Engine (GKE). Questo documento descrive come eseguire le GPU in Autopilot, impostare le richieste e i limiti delle risorse dei pod e monitorare i carichi di lavoro delle GPU.

Questo documento è destinato agli amministratori e agli operatori della piattaforma e agli specialisti di dati e AI che vogliono richiedere GPU per i workload che eseguono attività come l'addestramento o l'inferenza del machine learning (ML). Per scoprire di più sui ruoli, sulle responsabilità e sulle attività di esempio comuni a cui facciamo riferimento nei Cloud de Confiance contenuti, consulta Ruoli e attività comuni degli utenti GKE.

Prima di procedere, assicurati di avere familiarità con i seguenti concetti:

Puoi richiedere GPU utilizzando ComputeClasses o i selettori di nodi nella specifica del pod. GKE posiziona questi pod sui nodi che hanno queste GPU. Puoi anche utilizzare le funzionalità di condivisione della GPU, come la condivisione del tempo.

Prezzi

Il modello di fatturazione basato sui nodi di Autopilot si applica ai pod GPU. Sia il premium di gestione di Autopilot per i nodi sia l'hardware GPU effettivo in Compute Engine sono idonei per gli sconti per impegno di utilizzo (CUD) flessibili di Compute.

Tieni presente le seguenti considerazioni sui prezzi per le GPU Autopilot:

  • Tutti i nodi GPU A100 (80 GB) utilizzano SSD locali per i dischi di avvio dei nodi con dimensioni fisse in base al numero di GPU. Le unità SSD locali allegate vengono fatturate separatamente. Questi prezzi non si applicano alle GPU A100 (40 GB).
  • I prezzi di GKE Sandbox sono gli stessi dei prezzi predefiniti di Autopilot. Per scoprire di più sul sandboxing dei workload dell'acceleratore, consulta GKE Sandbox e Guida introduttiva a GKE Sandbox.
  • Se utilizzi le GPU NVIDIA RTX PRO 6000 (serie di macchine G4) con la modalità Autopilot, a partire dal 1° ottobre 2026, GKE addebita il premium per la gestione dei nodi Autopilot, oltre agli addebiti applicabili esistenti per l'hardware sottostante. Questi addebiti esistenti continuano a essere applicati sia prima che dopo questa data. Per ulteriori informazioni su come funziona la fatturazione quando si richiede hardware specifico con i workload Autopilot, consulta Workload Autopilot che selezionano hardware specifico.

Prima di iniziare

Prima di iniziare, assicurati di aver eseguito le seguenti operazioni:

  • Abilita l'API Google Kubernetes Engine.
  • Abilita l'API Google Kubernetes Engine
  • Per utilizzare Google Cloud CLI per questa attività, installala e poi inizializza gcloud CLI. Se hai già installato gcloud CLI, scarica l'ultima versione eseguendo il comando gcloud components update. Le versioni precedenti di gcloud CLI potrebbero non supportare l'esecuzione dei comandi in questo documento.
  • Assicurati di avere un cluster GKE Autopilot che esegue una delle seguenti versioni per utilizzare le seguenti GPU o funzionalità:

    • GPU NVIDIA B200 (180 GB): 1.32.2-gke.1422000 o versioni successive
    • GPU NVIDIA RTX PRO 6000:
      • Tipi di macchine con una o più GPU: 1.34.1-gke.1829001 o versioni successive
      • Tipi di macchine con meno di una GPU: 1.35.2-gke.1485000 o versioni successive

    Tutti gli altri tipi di GPU sono supportati in tutte le versioni di GKE disponibili.

Limitazioni

  • La disponibilità delle GPU dipende dalla Cloud de Confiance by S3NS regione del cluster Autopilot e dalla quota di GPU. Per trovare un modello di GPU per regione o zona, consulta la sezione Disponibilità delle GPU per regioni e zone.
  • Per le GPU NVIDIA A100 (80 GB), ti viene addebitato un prezzo fisso per le unità SSD locali collegate ai nodi, indipendentemente dal fatto che i tuoi pod utilizzino o meno questa capacità.
  • Se vuoi che più pod GPU rientrino in un singolo nodo, la somma delle richieste di GPU per questi pod deve essere inferiore o uguale a il numero di risorse GPU collegate a quel nodo. Ad esempio, un nodo con un gke-accelerator-count di 4 potrebbe ospitare fino a quattro pod che richiedono una GPU ciascuno.

Il posizionamento di più pod su un singolo nodo GPU è utile in situazioni come le seguenti:

  • Hai prenotazioni di capacità per tipi di macchine Accelerator di grandi dimensioni ed esegui workload con una singola GPU, quindi il deployment di un pod per nodo sprecherebbe le altre GPU su quella macchina
  • Hai carichi di lavoro GPU che devono essere eseguiti sullo stesso host

In queste situazioni, ti consigliamo di utilizzare tutte le GPU sul nodo assicurandoti che la somma delle richieste di risorse GPU del pod sul nodo sia uguale al numero di GPU collegate al nodo.

Richiedere GPU nei container

Per richiedere risorse GPU per i tuoi container, aggiungi i seguenti campi alla specifica del pod. A seconda dei requisiti del workload, puoi omettere facoltativamente il selettore cloud.google.com/gke-accelerator-count.

apiVersion: v1
kind: Pod
metadata:
  name: my-gpu-pod
spec:
  # Optional: Use GKE Sandbox
  # runtimeClassName: gvisor
  nodeSelector:
    cloud.google.com/gke-accelerator: GPU_TYPE
    cloud.google.com/gke-accelerator-count: "GPU_COUNT"
  containers:
  - name: my-gpu-container
    image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
    command: ["/bin/bash", "-c", "--"]
    args: ["while true; do sleep 600; done;"]
    resources:
      limits:
        nvidia.com/gpu: GPU_QUANTITY

Sostituisci quanto segue:

  • GPU_TYPE: il tipo di hardware GPU. I valori consentiti sono i seguenti:

    • nvidia-gb200: NVIDIA GB200 (anteprima)
    • nvidia-b200: NVIDIA B200 (180GB)
    • nvidia-h200-141gb: NVIDIA H200 (141GB)
    • nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)
    • nvidia-h100-80gb: NVIDIA H100 (80GB)
    • nvidia-a100-80gb: NVIDIA A100 (80GB)
    • nvidia-tesla-a100: NVIDIA A100 (40GB)
    • nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000
    • nvidia-l4: NVIDIA L4
    • nvidia-tesla-t4: NVIDIA T4
    oppure, se utilizzi GKE Sandbox, uno dei seguenti:
    • nvidia-gb200: NVIDIA GB200 (anteprima)
    • nvidia-b200: NVIDIA B200 (180 GB) (anteprima)
    • nvidia-h200-141gb: NVIDIA H200 (141 GB) (anteprima)
    • nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)
    • nvidia-h100-80gb: NVIDIA H100 (80GB)
    • nvidia-a100-80gb: NVIDIA A100 (80GB)
    • nvidia-tesla-a100: NVIDIA A100 (40GB)
    • nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000 (anteprima) (ad eccezione dei tipi di macchine G4 che hanno meno di una GPU)
    • nvidia-l4: NVIDIA L4
    • nvidia-tesla-t4: NVIDIA T4
    Per saperne di più, consulta Supporto dei modelli di GPU.

  • GPU_COUNT: il numero totale di GPU disponibili da collegare al nodo. Deve essere maggiore o uguale a GPU_QUANTITY e una quantità di GPU supportata per il tipo di GPU selezionato. Se ometti questo nodeSelector, Autopilot posiziona un pod su ogni nodo GPU.

  • GPU_QUANTITY: il numero di GPU da allocare al container. Deve essere minore o uguale a GPU_COUNT e a una quantità di GPU supportata per il tipo di GPU selezionato.

  • Facoltativo runtimeClassname: gvisor: l'impostazione che consente di eseguire questo pod in GKE Sandbox. Per utilizzarla, rimuovi il commento da questa riga. Per saperne di più, consulta Sandbox GKE.

Devi specificare sia il tipo di GPU sia la quantità di GPU nella specifica del pod. Se ometti uno di questi valori, Autopilot rifiuta il pod.

Quando esegui il deployment di questo manifest, Autopilot installa automaticamente i driver NVIDIA predefiniti per la versione GKE del nodo. Se vuoi, puoi scegliere di installare l'ultima versione del driver per quella versione di GKE aggiungendo il seguente selettore di nodi al tuo manifest:

spec:
  nodeSelector:
    cloud.google.com/gke-gpu-driver-version: "DRIVER_VERSION"

Sostituisci DRIVER_VERSION con uno dei seguenti valori:

  • default: il driver stabile predefinito per la versione GKE del nodo. Se ometti nodeSelector nel manifest, questa è l'opzione predefinita.
  • latest: l'ultima versione del driver disponibile per la versione GKE del nodo.

Richiedere CPU e memoria per i pod GPU Autopilot

Quando definisci i pod GPU, devi anche richiedere risorse di CPU e memoria in modo che i container funzionino come previsto. Autopilot applica valori minimi, massimi e predefiniti specifici per CPU e memoria in base al tipo e alla quantità di GPU. Se esegui più pod GPU su un singolo nodo, specifica la CPU e la memoria, altrimenti il valore predefinito è l'intera capacità del nodo. Per maggiori dettagli, consulta Richieste di risorse in Autopilot.

La specifica del pod dovrebbe essere simile al seguente esempio, che richiede quattro GPU T4:

apiVersion: v1
kind: Pod
metadata:
  name: t4-pod
spec:
  # Optional: Use GKE Sandbox
  # runtimeClassName: gvisor
  nodeSelector:
    cloud.google.com/gke-accelerator: "nvidia-tesla-t4"
  containers:
  - name: t4-container-1
    image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
    command: ["/bin/bash", "-c", "--"]
    args: ["while true; do sleep 600; done;"]
    resources:
      limits:
        nvidia.com/gpu: 3
        cpu: "54"
        memory: "54Gi"
      requests:
        cpu: "54"
        memory: "54Gi"
  - name: t4-container-2
    image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
    command: ["/bin/bash", "-c", "--"]
    args: ["while true; do sleep 600; done;"]
    resources:
      limits:
        nvidia.com/gpu: 1
        cpu: "18"
        memory: "18Gi"
      requests:
        cpu: "18"
        memory: "18Gi"
  • Facoltativo runtimeClassname: gvisor: l'impostazione che consente di eseguire questo pod in GKE Sandbox. Per utilizzarla, rimuovi il commento da questa riga. Per saperne di più, consulta Sandbox GKE.

Questo manifest specifica limits per le risorse di CPU e memoria. Se ometti limits per CPU o memoria, GKE assegna ai pod la classe QoS Burstable e consente ai pod di utilizzare le risorse inutilizzate dalla somma delle richieste di risorse sul nodo. Per saperne di più, consulta Configurare il bursting dei pod in GKE.

Richiedere lo spazio di archiviazione temporanea per i pod GPU Autopilot

Puoi anche richiedere l'archiviazione temporanea nei pod che necessitano di un'archiviazione di breve durata. Lo spazio di archiviazione temporaneo massimo disponibile e il tipo di hardware di archiviazione utilizzato dipendono dal tipo e dalla quantità di GPU richieste dal pod. Puoi utilizzare l'SSD locale per l'archiviazione temporanea con le seguenti configurazioni:

  • Utilizza le GPU NVIDIA RTX PRO 6000 ed esegui una versione patch di GKE che soddisfi i requisiti di versione elencati nella sezione Prima di iniziare. La configurazione frazionaria di un ottavo di GPU non supporta l'archiviazione temporanea.
  • Utilizza le GPU NVIDIA L4.

Per utilizzare l'SSD locale per l'archiviazione temporanea, aggiungi cloud.google.com/gke-ephemeral-storage-local-ssd: "true" nodeSelector al manifest del carico di lavoro. Consulta il manifest di esempio in Utilizza l'archiviazione temporanea supportata da SSD locali con i cluster Autopilot. Le GPU NVIDIA H100 (80 GB) e NVIDIA A100 (80 GB) utilizzano sempre SSD locali per lo spazio di archiviazione temporaneo e non puoi specificare questo selettore di nodi per queste GPU.

Richiedi tipi di macchine specifici utilizzando ComputeClass personalizzate

In alcuni casi, potrebbe essere necessario eseguire il workload GPU su un tipo di macchina specifico, ad esempio se il tipo di macchina che vuoi non è un tipo di macchina predefinito per i cluster Autopilot. Puoi richiedere esplicitamente una macchina specifica utilizzando ComputeClass personalizzate, che ti consentono di definire un profilo di configurazione del nodo che specifica il tipo di macchina e la GPU. Per utilizzare i tipi di macchine G4 con meno di una GPU, devi seguire le istruzioni nella sezione successiva per richiedere esplicitamente un tipo di macchina.

Per informazioni generali su ComputeClasses, consulta Informazioni su ComputeClasses personalizzate.

Per richiedere un tipo di macchina specifico per il tuo workload GPU, completa i seguenti passaggi:

  1. Crea un manifest per una classe ComputeClass personalizzata. Per questo esempio, salva quanto segue come a3-computeclass.yaml:

    apiVersion: cloud.google.com/v1
    kind: ComputeClass
    metadata:
      name: a3-edge-gpu
    spec:
      priorities:
      - machineType: a3-edgegpu-8g-nolssd
        gpu:
         count: 8
         type: nvidia-h100-80gb
      nodePoolAutoCreation:
        enabled: true
    

    In questo manifest:

    • metadata.name è il nome della ComputeClass personalizzata, a cui farai riferimento nella specifica del pod.
    • machineType è la macchina specifica di cui eseguire il provisioning.
    • I campi gpu specificano il tipo e il numero di GPU collegate alla macchina. I valori di questi campi devono corrispondere alle funzionalità di machineType specificato.
  2. Applica il manifest eseguendo questo comando:

    kubectl apply -f a3-computeclass.yaml
    
  3. Nel manifest del pod, richiedi ComputeClass utilizzando il selettore di nodi cloud.google.com/compute-class:

    apiVersion: v1
    kind: Pod
    metadata:
      name: gpu-cc-pod
    spec:
      nodeSelector:
        cloud.google.com/compute-class: a3-edge-gpu
      containers:
      - name: my-gpu-container
        image: nvidia/cuda:latest
        command: ["/bin/bash", "-c", "--"]
        args: ["while true; do sleep 600; done;"]
        resources:
          limits:
            nvidia.com/gpu: 1
    

    GKE esegue il provisioning di un nuovo nodo che corrisponde alla definizione in a3-edge-gpu ComputeClass per eseguire il pod.

Richiedi tipi di macchine G4 con meno di una GPU

I tipi di macchine G4 utilizzano la GPU NVIDIA RTX PRO 6000. Per richiedere tipi di macchina G4 con meno di una GPU, devi seguire le istruzioni della sezione precedente, impostando i seguenti campi:

  • machineType a uno dei seguenti valori:

    • g4-standard-6 (un ottavo di GPU)
    • g4-standard-12 (un quarto di GPU)
    • g4-standard-24 (metà di una GPU)
  • gpu.count: 1

  • gpu.type: nvidia-rtx-pro-6000

Verifica l'allocazione delle GPU di cui è stato eseguito il deployment

Per verificare che un workload GPU di cui è stato eseguito il deployment disponga delle GPU richieste, esegui questo comando:

kubectl describe node NODE_NAME

Sostituisci NODE_NAME con il nome del nodo su cui è stato pianificato il pod.

L'output è simile al seguente:


apiVersion: v1
kind: Node
metadata:
...
  labels:
    ...
    cloud.google.com/gke-accelerator: nvidia-tesla-t4
    cloud.google.com/gke-accelerator-count: "1"
    cloud.google.com/machine-family: custom-48
    ...
...

Controlla la versione del driver GPU

Nei cluster Autopilot, GKE installa automaticamente i driver di dispositivo NVIDIA su tutti i nodi GPU. Per trovare la versione del driver installata da GKE nel tuo cluster, esegui questo comando:

kubectl logs --selector=k8s-app=nvidia-gpu-device-plugin \
    --container="nvidia-gpu-device-plugin" \
    --tail=-1 \
    --namespace=kube-system | grep Driver

L'output è simile al seguente:

I1206 18:37:08.251742    5851 metrics.go:144] nvml initialized successfully. Driver version: 535.104.12

Come funziona l'allocazione delle GPU in Autopilot

Dopo aver richiesto un tipo di GPU e una quantità per i container in un pod e aver eseguito il deployment del pod, si verifica quanto segue:

  1. Se non esiste un nodo GPU allocabile, Autopilot esegue il provisioning di un nuovo nodo GPU per pianificare il pod. Autopilot installa automaticamente i driver NVIDIA per facilitare l'hardware.
  2. Autopilot aggiunge taint dei nodi al nodo GPU e aggiunge le tolleranze corrispondenti al pod. In questo modo, GKE non pianifica altri pod sul nodo GPU.

Autopilot inserisce esattamente un pod GPU su ogni nodo GPU, nonché tutti i carichi di lavoro gestiti da GKE che vengono eseguiti su tutti i nodi e tutti i DaemonSet che configuri in modo da tollerare tutti i taint dei nodi.

Esegui DaemonSet su ogni nodo

Potresti voler eseguire DaemonSet su ogni nodo, anche su quelli a cui sono state applicate incompatibilità. Ad esempio, alcuni agenti di logging e monitoraggio devono essere eseguiti su ogni nodo del cluster. Puoi configurare questi DaemonSet in modo che ignorino le incompatibilità dei nodi, in modo che GKE posizioni i workload su ogni nodo.

Per eseguire DaemonSet su ogni nodo del cluster, inclusi i nodi GPU, aggiungi la seguente tolleranza alla specifica:

apiVersion: apps/v1
kind: DaemonSet
metadata:
  name: logging-agent
spec:
  tolerations:
  - key: ""
    operator: "Exists"
    effect: ""
  containers:
  - name: logging-agent-v1
    image: IMAGE_PATH

Sostituisci IMAGE_PATH con il percorso dell'immagine container.

Per eseguire DaemonSet su nodi GPU specifici nel cluster, aggiungi quanto segue alla specifica:

apiVersion: apps/v1
kind: DaemonSet
metadata:
  name: logging-agent
spec:
  nodeSelector:
    cloud.google.com/gke-accelerator: "GPU_TYPE"
  tolerations:
  - key: ""
    operator: "Exists"
    effect: ""
  containers:
  - name: logging-agent-v1
    image: IMAGE_PATH

Sostituisci GPU_TYPE con il tipo di GPU nei nodi di destinazione. Può essere uno dei seguenti:

  • nvidia-gb200: NVIDIA GB200 (anteprima)
  • nvidia-b200: NVIDIA B200 (180GB)
  • nvidia-h200-141gb: NVIDIA H200 (141GB)
  • nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)
  • nvidia-h100-80gb: NVIDIA H100 (80GB)
  • nvidia-a100-80gb: NVIDIA A100 (80GB)
  • nvidia-tesla-a100: NVIDIA A100 (40GB)
  • nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000
  • nvidia-l4: NVIDIA L4
  • nvidia-tesla-t4: NVIDIA T4
o se utilizzi GKE Sandbox, uno dei seguenti:

  • nvidia-gb200: NVIDIA GB200 (anteprima)
  • nvidia-b200: NVIDIA B200 (180 GB) (anteprima)
  • nvidia-h200-141gb: NVIDIA H200 (141 GB) (anteprima)
  • nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)
  • nvidia-h100-80gb: NVIDIA H100 (80GB)
  • nvidia-a100-80gb: NVIDIA A100 (80GB)
  • nvidia-tesla-a100: NVIDIA A100 (40GB)
  • nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000 (anteprima) (ad eccezione dei tipi di macchine G4 che hanno meno di una GPU)
  • nvidia-l4: NVIDIA L4
  • nvidia-tesla-t4: NVIDIA T4
Per saperne di più, consulta Supporto dei modelli di GPU.

Casi d'uso delle GPU in Autopilot

Puoi allocare GPU ai container nei pod Autopilot per facilitare carichi di lavoro come i seguenti:

  • Inferenza di machine learning (ML)
  • Addestramento ML
  • Rendering

Quantità di GPU supportate

Quando richiedi GPU nella specifica del pod, devi utilizzare le seguenti quantità in base al tipo di GPU. Se richiedi una quantità di GPU non supportata per quel tipo, Autopilot rifiuta il pod.

Quantità di GPU
NVIDIA B200 (180GB)
nvidia-b200
8
NVIDIA H200 (141GB)
nvidia-h200-141gb
8
NVIDIA H100 Mega (80GB)
nvidia-h100-mega-80gb
8
NVIDIA H100 (80GB)
nvidia-h100-80gb
1, 2, 4, 8
NVIDIA A100 (80GB)
nvidia-a100-80gb
1, 2, 4, 8
NVIDIA A100 (40GB)
nvidia-tesla-a100
1, 2, 4, 8, 16
NVIDIA RTX PRO 6000
nvidia-rtx-pro-6000
1/8, 1/4, 1/2, 1, 2, 4, 8
NVIDIA L4
nvidia-l4
1, 2, 4, 8
NVIDIA T4
nvidia-tesla-t4
1, 2, 4

Monitora le prestazioni del carico di lavoro del nodo GPU

Se nel tuo cluster GKE sono abilitate le metriche di sistema, in Cloud Monitoring sono disponibili le seguenti metriche per monitorare le prestazioni del workload della GPU:

  • Ciclo di lavoro (container/accelerator/duty_cycle): percentuale di tempo nell'ultimo periodo di campionamento (10 secondi) durante il quale l'acceleratore ha eseguito attivamente l'elaborazione. Tra 1 e 100.
  • Utilizzo della memoria (container/accelerator/memory_used): quantità di memoria dell'acceleratore allocata in byte.
  • Capacità di memoria (container/accelerator/memory_total): memoria totale dell'acceleratore in byte.

Queste metriche si applicano a livello di container (container/accelerator) e non vengono raccolte per i container pianificati su una GPU che utilizza la condivisione del tempo della GPU o NVIDIA MPS.

Puoi utilizzare dashboard predefinite per monitorare i cluster con nodi GPU. Per saperne di più, vedi Visualizzare le metriche di osservabilità. Per informazioni generali sul monitoraggio dei cluster e delle relative risorse, consulta Osservabilità per GKE.

Visualizzare le metriche di utilizzo per i workload

Puoi visualizzare le metriche di utilizzo della GPU del workload dalla dashboard Workload nella console Cloud de Confiance .

Per visualizzare l'utilizzo della GPU del workload, segui questi passaggi:

  1. Vai alla pagina Workload nella console Cloud de Confiance .

    Vai a Carichi di lavoro
  2. Seleziona un workload.

La dashboard Workloads mostra grafici relativi alla memoria utilizzata e alla capacità della GPU e al ciclo di lavoro della GPU.

Visualizza le metriche di NVIDIA Data Center GPU Manager (DCGM)

Puoi raccogliere e visualizzare le metriche NVIDIA DCGM utilizzando Google Cloud Managed Service per Prometheus. Per i cluster Autopilot, GKE installa i driver. Per i cluster Standard, devi installare i driver NVIDIA.

Per istruzioni su come eseguire il deployment del pacchetto DCGM gestito da GKE, consulta Raccogliere e visualizzare le metriche di NVIDIA Data Center GPU Manager (DCGM).

Metriche di integrità di JobSet e dei nodi per i workload GPU

Oltre alle metriche DCGM, puoi utilizzare le seguenti metriche per monitorare l'integrità e le prestazioni dei tuoi carichi di lavoro GPU, soprattutto quando li esegui come JobSet.

Metriche JobSet

Le seguenti metriche si applicano sia ai JobSet GPU che TPU con un singolo job replicato:

  • kubernetes.io/jobset/times_between_interruptions
  • kubernetes.io/jobset/times_to_recover
  • kubernetes.io/jobset/uptime

Per ulteriori informazioni su queste metriche di sistema, consulta Metriche Kubernetes.

Puoi anche utilizzare la dashboard JobSet nella console Cloud de Confiance per visualizzare e monitorare i tuoi workload GPU:

Vai a Deployment

Metriche di integrità dei nodi

Le seguenti metriche a livello di nodo si applicano a tutti i nodi, inclusi quelli con GPU:

  • kubernetes.io/node/status_condition: questa metrica richiede GKE versione 1.32.1-gke.1357001 o successive.

Le metriche di interruzione dei nodi e dei pool di nodi si applicano anche ai nodi non TPU.

Kube-state-metrics per JobSet

kube-state-metrics per JobSet può essere utilizzato con le GPU. La raccolta di queste metriche richiede GKE versione 1.32.1-gke.1357001 o versioni successive. Per saperne di più, consulta la documentazione sulle metriche JobSet.

Passaggi successivi