Puoi richiedere GPU per accelerare le attività nei tuoi workload Autopilot di Google Kubernetes Engine (GKE). Questo documento descrive come eseguire le GPU in Autopilot, impostare le richieste e i limiti delle risorse dei pod e monitorare i carichi di lavoro delle GPU.
Questo documento è destinato agli amministratori e agli operatori della piattaforma e agli specialisti di dati e AI che vogliono richiedere GPU per i workload che eseguono attività come l'addestramento o l'inferenza del machine learning (ML). Per scoprire di più sui ruoli, sulle responsabilità e sulle attività di esempio comuni a cui facciamo riferimento nei Cloud de Confiance contenuti, consulta Ruoli e attività comuni degli utenti GKE.
Prima di procedere, assicurati di avere familiarità con i seguenti concetti:
Puoi richiedere GPU utilizzando ComputeClasses o i selettori di nodi nella specifica del pod. GKE posiziona questi pod sui nodi che hanno queste GPU. Puoi anche utilizzare le funzionalità di condivisione della GPU, come la condivisione del tempo.
Prezzi
Il modello di fatturazione basato sui nodi di Autopilot si applica ai pod GPU. Sia il premium di gestione di Autopilot per i nodi sia l'hardware GPU effettivo in Compute Engine sono idonei per gli sconti per impegno di utilizzo (CUD) flessibili di Compute.
Tieni presente le seguenti considerazioni sui prezzi per le GPU Autopilot:
- Tutti i nodi GPU A100 (80 GB) utilizzano SSD locali per i dischi di avvio dei nodi con dimensioni fisse in base al numero di GPU. Le unità SSD locali allegate vengono fatturate separatamente. Questi prezzi non si applicano alle GPU A100 (40 GB).
- I prezzi di GKE Sandbox sono gli stessi dei prezzi predefiniti di Autopilot. Per scoprire di più sul sandboxing dei workload dell'acceleratore, consulta GKE Sandbox e Guida introduttiva a GKE Sandbox.
- Se utilizzi le GPU NVIDIA RTX PRO 6000 (serie di macchine G4) con la modalità Autopilot, a partire dal 1° ottobre 2026, GKE addebita il premium per la gestione dei nodi Autopilot, oltre agli addebiti applicabili esistenti per l'hardware sottostante. Questi addebiti esistenti continuano a essere applicati sia prima che dopo questa data. Per ulteriori informazioni su come funziona la fatturazione quando si richiede hardware specifico con i workload Autopilot, consulta Workload Autopilot che selezionano hardware specifico.
Prima di iniziare
Prima di iniziare, assicurati di aver eseguito le seguenti operazioni:
- Abilita l'API Google Kubernetes Engine. Abilita l'API Google Kubernetes Engine
- Per utilizzare Google Cloud CLI per questa attività,
installala e poi
inizializza
gcloud CLI. Se hai già installato gcloud CLI, scarica l'ultima
versione eseguendo il comando
gcloud components update. Le versioni precedenti di gcloud CLI potrebbero non supportare l'esecuzione dei comandi in questo documento.
Assicurati di avere un cluster GKE Autopilot che esegue una delle seguenti versioni per utilizzare le seguenti GPU o funzionalità:
- GPU NVIDIA B200 (180 GB): 1.32.2-gke.1422000 o versioni successive
- GPU NVIDIA RTX PRO 6000:
- Tipi di macchine con una o più GPU: 1.34.1-gke.1829001 o versioni successive
- Tipi di macchine con meno di una GPU: 1.35.2-gke.1485000 o versioni successive
Tutti gli altri tipi di GPU sono supportati in tutte le versioni di GKE disponibili.
- Assicurati di disporre di quote GPU sufficienti nel tuo progetto. Devi disporre di una quota GPU di Compute Engine sufficiente per i modelli di GPU che vuoi creare in ogni regione. Se hai bisogno di una quota di GPU aggiuntiva, richiedi un aggiustamento della quota.
Se vuoi utilizzare i tipi di macchina G4 con meno di una GPU NVIDIA RTX PRO 6000, devi eseguire le seguenti operazioni, oltre a rispettare i requisiti di versione menzionati:
- Richiedi esplicitamente i tipi di macchina G4 con meno di una GPU.
- Se il tuo cluster esegue versioni di GKE precedenti alla 1.36, prepara i tuoi workload.
Limitazioni
- La disponibilità delle GPU dipende dalla Cloud de Confiance by S3NS regione del cluster Autopilot e dalla quota di GPU. Per trovare un modello di GPU per regione o zona, consulta la sezione Disponibilità delle GPU per regioni e zone.
- Per le GPU NVIDIA A100 (80 GB), ti viene addebitato un prezzo fisso per le unità SSD locali collegate ai nodi, indipendentemente dal fatto che i tuoi pod utilizzino o meno questa capacità.
- Se vuoi che più pod GPU rientrino in un singolo nodo, la somma delle richieste di GPU per questi pod deve essere inferiore o uguale a il numero di risorse GPU collegate a quel nodo. Ad esempio, un nodo con un
gke-accelerator-countdi 4 potrebbe ospitare fino a quattro pod che richiedono una GPU ciascuno.
Il posizionamento di più pod su un singolo nodo GPU è utile in situazioni come le seguenti:
- Hai prenotazioni di capacità per tipi di macchine Accelerator di grandi dimensioni ed esegui workload con una singola GPU, quindi il deployment di un pod per nodo sprecherebbe le altre GPU su quella macchina
- Hai carichi di lavoro GPU che devono essere eseguiti sullo stesso host
In queste situazioni, ti consigliamo di utilizzare tutte le GPU sul nodo assicurandoti che la somma delle richieste di risorse GPU del pod sul nodo sia uguale al numero di GPU collegate al nodo.
Richiedere GPU nei container
Per richiedere risorse GPU per i tuoi container, aggiungi i seguenti campi alla specifica del pod.
A seconda dei requisiti del workload, puoi omettere facoltativamente il selettore cloud.google.com/gke-accelerator-count.
apiVersion: v1
kind: Pod
metadata:
name: my-gpu-pod
spec:
# Optional: Use GKE Sandbox
# runtimeClassName: gvisor
nodeSelector:
cloud.google.com/gke-accelerator: GPU_TYPE
cloud.google.com/gke-accelerator-count: "GPU_COUNT"
containers:
- name: my-gpu-container
image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
command: ["/bin/bash", "-c", "--"]
args: ["while true; do sleep 600; done;"]
resources:
limits:
nvidia.com/gpu: GPU_QUANTITY
Sostituisci quanto segue:
GPU_TYPE: il tipo di hardware GPU. I valori consentiti sono i seguenti:nvidia-gb200: NVIDIA GB200 (anteprima)nvidia-b200: NVIDIA B200 (180GB)nvidia-h200-141gb: NVIDIA H200 (141GB)nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)nvidia-h100-80gb: NVIDIA H100 (80GB)nvidia-a100-80gb: NVIDIA A100 (80GB)nvidia-tesla-a100: NVIDIA A100 (40GB)nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000nvidia-l4: NVIDIA L4nvidia-tesla-t4: NVIDIA T4
nvidia-gb200: NVIDIA GB200 (anteprima)nvidia-b200: NVIDIA B200 (180 GB) (anteprima)nvidia-h200-141gb: NVIDIA H200 (141 GB) (anteprima)nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)nvidia-h100-80gb: NVIDIA H100 (80GB)nvidia-a100-80gb: NVIDIA A100 (80GB)nvidia-tesla-a100: NVIDIA A100 (40GB)nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000 (anteprima) (ad eccezione dei tipi di macchine G4 che hanno meno di una GPU)nvidia-l4: NVIDIA L4nvidia-tesla-t4: NVIDIA T4
GPU_COUNT: il numero totale di GPU disponibili da collegare al nodo. Deve essere maggiore o uguale aGPU_QUANTITYe una quantità di GPU supportata per il tipo di GPU selezionato. Se ometti questo nodeSelector, Autopilot posiziona un pod su ogni nodo GPU.GPU_QUANTITY: il numero di GPU da allocare al container. Deve essere minore o uguale aGPU_COUNTe a una quantità di GPU supportata per il tipo di GPU selezionato.Facoltativo
runtimeClassname: gvisor: l'impostazione che consente di eseguire questo pod in GKE Sandbox. Per utilizzarla, rimuovi il commento da questa riga. Per saperne di più, consulta Sandbox GKE.
Devi specificare sia il tipo di GPU sia la quantità di GPU nella specifica del pod. Se ometti uno di questi valori, Autopilot rifiuta il pod.
Quando esegui il deployment di questo manifest, Autopilot installa automaticamente i driver NVIDIA predefiniti per la versione GKE del nodo. Se vuoi, puoi scegliere di installare l'ultima versione del driver per quella versione di GKE aggiungendo il seguente selettore di nodi al tuo manifest:
spec:
nodeSelector:
cloud.google.com/gke-gpu-driver-version: "DRIVER_VERSION"
Sostituisci DRIVER_VERSION con uno dei seguenti valori:
default: il driver stabile predefinito per la versione GKE del nodo. Se ometti nodeSelector nel manifest, questa è l'opzione predefinita.latest: l'ultima versione del driver disponibile per la versione GKE del nodo.
Richiedere CPU e memoria per i pod GPU Autopilot
Quando definisci i pod GPU, devi anche richiedere risorse di CPU e memoria in modo che i container funzionino come previsto. Autopilot applica valori minimi, massimi e predefiniti specifici per CPU e memoria in base al tipo e alla quantità di GPU. Se esegui più pod GPU su un singolo nodo, specifica la CPU e la memoria, altrimenti il valore predefinito è l'intera capacità del nodo. Per maggiori dettagli, consulta Richieste di risorse in Autopilot.
La specifica del pod dovrebbe essere simile al seguente esempio, che richiede quattro GPU T4:
apiVersion: v1
kind: Pod
metadata:
name: t4-pod
spec:
# Optional: Use GKE Sandbox
# runtimeClassName: gvisor
nodeSelector:
cloud.google.com/gke-accelerator: "nvidia-tesla-t4"
containers:
- name: t4-container-1
image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
command: ["/bin/bash", "-c", "--"]
args: ["while true; do sleep 600; done;"]
resources:
limits:
nvidia.com/gpu: 3
cpu: "54"
memory: "54Gi"
requests:
cpu: "54"
memory: "54Gi"
- name: t4-container-2
image: nvidia/cuda:11.0.3-runtime-ubuntu20.04
command: ["/bin/bash", "-c", "--"]
args: ["while true; do sleep 600; done;"]
resources:
limits:
nvidia.com/gpu: 1
cpu: "18"
memory: "18Gi"
requests:
cpu: "18"
memory: "18Gi"
- Facoltativo
runtimeClassname: gvisor: l'impostazione che consente di eseguire questo pod in GKE Sandbox. Per utilizzarla, rimuovi il commento da questa riga. Per saperne di più, consulta Sandbox GKE.
Questo manifest specifica limits per le risorse di CPU e memoria. Se ometti limits per CPU o memoria, GKE assegna ai pod la classe QoS Burstable e consente ai pod di utilizzare le risorse inutilizzate dalla somma delle richieste di risorse sul nodo. Per saperne di più, consulta Configurare il bursting dei pod in GKE.
Richiedere lo spazio di archiviazione temporanea per i pod GPU Autopilot
Puoi anche richiedere l'archiviazione temporanea nei pod che necessitano di un'archiviazione di breve durata. Lo spazio di archiviazione temporaneo massimo disponibile e il tipo di hardware di archiviazione utilizzato dipendono dal tipo e dalla quantità di GPU richieste dal pod. Puoi utilizzare l'SSD locale per l'archiviazione temporanea con le seguenti configurazioni:
- Utilizza le GPU NVIDIA RTX PRO 6000 ed esegui una versione patch di GKE che soddisfi i requisiti di versione elencati nella sezione Prima di iniziare. La configurazione frazionaria di un ottavo di GPU non supporta l'archiviazione temporanea.
- Utilizza le GPU NVIDIA L4.
Per utilizzare l'SSD locale per l'archiviazione temporanea, aggiungi
cloud.google.com/gke-ephemeral-storage-local-ssd: "true" nodeSelector al manifest
del carico di lavoro. Consulta il manifest di esempio in Utilizza l'archiviazione temporanea supportata da SSD locali con i cluster Autopilot.
Le GPU NVIDIA H100 (80 GB) e NVIDIA A100 (80 GB) utilizzano sempre SSD locali
per lo spazio di archiviazione temporaneo e non puoi specificare questo selettore di nodi per queste GPU.
Richiedi tipi di macchine specifici utilizzando ComputeClass personalizzate
In alcuni casi, potrebbe essere necessario eseguire il workload GPU su un tipo di macchina specifico, ad esempio se il tipo di macchina che vuoi non è un tipo di macchina predefinito per i cluster Autopilot. Puoi richiedere esplicitamente una macchina specifica utilizzando ComputeClass personalizzate, che ti consentono di definire un profilo di configurazione del nodo che specifica il tipo di macchina e la GPU. Per utilizzare i tipi di macchine G4 con meno di una GPU, devi seguire le istruzioni nella sezione successiva per richiedere esplicitamente un tipo di macchina.
Per informazioni generali su ComputeClasses, consulta Informazioni su ComputeClasses personalizzate.
Per richiedere un tipo di macchina specifico per il tuo workload GPU, completa i seguenti passaggi:
Crea un manifest per una classe ComputeClass personalizzata. Per questo esempio, salva quanto segue come
a3-computeclass.yaml:apiVersion: cloud.google.com/v1 kind: ComputeClass metadata: name: a3-edge-gpu spec: priorities: - machineType: a3-edgegpu-8g-nolssd gpu: count: 8 type: nvidia-h100-80gb nodePoolAutoCreation: enabled: trueIn questo manifest:
metadata.nameè il nome della ComputeClass personalizzata, a cui farai riferimento nella specifica del pod.machineTypeè la macchina specifica di cui eseguire il provisioning.- I campi
gpuspecificano il tipo e il numero di GPU collegate alla macchina. I valori di questi campi devono corrispondere alle funzionalità dimachineTypespecificato.
Applica il manifest eseguendo questo comando:
kubectl apply -f a3-computeclass.yamlNel manifest del pod, richiedi ComputeClass utilizzando il selettore di nodi
cloud.google.com/compute-class:apiVersion: v1 kind: Pod metadata: name: gpu-cc-pod spec: nodeSelector: cloud.google.com/compute-class: a3-edge-gpu containers: - name: my-gpu-container image: nvidia/cuda:latest command: ["/bin/bash", "-c", "--"] args: ["while true; do sleep 600; done;"] resources: limits: nvidia.com/gpu: 1GKE esegue il provisioning di un nuovo nodo che corrisponde alla definizione in
a3-edge-gpuComputeClass per eseguire il pod.
Richiedi tipi di macchine G4 con meno di una GPU
I tipi di macchine G4 utilizzano la GPU NVIDIA RTX PRO 6000. Per richiedere tipi di macchina G4 con meno di una GPU, devi seguire le istruzioni della sezione precedente, impostando i seguenti campi:
machineTypea uno dei seguenti valori:g4-standard-6(un ottavo di GPU)g4-standard-12(un quarto di GPU)g4-standard-24(metà di una GPU)
gpu.count:1gpu.type:nvidia-rtx-pro-6000
Verifica l'allocazione delle GPU di cui è stato eseguito il deployment
Per verificare che un workload GPU di cui è stato eseguito il deployment disponga delle GPU richieste, esegui questo comando:
kubectl describe node NODE_NAME
Sostituisci NODE_NAME con il nome del nodo su cui è stato pianificato il pod.
L'output è simile al seguente:
apiVersion: v1
kind: Node
metadata:
...
labels:
...
cloud.google.com/gke-accelerator: nvidia-tesla-t4
cloud.google.com/gke-accelerator-count: "1"
cloud.google.com/machine-family: custom-48
...
...
Controlla la versione del driver GPU
Nei cluster Autopilot, GKE installa automaticamente i driver di dispositivo NVIDIA su tutti i nodi GPU. Per trovare la versione del driver installata da GKE nel tuo cluster, esegui questo comando:
kubectl logs --selector=k8s-app=nvidia-gpu-device-plugin \
--container="nvidia-gpu-device-plugin" \
--tail=-1 \
--namespace=kube-system | grep Driver
L'output è simile al seguente:
I1206 18:37:08.251742 5851 metrics.go:144] nvml initialized successfully. Driver version: 535.104.12
Come funziona l'allocazione delle GPU in Autopilot
Dopo aver richiesto un tipo di GPU e una quantità per i container in un pod e aver eseguito il deployment del pod, si verifica quanto segue:
- Se non esiste un nodo GPU allocabile, Autopilot esegue il provisioning di un nuovo nodo GPU per pianificare il pod. Autopilot installa automaticamente i driver NVIDIA per facilitare l'hardware.
- Autopilot aggiunge taint dei nodi al nodo GPU e aggiunge le tolleranze corrispondenti al pod. In questo modo, GKE non pianifica altri pod sul nodo GPU.
Autopilot inserisce esattamente un pod GPU su ogni nodo GPU, nonché tutti i carichi di lavoro gestiti da GKE che vengono eseguiti su tutti i nodi e tutti i DaemonSet che configuri in modo da tollerare tutti i taint dei nodi.
Esegui DaemonSet su ogni nodo
Potresti voler eseguire DaemonSet su ogni nodo, anche su quelli a cui sono state applicate incompatibilità. Ad esempio, alcuni agenti di logging e monitoraggio devono essere eseguiti su ogni nodo del cluster. Puoi configurare questi DaemonSet in modo che ignorino le incompatibilità dei nodi, in modo che GKE posizioni i workload su ogni nodo.
Per eseguire DaemonSet su ogni nodo del cluster, inclusi i nodi GPU, aggiungi la seguente tolleranza alla specifica:
apiVersion: apps/v1
kind: DaemonSet
metadata:
name: logging-agent
spec:
tolerations:
- key: ""
operator: "Exists"
effect: ""
containers:
- name: logging-agent-v1
image: IMAGE_PATH
Sostituisci IMAGE_PATH con il percorso dell'immagine container.
Per eseguire DaemonSet su nodi GPU specifici nel cluster, aggiungi quanto segue alla specifica:
apiVersion: apps/v1
kind: DaemonSet
metadata:
name: logging-agent
spec:
nodeSelector:
cloud.google.com/gke-accelerator: "GPU_TYPE"
tolerations:
- key: ""
operator: "Exists"
effect: ""
containers:
- name: logging-agent-v1
image: IMAGE_PATH
Sostituisci GPU_TYPE con il tipo di GPU nei nodi di destinazione. Può essere uno dei seguenti:
nvidia-gb200: NVIDIA GB200 (anteprima)nvidia-b200: NVIDIA B200 (180GB)nvidia-h200-141gb: NVIDIA H200 (141GB)nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)nvidia-h100-80gb: NVIDIA H100 (80GB)nvidia-a100-80gb: NVIDIA A100 (80GB)nvidia-tesla-a100: NVIDIA A100 (40GB)nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000nvidia-l4: NVIDIA L4nvidia-tesla-t4: NVIDIA T4
nvidia-gb200: NVIDIA GB200 (anteprima)nvidia-b200: NVIDIA B200 (180 GB) (anteprima)nvidia-h200-141gb: NVIDIA H200 (141 GB) (anteprima)nvidia-h100-mega-80gb: NVIDIA H100 Mega (80GB)nvidia-h100-80gb: NVIDIA H100 (80GB)nvidia-a100-80gb: NVIDIA A100 (80GB)nvidia-tesla-a100: NVIDIA A100 (40GB)nvidia-rtx-pro-6000: NVIDIA RTX PRO 6000 (anteprima) (ad eccezione dei tipi di macchine G4 che hanno meno di una GPU)nvidia-l4: NVIDIA L4nvidia-tesla-t4: NVIDIA T4
Casi d'uso delle GPU in Autopilot
Puoi allocare GPU ai container nei pod Autopilot per facilitare carichi di lavoro come i seguenti:
- Inferenza di machine learning (ML)
- Addestramento ML
- Rendering
Quantità di GPU supportate
Quando richiedi GPU nella specifica del pod, devi utilizzare le seguenti quantità in base al tipo di GPU. Se richiedi una quantità di GPU non supportata per quel tipo, Autopilot rifiuta il pod.
| Quantità di GPU | |
|---|---|
NVIDIA B200 (180GB)nvidia-b200 |
8 |
NVIDIA H200 (141GB)nvidia-h200-141gb |
8 |
NVIDIA H100 Mega (80GB)nvidia-h100-mega-80gb |
8 |
NVIDIA H100 (80GB)nvidia-h100-80gb |
1, 2, 4, 8 |
NVIDIA A100 (80GB)nvidia-a100-80gb |
1, 2, 4, 8 |
NVIDIA A100 (40GB)nvidia-tesla-a100 |
1, 2, 4, 8, 16 |
NVIDIA RTX PRO 6000nvidia-rtx-pro-6000 |
1/8, 1/4, 1/2, 1, 2, 4, 8 |
NVIDIA L4nvidia-l4 |
1, 2, 4, 8 |
NVIDIA T4nvidia-tesla-t4 |
1, 2, 4 |
Monitora le prestazioni del carico di lavoro del nodo GPU
Se nel tuo cluster GKE sono abilitate le metriche di sistema, in Cloud Monitoring sono disponibili le seguenti metriche per monitorare le prestazioni del workload della GPU:
-
Ciclo di lavoro (
container/accelerator/duty_cycle): percentuale di tempo nell'ultimo periodo di campionamento (10 secondi) durante il quale l'acceleratore ha eseguito attivamente l'elaborazione. Tra 1 e 100. -
Utilizzo della memoria (
container/accelerator/memory_used): quantità di memoria dell'acceleratore allocata in byte. -
Capacità di memoria (
container/accelerator/memory_total): memoria totale dell'acceleratore in byte.
Queste metriche si applicano a livello di container (container/accelerator) e non vengono
raccolte per i container pianificati su una GPU che utilizza la condivisione del tempo della GPU o NVIDIA MPS.
Puoi utilizzare dashboard predefinite per monitorare i cluster con nodi GPU. Per saperne di più, vedi Visualizzare le metriche di osservabilità. Per informazioni generali sul monitoraggio dei cluster e delle relative risorse, consulta Osservabilità per GKE.
Visualizzare le metriche di utilizzo per i workload
Puoi visualizzare le metriche di utilizzo della GPU del workload dalla dashboard Workload nella console Cloud de Confiance .
Per visualizzare l'utilizzo della GPU del workload, segui questi passaggi:
-
Vai alla pagina Workload nella console Cloud de Confiance .
Vai a Carichi di lavoro - Seleziona un workload.
La dashboard Workloads mostra grafici relativi alla memoria utilizzata e alla capacità della GPU e al ciclo di lavoro della GPU.
Visualizza le metriche di NVIDIA Data Center GPU Manager (DCGM)
Puoi raccogliere e visualizzare le metriche NVIDIA DCGM utilizzando Google Cloud Managed Service per Prometheus. Per i cluster Autopilot, GKE installa i driver. Per i cluster Standard, devi installare i driver NVIDIA.
Per istruzioni su come eseguire il deployment del pacchetto DCGM gestito da GKE, consulta Raccogliere e visualizzare le metriche di NVIDIA Data Center GPU Manager (DCGM).
Metriche di integrità di JobSet e dei nodi per i workload GPU
Oltre alle metriche DCGM, puoi utilizzare le seguenti metriche per monitorare l'integrità e le prestazioni dei tuoi carichi di lavoro GPU, soprattutto quando li esegui come JobSet.
Metriche JobSet
Le seguenti metriche si applicano sia ai JobSet GPU che TPU con un singolo job replicato:
kubernetes.io/jobset/times_between_interruptionskubernetes.io/jobset/times_to_recoverkubernetes.io/jobset/uptime
Per ulteriori informazioni su queste metriche di sistema, consulta Metriche Kubernetes.
Puoi anche utilizzare la dashboard JobSet nella console Cloud de Confiance per visualizzare e monitorare i tuoi workload GPU:
Metriche di integrità dei nodi
Le seguenti metriche a livello di nodo si applicano a tutti i nodi, inclusi quelli con GPU:
-
kubernetes.io/node/status_condition: questa metrica richiede GKE versione 1.32.1-gke.1357001 o successive.
Le metriche di interruzione dei nodi e dei pool di nodi si applicano anche ai nodi non TPU.
Kube-state-metrics per JobSet
kube-state-metrics per JobSet può essere utilizzato con le GPU. La raccolta di queste metriche richiede GKE versione 1.32.1-gke.1357001 o versioni successive. Per saperne di più, consulta la documentazione sulle metriche JobSet.
Passaggi successivi
- Scopri di più sul supporto delle GPU in GKE.
- Scopri come le classi di computing Autopilot sono ottimizzate per casi d'uso specializzati.
- Scopri di più sul deployment delle GPU per i carichi di lavoro batch con Dynamic Workload Scheduler.
- Scopri di più sul sandboxing dei workload GPU con GKE Sandbox