Risolvere i problemi di GKE

Questo documento elenca i documenti per la risoluzione dei problemi comuni che potresti riscontrare durante l'utilizzo di Google Kubernetes Engine (GKE). Che tu stia diagnosticando errori del workload come ImagePullBackOff e CrashLoopBackOff, eseguendo il debug del comportamento di scalabilità automatica del cluster, risolvendo problemi di PersistentVolume o risolvendo problemi di registrazione dei nodi, i documenti elencati qui possono aiutarti.

Se non hai familiarità con la risoluzione dei problemi in GKE, inizia con Introduzione alla risoluzione dei problemi.

Per diagnosticare e risolvere i problemi che riscontri, consulta i documenti nelle seguenti sezioni:

Per risolvere i problemi relativi al networking GKE, consulta Risolvi i problemi relativi al networking GKE nella documentazione sul networking GKE.

Questo documento è destinato ad amministratori e architetti, esperti di sicurezza, specialisti di networking o di archiviazione che risolvono i problemi relativi alle configurazioni GKE. Per scoprire di più sui ruoli GKE, consulta Ruoli utente e attività comuni di GKE.

Introduzione alla risoluzione dei problemi

Argomento Descrizione
Introduzione alla risoluzione dei problemi di GKE Inizia a risolvere i problemi di GKE scoprendo il processo generale e i concetti fondamentali.
Controllare Service Health e gli incidenti Scopri come controllare l'integrità di GKE e dei servizi Cloud de Confiance by S3NS correlati per escludere problemi della piattaforma.
Valuta l'integrità del cluster e del workload nella console Cloud de Confiance Scopri come utilizzare la console Cloud de Confiance per esaminare e risolvere i problemi di GKE.
Esamina lo stato di un cluster con kubectl Esplora i comandi e le tecniche comuni di kubectl per diagnosticare i problemi nei cluster e nei workload.
Esegui analisi storiche con Cloud Logging Scopri come utilizzare in modo efficace Cloud Logging per trovare le cause principali dei problemi in GKE.
Eseguire il monitoraggio proattivo con Cloud Monitoring Utilizza le dashboard e le metriche di Cloud Monitoring per identificare, diagnosticare e risolvere i problemi di GKE.
Accelerare la diagnosi con Gemini Cloud Assist Scopri come Gemini può aiutarti a diagnosticare e risolvere i problemi di GKE.
Metti insieme tutti i pezzi: scenario di risoluzione dei problemi di esempio Segui un esempio passo passo di risoluzione dei problemi di uno scenario comune in GKE.

Configurazione del cluster

Argomento Descrizione
Creazione del cluster Risolvi i problemi relativi alla creazione di cluster.
Cluster Autopilot Diagnostica e risolvi i problemi dei cluster GKE Autopilot, inclusi i problemi di creazione dei cluster, eliminazione degli spazi dei nomi, scalabilità e workload.
Strumento a riga di comando kubectl Risolvi i problemi relativi allo strumento a riga di comando kubectl in GKE, inclusi i problemi di autenticazione e autorizzazione. Questa pagina include anche consigli su come risolvere i problemi del proxy Konnectivity per verificare se è la causa dell'interruzione della risposta ai comandi kubectl logs, attach, exec o port-forward.
Pool di nodi standard Risolvi i problemi relativi ai pool di nodi GKE Standard, inclusi problemi relativi alla creazione di pool di nodi, al provisioning best-effort, ai metadati delle istanze danneggiati e alla migrazione dei carichi di lavoro a nuovi pool di nodi.
Stato del nodo NotReady Scopri come diagnosticare e risolvere lo stato NotReady del nodo in GKE risolvendo i problemi relativi a cause comuni come carenza di risorse, problemi di rete ed errori dei componenti.
Registrazione dei nodi Risolvi i problemi che si verificano durante l'aggiunta di nodi al tuo cluster GKE Standard, ad esempio errori di registrazione dei nodi e prerequisiti mancanti per la registrazione dei nodi.
Runtime container Risolvi i problemi relativi ai runtime dei container in GKE, inclusi problemi con containerd e dockershim e registri privati.
Node pool Windows Server Risolvi i problemi relativi ai pool di nodi Windows Server in GKE, inclusi errori di avvio dei pod, errori di pull delle immagini, problemi di connettività di rete e problemi di stato dei nodi.

Scalabilità automatica

Argomento Descrizione
Il gestore della scalabilità automatica dei cluster non esegue lo scale down Diagnostica e risolvi i motivi comuni per cui il cluster non rimuove i nodi sottoutilizzati. Scopri come verificare la presenza di problemi come PodDisruptionBudgets restrittivi, pod con spazio di archiviazione locale o annotazioni specifiche (ad esempio "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") che impediscono l'espulsione dei nodi.
Il gestore della scalabilità automatica dei cluster non esegue lo scale up Scopri perché il gestore della scalabilità automatica dei cluster non aggiunge nuovi nodi per soddisfare la domanda. Controlla la presenza di pod non pianificabili, verifica di non aver raggiunto i limiti di dimensioni del cluster o del pool di nodi e identifica potenziali problemi di quota delle risorse o di disponibilità delle VM regionali.
Scalabilità automatica orizzontale dei pod Risolvi i problemi relativi alla mancata scalabilità di Horizontal Pod Autoscaler delle repliche dei pod della tua applicazione. Risolvi problemi comuni, ad esempio risorse HorizontalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche.
Scalabilità automatica verticale dei pod Risolvi i problemi relativi a VerticalPodAutoscaler che non scala le risorse dei pod della tua applicazione. Risolvi i problemi comuni, ad esempio risorse VerticalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche.

Archiviazione

Argomento Descrizione
Spazio di archiviazione Risolvi i problemi di archiviazione, inclusi quelli relativi ai Persistent Disk regionali, alle prestazioni del disco e all'espansione del volume.

Sicurezza del cluster

Argomento Descrizione
Autenticazione Risolvi i problemi di autenticazione in GKE, inclusi i problemi con RBAC, Workload Identity Federation for GKE e il server dei metadati GKE.
Service account Risolvi i problemi relativi ai service account, tra cui il ripristino del service account predefinito e l'abilitazione del account di servizio predefinito di Compute Engine.
Secret a livello di applicazione Risolvi i problemi che possono verificarsi durante la configurazione della crittografia dei secret a livello di applicazione, inclusi aggiornamenti non riusciti ed errori in cui non puoi utilizzare una chiave Cloud KMS o in cui la versione della chiave Cloud KMS è stata eliminata.

L'autorità di certificazione radice del cluster scadrà a breve

Argomento Descrizione
Scadenza dell'autorità di certificazione (CA) radice Se l'autorità di certificazione (CA) radice del tuo cluster sta per scadere, scopri come eseguire una rotazione delle credenziali per evitare che le normali operazioni del cluster vengano interrotte.

Workload

Argomento Descrizione
Workload di cui è stato eseguito il deployment Risolvi gli errori per i carichi di lavoro in esecuzione in un cluster GKE, inclusi PodUnschedulable. Leggi la sezione PodUnschedulable per suggerimenti su errori come MatchNodeSelector e Does not have minimum availability.
Estrazioni di immagini Risolvi i problemi relativi ai pull delle immagini. Scopri le cause di stati come ImagePullBackOff e ErrImagePull e come risolverli risolvendo problemi comuni come l'autenticazione e la connettività di rete.
Eventi CrashLoopBackOff Risolvi i problemi relativi agli eventi CrashLoopBackOff in GKE. Diagnostica problemi come l'esaurimento delle risorse, le configurazioni errate delle app e gli errori dei probe di attività.
Eventi OOM Risolvi i problemi relativi agli eventi di esaurimento della memoria (OOM) di Kubernetes. Identificare le cause, distinguere i tipi di eventi e applicare soluzioni efficaci per gli errori OOM a livello di container e nodo.
Workload ARM Risolvi i problemi relativi ai workload ARM, incluso l'arresto anomalo dei pod sui nodi ARM.
TPU Risolvi i problemi relativi alle TPU, inclusi quelli relativi a quota, provisioning automatico dei nodi, configurazione e pianificazione dei workload.
GPU Risolvi i problemi relativi alle GPU, inclusi quelli relativi all'installazione dei driver GPU, agli errori dei plug-in del dispositivo e alle immagini container.

Gestione dei cluster

Argomento Descrizione
Upgrade dei cluster Risolvi i problemi di upgrade dei cluster e dei nodi GKE, inclusi upgrade lunghi o incompleti, upgrade automatici imprevisti, errori e problemi post-upgrade.
Webhook Scopri come risolvere i problemi e garantire la stabilità del piano di controllo del cluster quando utilizzi i webhook di controllo dell'ammissione.
Spazio dei nomi bloccato nello stato Terminating Risolvi i problemi relativi agli spazi dei nomi bloccati nello stato Terminating identificando e rimuovendo i componenti non integri che bloccano l'eliminazione.
Operazioni simultanee Risolvi i problemi relativi alle operazioni simultanee imparando a identificare questi errori e a risolverli aspettando che le operazioni vengano completate.

Monitoraggio

Argomento Descrizione
Metriche di sistema Risolvi i problemi relativi alla mancata visualizzazione delle metriche di sistema in Cloud Monitoring.
Dashboard di Monitoring Risolvi i problemi relativi alle dashboard di monitoraggio, inclusi quelli relativi all'attivazione del monitoraggio, alle risorse Kubernetes mancanti e alle autorizzazioni.
Risolvere i problemi relativi ai log mancanti Risolvi i problemi relativi ai log GKE mancanti. Scopri come controllare lo stato dell'API, le impostazioni del cluster, le autorizzazioni, le quote, i filtri e il comportamento dell'applicazione.

Errori 4xx

Argomento Descrizione
Errori 4xx Risolvi alcuni degli errori 400, 401, 403 e 404 che potresti riscontrare durante l'utilizzo di GKE. Questa pagina include anche informazioni su come risolvere i problemi relativi agli errori di autorizzazioni di modifica mancanti nell'account.

Problemi noti

Argomento Descrizione
Problemi noti Identifica e risolvi i problemi noti che potrebbero influire sull'utilizzo di GKE.

Passaggi successivi