In diesem Dokument wird beschrieben, wie Sie Hostwartungsvorgänge über die Befehlszeile und das GKE-Wartungsdashboard aufrufen.
Wenn Sie sich Wartungsvorgänge für Hosts ansehen, können Sie Unterbrechungen von Arbeitslasten vermeiden, insbesondere bei einem GKE-Cluster mit langer Laufzeit und Arbeitslasten, die aufgrund regelmäßiger Infrastrukturunterbrechungen unterbrochen werden könnten.
Weitere Informationen zur Hostwartung in GKE finden Sie unter Hostwartung in GKE.
Wartungsbenachrichtigungen beobachten
Vor einem geplanten Wartungsereignis für eine VM sendet Compute Engine Benachrichtigungen an alle VMs. Diese Benachrichtigungen informieren über den Beginn des Compute Engine-Wartungsfensters. Wenn eine bevorstehende Wartung von der VM geplant, aber nicht aktiv ist, fügt GKE dem Knotenlabel scheduled-maintenance-time hinzu.
Wenn Sie anstehende Wartungsereignisse im Blick behalten und erkennen möchten, müssen Sie die Benachrichtigungen von GKE und Compute Engine aufrufen.
Anstehende Wartungsarbeiten in Compute Engine ansehen
Compute Engine gibt Benachrichtigungen aus, wenn Knoten und die zugrunde liegenden VMs für störende Hostereignisse geplant sind und wenn diese Ereignisse aktiv werden. Die Benachrichtigungen enthalten Informationen zur geplanten Startzeit, zum Ereignistyp und andere Details.
Anstehende Wartung in GKE ansehen
In GKE-Version 1.31.1-gke.2008000 und höher können Sie für bestimmte Maschinentypen anstehende Wartungsereignisse beobachten.
- Für Maschinentypen mit angehängten GPUs oder TPUs: 1.31.1-gke.2008000 oder höher.
- Für H4D-Maschinentypen: 1.32.6-gke.1060000 oder höher.
- Für
c4a-highmem-96-metal: 1.35.0-gke.2232000 oder höher. - Für Z3-Maschinentypen mit mehr als 18 TiB Titanium-SSD: 1.32.4-gke.1376000 oder höher.
- Für Z4D-Maschinentypen mit mehr als 41 TiB angehängter Titanium-SSD: 1.36.3-gke.1244000 oder höher.
Sie haben folgende Möglichkeiten, um anstehende Wartungsereignisse aufzurufen:
Benachrichtigungen auf Knotenebene abfragen. Führen Sie zu diesem Zweck den nachfolgenden Befehl aus.
kubectl get nodes -l cloud.google.com/scheduled-maintenance-time \ -L cloud.google.com/scheduled-maintenance-timeDie Ausgabe sieht etwa so aus:
NAME STATUS SCHEDULED-MAINTENANCE-TIME <gke-accelerator-node-name> Ready 1733083200 <gke-accelerator-node-name> Ready 1733083200 [...]Die Spalte
SCHEDULED-MAINTENANCE-TIMEsteht für Sekunden, die im Unix-Epochenzeitformat angezeigt werden.Sie können diese Benachrichtigungen auf der Ebene der Knotenmetadaten abfragen, indem Sie Instanzen auf Benachrichtigungen zu Wartungsereignissen prüfen.
Für beschleunigungsoptimierte Maschinenfamilien, die erweiterte Wartung unterstützen, können Sie auf den
upcoming-maintenance-Endpunkt zugreifen, der Informationen zu geplanten und gestarteten Wartungsereignissen enthält.
Kubernetes-Ereignisse für die Hostwartung ansehen
In GKE-Version 1.35 und höher werden Kubernetes-Ereignisse ausgegeben, die den Lebenszyklus der Hostwartung verfolgen. Diese Kubernetes-Ereignisse bieten detaillierte Informationen zu geplanten Compute Engine-Wartungsfenstern, laufenden Vorgängen und Grenzfallereignissen wie Reparaturen oder Kündigungen. So können Sie Störungen direkt in der Kubernetes-Umgebung überwachen.
Sie können diese Ereignisse mit Standard-Kubernetes-Tools oder über Cloud Logging aufrufen:
Verwenden Sie den folgenden
kubectl-Befehl, um die letzten Wartungsereignisse aufzurufen:kubectl get events -n kube-system --field-selector involvedObject.kind=NodeKubernetes-Ereignisse werden 60 Minuten lang im Cluster aufbewahrt. Mit diesem Befehl werden also nur die letzten Ereignisse pro Knoten ausgegeben.
So rufen Sie Ereignisse in Cloud Logging auf:
Rufen Sie in der Cloud de Confiance Console die Seite Log-Explorer auf:
Verwenden Sie die folgende Abfrage:
resource.type="k8s_node" log_id("events") jsonPayload.metadata.annotations."maintenance.gke.io/category"="HostMaintenance"
Wartungs-Lifecycle-Ereignisse
Wartungslebenszyklusereignisse werden für Kubernetes-Knotenressourcen ausgegeben. In der folgenden Tabelle werden die Ereignisse beschrieben, die von GKE während des Lebenszyklus der Compute Engine-Hostwartung ausgegeben werden:
| Grund | Beschreibung |
|---|---|
MaintenanceWindowScheduled |
Für den Knoten wurde ein Compute Engine-Hostwartungsfenster geplant. |
MaintenanceWindowCancelled |
Das Wartungsfenster für den Compute Engine-Host wurde auf dem Knoten geschlossen. |
MaintenanceWindowRescheduled |
Das zuvor geplante Wartungsfenster für Compute Engine-Hosts wurde verschoben und die Wartungsstartzeit wurde aktualisiert. |
CustomerTriggeredMaintenance |
Die Wartung des Compute Engine-Hosts wurde manuell über GKE ausgelöst. |
MaintenanceWindowStarted |
Compute Engine-Hostwartung wurde gestartet |
TerminateOnHostMaintenance |
Wird ausgegeben, wenn Compute Engine das Beendigungssignal (TERMINATE_ON_HOST_MAINTENANCE) ausgibt. Wenn die ordnungsgemäße Beendigung aktiviert ist, isoliert GKE den Knoten und plant die Pod-Entfernung (SIGTERM). Arbeitslasten erhalten je nach Maschinenklasse eine Benachrichtigungsfrist von 5 bis 60 Minuten. |
PodEvictionComplete |
Alle Pods wurden erfolgreich vom Knoten entfernt. |
MaintenanceWindowCleared |
Die Wartung des Compute Engine-Hosts ist abgeschlossen und der Knoten ist wieder bereit. |
Informationen zur Ereignisnutzlast
Wenn Informationen zu bevorstehenden Wartungsereignissen über Compute Engine verfügbar sind, enthält jedes Ereignis auch eine Nutzlast mit Anmerkungsdaten, die die folgenden Informationen enthalten:
- Compute Engine-Fensterdetails:Enthält
windowStartTime,windowEndTimeundlatestWindowStartTime. - Wartungsmetadaten:Der Status des Wartungszyklus zum Zeitpunkt des Ereignisses, der Grund für die Wartung (der Grund kann als
SCHEDULEDoderUNSCHEDULEDaufgeführt sein) und ob das Compute Engine-Zeitfenster neu geplant werden kann. - Kubernetes-Metadaten:Dazu gehören Cluster_name, nodepool_name und node_name.
Ansicht von Hostwartungsvorgängen im GKE-Wartungs-Dashboard
Das GKE-Wartungsdashboard bietet eine konsolidierte Ansicht der Hostwartungsvorgänge. Das Dashboard bietet umfassenden Einblick in Wartungsaktivitäten auf Cluster-, Knotenpool- und Knotenebene.
Das Dashboard basiert auf Observability Analytics. Sie enthält Wartungszyklen, Knotenstatus und Messwerte für vergangene Ausfallzeiten.
Nächste Schritte
- Knotenunterbrechungen während der Hostwartung verwalten
- Hostwartung für Knoten mit Beschleunigerarbeitslasten durchführen
- Informationen zu GKE-Wartungsfenstern und ‑ausschlüssen