Dokumen ini menjelaskan cara melihat operasi pemeliharaan host menggunakan command line dan menggunakan dasbor pemeliharaan GKE.
Melihat operasi pemeliharaan host dapat membantu Anda mengurangi gangguan workload, terutama untuk cluster GKE yang berjalan lama dengan workload yang dapat terganggu karena gangguan infrastruktur berkala.
Untuk mengetahui detail selengkapnya tentang pemeliharaan host di GKE, lihat Memahami cara melakukan pemeliharaan host di GKE.
Memantau notifikasi pemeliharaan
Sebelum VM memiliki peristiwa pemeliharaan terjadwal,
Compute Engine akan mengirimkan notifikasi ke semua VM-nya. Notifikasi ini melaporkan awal masa pemeliharaan Compute Engine. Jika pemeliharaan mendatang dijadwalkan oleh VM tetapi tidak aktif, GKE akan menambahkan scheduled-maintenance-time ke label node.
Untuk memantau dan mendeteksi peristiwa pemeliharaan mendatang, Anda harus melihat notifikasi dari GKE dan Compute Engine.
Melihat pemeliharaan mendatang di Compute Engine
Compute Engine issues notifikasi saat node dan VM yang mendasarinya dijadwalkan untuk peristiwa host yang mengganggu, dan saat peristiwa ini menjadi aktif. Notifikasi ini mencakup informasi tentang waktu mulai yang direncanakan, jenis peristiwa, dan detail lainnya.
Melihat pemeliharaan mendatang di GKE
Di GKE versi 1.31.1-gke.2008000 dan yang lebih baru, serta untuk jenis mesin tertentu, Anda dapat memantau peristiwa pemeliharaan mendatang.
- Untuk jenis mesin dengan GPU atau TPU terpasang, 1.31.1-gke.2008000 atau yang lebih baru
- Untuk jenis mesin Z3 dengan SSD lebih dari 18 TiB, 1.32.4-gke.1376000 atau yang lebih baru
- Untuk jenis mesin H4D, 1.32.6-gke.1060000 atau yang lebih baru
- Untuk
c4a-highmem-96-metal, 1.35.0-gke.2232000 atau yang lebih baru
Untuk melihat peristiwa pemeliharaan mendatang, Anda dapat melakukan salah satu hal berikut:
Membuat kueri notifikasi di tingkat node. Untuk melakukannya, jalankan perintah berikut:
kubectl get nodes -l cloud.google.com/scheduled-maintenance-time \ -L cloud.google.com/scheduled-maintenance-timeOutputnya mirip dengan hal berikut ini:
NAME STATUS SCHEDULED-MAINTENANCE-TIME <gke-accelerator-node-name> Ready 1733083200 <gke-accelerator-node-name> Ready 1733083200 [...]Kolom
SCHEDULED-MAINTENANCE-TIMEmewakili detik, yang ditampilkan dalam format waktu epoch Unix.Membuat kueri notifikasi ini di tingkat metadata node dengan memeriksa instance untuk notifikasi peristiwa pemeliharaan.
Untuk kelompok mesin yang dioptimalkan akselerator yang mendukung pemeliharaan lanjutan, Anda dapat mengakses endpoint
upcoming-maintenanceyang memberikan informasi tentang peristiwa pemeliharaan terjadwal dan yang telah dimulai.
Melihat peristiwa Kubernetes untuk pemeliharaan host
Di GKE versi 1.35 dan yang lebih baru, peristiwa Kubernetes yang melacak siklus proses pemeliharaan host akan ditampilkan. Peristiwa Kubernetes ini memberikan visibilitas mendetail ke masa pemeliharaan Compute Engine terjadwal, operasi yang sedang berlangsung, dan kasus ekstrem seperti perbaikan atau pembatalan, sehingga Anda dapat memantau gangguan langsung dalam lingkungan Kubernetes.
Anda dapat melihat peristiwa ini menggunakan alat Kubernetes standar atau melalui Cloud Logging:
Untuk melihat peristiwa pemeliharaan terbaru, gunakan perintah
kubectlberikut:kubectl get events -n kube-system --field-selector involvedObject.kind=NodePeristiwa Kubernetes disimpan di cluster selama 60 menit, sehingga perintah ini hanya menampilkan peristiwa terbaru per node.
Untuk melihat peristiwa di Cloud Logging, lakukan hal berikut:
Buka halaman Logs Explorer di Cloud de Confiance konsol:
Gunakan kueri berikut:
resource.type="k8s_node" log_id("events") jsonPayload.metadata.annotations."maintenance.gke.io/category"="HostMaintenance"
Peristiwa siklus proses pemeliharaan
Peristiwa siklus proses pemeliharaan ditampilkan pada resource node Kubernetes. Tabel berikut menjelaskan peristiwa yang ditampilkan oleh GKE selama siklus proses pemeliharaan host Compute Engine:
| Alasan | Deskripsi |
|---|---|
MaintenanceWindowScheduled |
Masa pemeliharaan host Compute Engine telah dijadwalkan untuk node |
MaintenanceWindowCancelled |
Masa pemeliharaan host Compute Engine telah dihapus di node |
MaintenanceWindowRescheduled |
Masa pemeliharaan host Compute Engine yang dijadwalkan sebelumnya telah dipindahkan dan waktu mulai pemeliharaan diperbarui |
CustomerTriggeredMaintenance |
Pemeliharaan host Compute Engine dipicu secara manual melalui GKE |
MaintenanceWindowStarted |
Pemeliharaan host Compute Engine telah dimulai |
TerminateOnHostMaintenance |
Ditampilkan saat Compute Engine mengeluarkan sinyal penghentian (TERMINATE_ON_HOST_MAINTENANCE). Jika penghentian yang lancar diaktifkan, GKE akan mengisolasi node dan menjadwalkan penghentian pod (SIGTERM). Workload akan menerima pemberitahuan 5 hingga 60 menit, bergantung pada tingkat mesin. |
PodEvictionComplete |
Semua pod telah berhasil dihentikan dari node |
MaintenanceWindowCleared |
Pemeliharaan host Compute Engine telah selesai dan node kembali ke status siap. |
Informasi payload peristiwa
Jika informasi tentang peristiwa pemeliharaan mendatang tersedia melalui Compute Engine, setiap peristiwa juga menyertakan payload yang berisi data anotasi dengan informasi berikut:
- Detail masa pemeliharaan Compute Engine: Mencakup
windowStartTime,windowEndTime, danlatestWindowStartTime. - Metadata pemeliharaan: Status siklus pemeliharaan pada saat
peristiwa, alasan pemeliharaan (alasan dapat dicantumkan sebagai
SCHEDULEDatauUNSCHEDULED), dan apakah masa pemeliharaan Compute Engine dapat dijadwalkan ulang. - Metadata Kubernetes: Mencakup Cluster_name, nodepool_name, dan node_name.
Tampilan operasi pemeliharaan host di Dasbor Pemeliharaan GKE
Dasbor Pemeliharaan GKE memberikan tampilan gabungan operasi pemeliharaan host. Dasbor ini memberikan visibilitas komprehensif ke aktivitas pemeliharaan di seluruh tingkat cluster, node pool, dan node.
Dasbor ini dibuat berdasarkan Observability Analytics. Dasbor ini menampilkan siklus pemeliharaan, status node, dan metrik waktu nonaktif historis.
Langkah berikutnya
- Pelajari cara mengelola gangguan node selama pemeliharaan host.
- Pelajari cara me lakukan pemeliharaan host untuk node yang menjalankan workload akselerator.
- Pelajari tentang masa pemeliharaan dan pengecualian GKE.