Saat Anda perlu memeriksa dengan cepat kondisi cluster dan workload Google Kubernetes Engine (GKE), Anda mungkin kesulitan menentukan titik awalnya. Memvisualisasikan kesehatan cluster dan workload di konsol Cloud de Confiance membantu Anda menilai status lingkungan dengan cepat. Kondisi cluster mengacu pada kondisi infrastruktur GKE yang mendasarinya seperti node dan jaringan, sedangkan kondisi workload mengacu pada status dan performa aplikasi yang berjalan di cluster.
Gunakan halaman ini untuk mempelajari cara menjelajahi halaman cluster dan workload Kubernetes untuk mendapatkan ringkasan tingkat tinggi, mengidentifikasi potensi masalah (seperti node yang mengalami tekanan resource atau Pod yang gagal), dan melihat perincian resource tertentu untuk mengetahui detail selengkapnya.
Informasi ini penting bagi admin dan operator Platform yang bertanggung jawab untuk menjaga stabilitas cluster dan perlu melakukan penilaian kondisi dan pemeriksaan resource dengan cepat. Hal ini juga penting bagi developer Aplikasi yang perlu memahami status runtime deployment mereka dan menyelidiki kegagalan. Untuk mengetahui informasi selengkapnya tentang peran umum dan contoh tugas yang kami referensikan dalam konten Cloud de Confiance by S3NS , lihat Peran dan tugas pengguna GKE umum.
Untuk memberikan gambaran lengkap tentang kesehatan aplikasi Anda, konsol Cloud de Confiance juga memberi Anda akses ke alat pemantauan dan pencatatan log yang canggih, sehingga Anda dapat menyelidiki penyebab utama kegagalan di masa lalu dan mencegahnya secara proaktif di masa mendatang. Untuk mengetahui informasi selengkapnya tentang alat ini, lihat Melakukan analisis historis dengan Cloud Logging dan Melakukan pemantauan proaktif dengan Cloud Monitoring.
Menemukan masalah cluster
Halaman Kubernetes clusters memberi Anda ringkasan performa cluster Anda. Untuk mengidentifikasi masalah pada cluster Anda, mulailah dari halaman ini.
Untuk memulai, di konsol Cloud de Confiance , buka halaman Kubernetes clusters.
Berikut beberapa contoh cara menggunakan halaman ini untuk memecahkan masalah:
- Untuk mendapatkan saran tentang cara meningkatkan kualitas cluster, strategi upgrade, dan pengoptimalan biaya, klik Lihat rekomendasi.
- Untuk mengidentifikasi cluster yang tidak responsif, tinjau kolom Status. Setiap kelompok yang tidak memiliki tanda centang hijau perlu diperhatikan.
- Untuk melihat potensi masalah, tinjau kolom Notifikasi. Klik pesan notifikasi untuk mengetahui informasi selengkapnya.
Menyelidiki cluster tertentu
Setelah menemukan masalah pada cluster, jelajahi halaman Detail cluster untuk mendapatkan informasi mendalam yang membantu Anda memecahkan masalah cluster dan memahami konfigurasinya.
Untuk membuka halaman Detail cluster, lakukan hal berikut:
Buka halaman Kubernetes clusters.
Tinjau kolom Nama, lalu klik nama cluster yang ingin Anda selidiki.
Berikut beberapa contoh cara menggunakan halaman Details cluster untuk memecahkan masalah cluster Anda:
Untuk health check umum, coba opsi berikut:
Untuk melihat dasbor tingkat cluster, buka tab Observability. Secara default, GKE mengaktifkan Cloud Monitoring saat Anda membuat cluster. Saat Cloud Monitoring diaktifkan, GKE akan otomatis menyiapkan dasbor di halaman ini. Berikut beberapa tampilan yang mungkin paling berguna untuk pemecahan masalah:
- Ringkasan: lihat ringkasan umum performa, pemanfaatan resource, dan peristiwa utama cluster Anda. Dasbor ini membantu Anda menilai dengan cepat status keseluruhan cluster dan mengidentifikasi potensi masalah.
- Metrik traffic: melihat metrik jaringan berbasis node untuk mendapatkan insight tentang traffic antara beban kerja Kubernetes Anda.
- Status workload: melihat status Deployment, Pod, dan container. Mengidentifikasi instance yang gagal atau tidak responsif, dan mendeteksi batasan resource.
Bidang kontrol: melihat performa dan kondisi bidang kontrol. Dasbor ini memungkinkan Anda memantau metrik utama komponen seperti
kube-apiserverdanetcd, mengidentifikasi bottleneck performa, dan mendeteksi kegagalan komponen.
Untuk melihat error aplikasi terbaru, buka tab Error aplikasi. Informasi di tab ini dapat membantu Anda memprioritaskan dan menyelesaikan error dengan menunjukkan jumlah kemunculan, kapan error pertama kali muncul, dan kapan terakhir kali terjadi.
Untuk menyelidiki error lebih lanjut, klik pesan error untuk melihat laporan error mendetail, termasuk link ke log yang relevan.
Jika Anda memecahkan masalah setelah upgrade atau perubahan terbaru, periksa bagian Dasar-dasar cluster di tab Detail cluster. Pastikan bahwa versi yang tercantum di kolom Version adalah versi yang Anda harapkan. Untuk penyelidikan lebih lanjut, klik Show upgrade history di bagian Upgrades.
Jika Anda menggunakan cluster Standard dan Pod Anda macet dalam status
Pending, atau Anda mencurigai bahwa node kelebihan beban, periksa tab Node. Tab Nodes tidak tersedia untuk cluster Autopilot karena GKE mengelola node untuk Anda.- Di bagian Node Pool, periksa apakah penskalaan otomatis dikonfigurasi dengan benar dan jenis mesin sesuai untuk beban kerja Anda.
- Di bagian Node, cari node dengan status selain
Ready. StatusNotReadymenunjukkan masalah pada node itu sendiri, seperti tekanan resource atau masalah pada kubelet (kubelet adalah agen yang berjalan di setiap node untuk mengelola container).
Menemukan masalah workload
Jika Anda menduga ada masalah dengan aplikasi tertentu, seperti Deployment yang gagal, buka halaman Workloads di konsol Cloud de Confiance . Halaman ini memberikan tampilan terpusat dari semua aplikasi yang berjalan dalam cluster Anda.
Untuk memulai, di konsol Cloud de Confiance , buka halaman Workloads.
Berikut beberapa contoh cara menggunakan halaman ini untuk memecahkan masalah:
- Untuk mengidentifikasi workload yang tidak responsif, tinjau kolom Status. Setiap workload yang tidak memiliki tanda centang hijau perlu diperhatikan.
- Jika aplikasi tidak merespons, tinjau kolom Pod. Misalnya, status seperti 1/3 berarti hanya satu dari tiga replika aplikasi yang berjalan, yang menunjukkan adanya masalah.
Menyelidiki workload tertentu
Setelah mengidentifikasi beban kerja yang bermasalah dari ringkasan, buka halaman Detail beban kerja untuk mulai mengisolasi penyebab utamanya.
Untuk membuka halaman Details workload, lakukan hal berikut:
Buka halaman Workloads.
Lihat kolom Name dan klik nama workload yang ingin Anda selidiki.
Berikut beberapa contoh cara menggunakan halaman Detail workload untuk memecahkan masalah workload Anda:
Untuk memeriksa konfigurasi workload, gunakan tab Overview dan Details workload. Anda dapat menggunakan informasi ini untuk memverifikasi peristiwa seperti apakah tag image container yang benar telah di-deploy atau memeriksa permintaan dan batas resource beban kerja.
Untuk menemukan nama Pod tertentu yang mengalami error, buka bagian Managed Pods. Anda mungkin memerlukan informasi ini untuk perintah
kubectl. Bagian ini mencantumkan semua Pod yang dikontrol oleh workload, beserta statusnya.Untuk melihat histori revisi terbaru pada workload, buka tab Revision history. Jika Anda melihat masalah performa setelah Deployment baru, gunakan bagian ini untuk mengidentifikasi revisi mana yang aktif. Kemudian, Anda dapat membandingkan konfigurasi revisi saat ini dengan revisi sebelumnya untuk menentukan sumber masalah. Jika tab ini tidak terlihat, workload adalah jenis yang tidak menggunakan revisi atau belum memiliki update.
Jika Deployment tampaknya gagal, buka tab Events. Halaman ini sering kali menjadi sumber informasi yang paling berharga karena menampilkan peristiwa tingkat Kubernetes.
Untuk melihat log aplikasi Anda, klik tab Logs. Halaman ini membantu Anda memahami apa yang terjadi di dalam cluster. Lihat di sini untuk menemukan pesan error dan stack trace yang dapat membantu Anda mendiagnosis masalah.
Untuk mengonfirmasi apa yang di-deploy, lihat tab YAML. Halaman ini menampilkan manifes YAML aktif untuk workload sebagaimana adanya di cluster. Informasi ini berguna untuk menemukan perbedaan dari manifes yang dikontrol sumber Anda. Jika Anda melihat manifes YAML satu Pod, tab ini juga menampilkan status Pod, yang memberikan insight tentang kegagalan tingkat Pod.
Langkah berikutnya
Baca Menyelidiki status cluster dengan
kubectl(halaman berikutnya dalam rangkaian ini).Lihat penerapan konsep ini dalam contoh skenario pemecahan masalah.
Untuk mendapatkan saran tentang cara menyelesaikan masalah tertentu, tinjau panduan pemecahan masalah GKE.
Jika Anda tidak dapat menemukan solusi untuk masalah Anda dalam dokumentasi, lihat Mendapatkan dukungan untuk mendapatkan bantuan lebih lanjut, termasuk saran tentang topik berikut:
- Membuka kasus dukungan dengan menghubungi Cloud Customer Care.
- Mendapatkan dukungan dari komunitas dengan
mengajukan pertanyaan di StackOverflow
dan menggunakan tag
google-kubernetes-engineuntuk menelusuri masalah serupa. Anda juga dapat bergabung ke channel Slack#kubernetes-engineuntuk mendapatkan dukungan komunitas lainnya. - Membuka masalah atau permintaan fitur menggunakan issue tracker publik.