Dokumen ini membantu Anda memahami manfaat dan model tanggung jawab bersama untuk men-deploy dan mengelola cluster Slurm di Google Kubernetes Engine (GKE). Slurm adalah pengelola workload dan penjadwal tugas open source yang sangat skalabel dan berfokus pada workload komputasi berperforma tinggi (HPC).
Dokumen ini berfokus pada add-on Slurm Operator untuk GKE, yang mengintegrasikan antarmuka Slurm untuk tugas batch dengan skalabilitas dan pengelolaan resource yang efisien di GKE.
Dokumen ini ditujukan bagi Administrator, Operator, dan Developer Data yang ingin mengaktifkan dan mengonfigurasi Slurm dengan add-on Slurm Operator untuk GKE.
Alasan menggunakan Slurm di GKE
Dengan menjalankan Slurm di GKE, Anda dapat menyiapkan lingkungan tempat tugas pelatihan Slurm dapat berjalan secara paralel dengan workload Kubernetes lainnya, seperti tugas Ray atau penayangan inferensi, di kumpulan komputasi bersama yang sama.
Cloud de Confiance by S3NS menawarkan cara berikut untuk menjalankan Slurm di GKE:
Cluster Director: solusi terkelola yang memberikan pengalaman yang telah dikonfigurasi sebelumnya dan memiliki opini. Sebaiknya gunakan Cluster Director jika Anda menginginkan pengalaman terkelola dengan konfigurasi minimal, di mana Google mengelola bidang kontrol Slurm, versi software, dan konfigurasi. Untuk mengetahui informasi selengkapnya, lihat Cluster Director.
Add-on Slurm Operator untuk GKE: teknologi open source yang dikembangkan sebagai bagian dari project Slinky open source, menawarkan penginstalan terkelola Slurm Operator. Penginstalan terkelola ini mengikuti praktik terbaik Google. Add-on Slurm Operator untuk GKE membantu engineer platform yang ingin membangun platform kustom yang menjalankan workload kecerdasan buatan (AI), machine learning (ML), dan HPC di mesin yang dioptimalkan akselerator. Sebaiknya gunakan add-on Slurm Operator untuk GKE jika Anda memerlukan kontrol penuh atas konfigurasi Slurm, ingin mengintegrasikan container kustom, atau perlu menjalankan Slurm dengan workload lain, seperti Ray atau inferensi, di cluster yang sama. Add-on Slurm Operator untuk GKE memiliki manfaat berikut:
- Infrastruktur terpadu: Anda dapat mengelola satu cluster GKE untuk tugas batch HPC dan microservice. Hal ini akan mengurangi hambatan operasional.
- Penskalaan yang efisien: add-on Slurm Operator untuk GKE menggunakan penyediaan node cepat dan bin-packing yang efisien dari GKE untuk mengoptimalkan penggunaan resource.
- Hardware berperforma tinggi: Anda dapat mengakses akselerator terbaru Cloud de Confiance by S3NS, seperti TPU dan GPU, dengan menggunakan perintah Slurm.
Bagian berikut dalam dokumen ini berfokus pada add-on Slurm Operator.
Memahami lapisan infrastruktur
Biasanya, Slurm di-deploy langsung di server bare metal atau VM. Dalam penyiapan ini, Slurm mengasumsikan serangkaian node yang relatif statis yang dikelolanya selama durasi siklus prosesnya.
Di sisi lain, GKE adalah layanan terkelola yang mengabstraksi VM yang mendasarinya dengan menampilkannya sebagai node dalam pool dinamis. GKE menangani penjadwalan dan penskalaan node ini secara otomatis.
Dengan add-on Slurm Operator untuk GKE, Slurm berjalan sebagai workload di atas GKE. Dalam model ini, GKE dan Slurm menyediakan kemampuan berikut:
- GKE sebagai pengelola infrastruktur: GKE menyediakan dan mengelola node, jaringan, dan keamanan yang mendasarinya.
- Slurm sebagai pengelola beban kerja: Slurm menyediakan antarmuka bagi pengguna untuk mengirim dan mengelola tugas batch.
Konvergensi ini menciptakan stack heterogen tempat tugas Slurm dapat berbagi hardware pokok yang sama (seperti GPU dan TPU) dengan aplikasi Kubernetes, seperti Ray atau inference serving.
Cara kerja add-on Slurm Operator
Saat Anda mengaktifkan add-on Slurm Operator untuk GKE di cluster GKE Anda, GKE akan melakukan langkah-langkah berikut:
- GKE menginstal dan menghosting Slurm Operator. Operator ini berjalan di bidang kontrol GKE dan mengelola siklus proses komponen Slurm yang di-deploy di cluster Anda. Operator ini secara otomatis menangani prasyarat seperti pembuatan sertifikat dan pengelolaan resource kustom.
- Setelah operator berjalan, Anda menentukan topologi cluster Slurm menggunakan resource kustom Kubernetes.
- Operator men-deploy Pod yang diperlukan—seperti pengontrol, login, dan pekerja—agar sesuai dengan spesifikasi workload Anda.
Resource kustom
Add-on Slurm Operator untuk GKE menggunakan resource kustom berikut untuk mengelola cluster Slurm:
- NodeSet: menentukan sekumpulan node pekerja yang homogen. Anda dapat memetakan pekerja Slurm ke jenis hardware atau kumpulan node GKE tertentu. Misalnya, Anda dapat membuat NodeSet untuk GPU H100 dan NodeSet lain untuk TPU.
- Controller: menentukan komponen inti Slurm Cluster, yaitu
Controller. Resource ini membuat komponen
slurmctlddi Pod dan semua komponen lainnya, seperti NodeSet atau LoginSet. - LoginSet: menentukan node login tempat pengguna login untuk mengirimkan tugas.
- Restapi: menentukan komponen REST API dari Slurm Cluster.
- Akuntansi: jika dikonfigurasi, men-deploy komponen
slurmdbduntuk menangani akuntansi tugas dan pelacakan penggunaan, biasanya terhubung ke database Cloud SQL.
Tanggung jawab bersama add-on Slurm Operator
Saat Anda memilih untuk menjalankan Slurm di GKE dengan add-on Slurm Operator untuk GKE, Cloud de Confiance by S3NS dan Anda berbagi tanggung jawab. Integrasi ini memberi Anda fleksibilitas untuk menyesuaikan lingkungan, sementara Google mengelola lapisan orkestrasi.
Tanggung jawab Google
- Siklus proses operator: menginstal Slurm Operator.
- Bidang kontrol GKE: mengelola keandalan dan waktu aktif bidang kontrol GKE.
- Kubernetes CustomResourceDefinition: mengelola resource kustom yang diperlukan untuk Slurm.
- Image dasar: menyediakan image container milik Google yang dioptimalkan untuk komponen Slurm. Penggunaan image ini bersifat opsional; saat mengonfigurasi cluster Slurm, Anda dapat menggunakan image yang disediakan Google ini atau menggunakan image Anda sendiri.
Tanggung jawab pelanggan
- Konfigurasi Slurm: tentukan topologi, partisi, batas, dan plugin cluster Slurm menggunakan file YAML.
- Pengiriman tugas: mengelola akses pengguna dan alur kerja pengiriman tugas.
- Image kustom: mempertahankan image container kustom yang digunakan untuk login atau node pekerja jika image Google default tidak memenuhi persyaratan tertentu.
- Dependensi eksternal: mengelola resource eksternal seperti Cloud SQL untuk akuntansi atau Filestore untuk penyimpanan bersama.
Untuk mengetahui informasi selengkapnya, lihat Tanggung jawab bersama GKE.
Langkah berikutnya
Untuk mulai menggunakan add-on Slurm Operator untuk GKE, lakukan hal berikut:
- Pelajari cara men-deploy cluster Slurm di GKE.
- Pelajari cara mengaktifkan add-on Slurm Operator.