Halaman ini menunjukkan cara melakukan operasi peluncuran inkremental, yang secara bertahap men-deploy versi baru infrastruktur inferensi Anda, untuk GKE Inference Gateway. Gateway ini memungkinkan Anda melakukan update yang aman dan terkontrol ke infrastruktur inferensi. Anda dapat mengupdate node, model dasar, dan adaptor LoRA dengan gangguan layanan minimal. Halaman ini juga memberikan panduan tentang pembagian traffic dan rollback untuk memastikan deployment yang andal.
Halaman ini ditujukan untuk Admin akun dan ID GKE serta Developer yang ingin melakukan operasi peluncuran untuk GKE Inference Gateway.
Kasus penggunaan berikut didukung:
Meluncurkan update node
Update node memigrasikan workload inferensi dengan aman ke konfigurasi hardware atau akselerator node baru. Proses ini terjadi secara terkontrol tanpa mengganggu layanan model. Gunakan update node untuk meminimalkan gangguan layanan selama upgrade hardware, update driver, atau penyelesaian masalah keamanan.
Buat
InferencePoolbaru: deployInferencePoolyang dikonfigurasi dengan spesifikasi hardware atau node yang diupdate.Membagi traffic menggunakan
HTTPRoute: konfigurasiHTTPRouteuntuk mendistribusikan traffic antara resourceInferencePoolyang ada dan yang baru. Gunakan kolomweightdibackendRefsuntuk mengelola persentase traffic yang diarahkan ke node baru.Mempertahankan
InferenceObjectiveyang konsisten: pertahankan konfigurasiInferenceObjectiveyang ada untuk memastikan perilaku model yang seragam di kedua konfigurasi node.Mempertahankan resource asli: pertahankan
InferencePooldan node asli tetap aktif selama peluncuran untuk mengaktifkan rollback jika diperlukan.
Misalnya, Anda dapat membuat InferencePool baru bernama llm-new. Konfigurasikan pool ini dengan konfigurasi model yang sama dengan InferencePool llm yang ada. Deploy pool di kumpulan node baru dalam cluster Anda. Gunakan
objek HTTPRoute untuk membagi traffic antara llm asli dan llm-new InferencePool yang baru. Teknik ini memungkinkan Anda mengupdate node model secara bertahap.
Diagram berikut mengilustrasikan cara GKE Inference Gateway melakukan peluncuran update node.
Untuk melakukan peluncuran update node, ikuti langkah-langkah berikut:
Simpan manifes contoh berikut sebagai
routes-to-llm.yaml:apiVersion: gateway.networking.k8s.io/v1 kind: HTTPRoute metadata: name: routes-to-llm spec: parentRefs: - name: my-inference-gateway group: gateway.networking.k8s.io kind: Gateway rules: - backendRefs: - name: llm group: inference.networking.k8s.io kind: InferencePool weight: 90 - name: llm-new group: inference.networking.k8s.io kind: InferencePool weight: 10Terapkan manifes contoh ke cluster Anda:
kubectl apply -f routes-to-llm.yaml
InferencePool llm asli menerima sebagian besar traffic, sedangkan
InferencePool llm-new menerima sisanya. Tingkatkan bobot traffic secara bertahap untuk InferencePool llm-new guna menyelesaikan peluncuran update node.
Meluncurkan model dasar
Peluncuran update model dasar dilakukan secara bertahap ke LLM dasar baru, dengan tetap mempertahankan kompatibilitas dengan adaptor LoRA yang ada. Anda dapat menggunakan peluncuran update model dasar untuk mengupgrade ke arsitektur model yang ditingkatkan atau untuk mengatasi masalah khusus model.
Untuk meluncurkan update model dasar:
- Men-deploy infrastruktur baru: buat node baru dan
InferencePoolyang dikonfigurasi dengan model dasar baru yang Anda pilih. - Mengonfigurasi distribusi traffic: gunakan
HTTPRouteuntuk membagi traffic antaraInferencePoolyang ada (yang menggunakan model dasar lama) danInferencePoolbaru (menggunakan model dasar baru). KolombackendRefs weightmengontrol persentase traffic yang dialokasikan ke setiap pool. - Mempertahankan
InferenceObjectiveintegritas: pertahankan konfigurasiInferenceObjectiveAnda tidak berubah. Pendekatan ini membantu memastikan bahwa sistem menerapkan adaptor LoRA yang sama secara konsisten di kedua versi model dasar. - Mempertahankan kemampuan rollback: pertahankan node asli dan
InferencePoolselama peluncuran untuk memfasilitasi rollback jika diperlukan.
Anda membuat InferencePool baru bernama llm-pool-version-2. Pool ini men-deploy versi baru model dasar pada kumpulan node baru. Dengan
mengonfigurasi HTTPRoute, seperti yang ditunjukkan dalam contoh yang diberikan, Anda dapat
membagi traffic secara bertahap antara llm-pool asli dan
llm-pool-version-2. Hal ini memungkinkan Anda mengontrol update model dasar di cluster.
Untuk melakukan peluncuran update model dasar, ikuti langkah-langkah berikut:
Simpan manifes contoh berikut sebagai
routes-to-llm.yaml:apiVersion: gateway.networking.k8s.io/v1 kind: HTTPRoute metadata: name: routes-to-llm spec: parentRefs: - name: my-inference-gateway group: gateway.networking.k8s.io kind: Gateway rules: - backendRefs: - name: llm-pool group: inference.networking.k8s.io kind: InferencePool weight: 90 - name: llm-pool-version-2 group: inference.networking.k8s.io kind: InferencePool weight: 10Terapkan manifes contoh ke cluster Anda:
kubectl apply -f routes-to-llm.yaml
InferencePool llm-pool asli menerima sebagian besar traffic, sedangkan
InferencePool llm-pool-version-2 menerima sisanya. Tingkatkan bobot traffic secara bertahap untuk InferencePool llm-pool-version-2 guna menyelesaikan peluncuran update model dasar.