Einführung in KI‑/ML-Arbeitslasten in GKE

Auf dieser Seite finden Sie eine konzeptionelle Übersicht über die Google Kubernetes Engine (GKE) für KI-/ML-Arbeitslasten. Die GKE ist eine von Google verwaltete Implementierung der Open-Source-Plattform zur Containerorchestrierung Kubernetes.

Die Google Kubernetes Engine bietet eine skalierbare, flexible und kostengünstige Plattform für die Ausführung aller Ihrer containerisierten Arbeitslasten, einschließlich Anwendungen für künstliche Intelligenz und maschinelles Lernen (KI/ML). Ob Sie große Foundation Models trainieren, Inferenzanfragen in großem Maßstab bereitstellen oder eine umfassende KI-Plattform entwickeln – die GKE bietet Ihnen die Kontrolle und Leistung, die Sie benötigen.

Diese Seite richtet sich an Daten- und KI-Experten, Cloud-Architekten, Operatoren und Entwickler, die nach einer skalierbaren, automatisierten und verwalteten Kubernetes-Lösung zum Ausführen von KI-/ML-Arbeitslasten suchen. Weitere Informationen zu gängigen Rollen finden Sie unter Häufig verwendete GKE-Nutzerrollen und -Aufgaben.

Erste Schritte mit KI-/ML-Arbeitslasten in der GKE

Sie können die GKE in wenigen Minuten kennenlernen, indem Sie die kostenlose Stufe der GKE verwenden, um mit Kubernetes zu beginnen, ohne dass Kosten für die Clusterverwaltung anfallen.

  1. Erste Schritte in der Cloud de Confiance Konsole

  2. Probieren Sie diese Kurzanleitungen aus:
    • Inferenz in der GKE: Stellen Sie ein großes KI-Sprachmodell (LLM) in der GKE für die Inferenz mit einer vordefinierten Architektur bereit.
    • Training in der GKE: Stellen Sie ein KI-Trainingsmodell in der GKE bereit und speichern Sie die Vorhersagen in Cloud Storage.
  3. Lesen Sie die Informationen zu Optionen für den Verbrauch von Beschleunigern für KI-/ML-Arbeitslasten. Dort finden Sie Anleitungen und Ressourcen zum Planen und Beschaffen von Beschleunigern (GPUs und TPUs) für Ihre Plattform.
  4. Lassen Sie sich von KI bei der Planung und Gestaltung der Infrastruktur für Ihre GKE-Cluster unterstützen, indem Sie Gemini in der Cloud de Confiance Konsole auffordern. Weitere Informationen finden Sie unter GKE-Cluster mit Gemini entwerfen und optimieren.

Gängige Anwendungsfälle

Die GKE bietet eine einheitliche Plattform, die alle Ihre KI-Arbeitslasten unterstützen kann.

  • KI-Plattform entwickeln: Für Enterprise-Plattformteams bietet die GKE die Flexibilität, eine standardisierte Plattform für mehrere Mandanten zu entwickeln, die unterschiedliche Anforderungen erfüllt.
  • Onlinebereitstellung mit niedriger Latenz: Für Entwickler, die generative KI Anwendungen entwickeln, bietet die GKE mit dem Inference Gateway das optimierte Routing und die automatische Skalierung, die erforderlich sind, um eine reaktionsschnelle Nutzererfahrung zu bieten und gleichzeitig die Kosten zu kontrollieren.

Die richtige Plattform für Ihre KI-/ML-Arbeitslast auswählen

Cloud de Confiance by S3NS bietet eine Reihe von KI-Infrastrukturprodukten, die Ihre ML-Reise unterstützen, von vollständig verwaltet bis vollständig konfigurierbar. Die Wahl der richtigen Plattform hängt von Ihren spezifischen Anforderungen an Kontrolle, Flexibilität und Verwaltungsaufwand ab.

Best Practice:

Wählen Sie die GKE aus, wenn Sie umfassende Kontrolle, Portabilität und die Möglichkeit benötigen, eine benutzerdefinierte, leistungsstarke KI-Plattform zu entwickeln.

  • Infrastrukturkontrolle und -flexibilität: Sie benötigen ein hohes Maß an Kontrolle über Ihre Infrastruktur, müssen benutzerdefinierte Pipelines verwenden oder Anpassungen auf Kernelebene vornehmen.
  • Training und Inferenz in großem Maßstab: Sie möchten sehr große Modelle trainieren oder Modelle mit minimaler Latenz bereitstellen, indem Sie die Skalierungs- und Hochleistungsfunktionen der GKE nutzen.
  • Kosteneffizienz in großem Maßstab: Sie möchten die Kostenoptimierung priorisieren, indem Sie die Integration der GKE mit Spot-VMs und Flex-Start-VMs nutzen, um die Kosten effektiv zu verwalten.
  • Portabilität und offene Standards: Sie möchten eine Anbieterabhängigkeit vermeiden und Ihre Arbeitslasten überall mit Kubernetes ausführen. Außerdem verfügen Sie bereits über Kubernetes-Kenntnisse oder eine Multi-Cloud-Strategie.

Sie können auch diese Alternativen in Betracht ziehen:

Cloud de Confiance by S3NS -Dienst Optimal für
Vertex AI Eine vollständig verwaltete End-to-End-Plattform, mit der Sie die Entwicklung beschleunigen und die Infrastrukturverwaltung auslagern können. Gut geeignet für Teams, die sich auf MLOps und eine schnelle Wertschöpfung konzentrieren. Weitere Informationen finden Sie im Video Choosing between self-hosted GKE and managed Vertex AI host AI models.

Wie die GKE KI-/ML-Arbeitslasten unterstützt

Die GKE bietet eine Reihe spezialisierter Komponenten, die jede Phase des KI-/ML-Lebenszyklus vereinfachen und beschleunigen, vom Training in großem Maßstab bis zur Inferenz mit niedriger Latenz.

Im folgenden Diagramm befindet sich GKE in Cloud de Confiance by S3NSund kann verschiedene Cloud-Speicheroptionen (z. B. Cloud Storage FUSE und Managed Lustre) und verschiedene Cloud-Infrastrukturoptionen (z. B. Cloud TPU und Cloud-GPUs) verwenden. GKE ist auch mit Open-Source-Software und ‑Frameworks für Deep Learning (z. B. JAX oder TensorFlow), ML-Orchestrierung (z. B. Jupyter oder Ray) und LLM-Inferenz (z. B. vLLM oder NVIDIA Dynamo) kompatibel.
Abbildung 1: GKE als skalierbare verwaltete Plattform für KI-/ML-Arbeitslasten.

In der folgenden Tabelle sind die GKE-Funktionen zusammengefasst, die Ihre KI-/ML-Arbeitslasten oder Betriebsziele unterstützen.

KI-/ML-Arbeitslast oder -Vorgang Unterstützung durch die GKE Wichtige Features
Inferenz und Bereitstellung Optimiert für die elastische Bereitstellung von KI-Modellen mit niedriger Latenz, hohem Durchsatz und Kosteneffizienz.
  • Flexibilität bei Beschleunigern: Die GKE unterstützt sowohl GPUs für die Inferenz.
  • GKE Inference Gateway: Ein modellbewusstes Gateway, das intelligentes Routing und Lastenausgleich speziell für KI-Inferenzarbeitslasten bietet.
  • GKE Inference Quickstart: Ein Tool zur Vereinfachung der Leistungsanalyse und Bereitstellung, das eine Reihe von Benchmark-Profilen für gängige KI-Modelle bietet.
  • GKE Autopilot: Ein GKE-Betriebsmodus, der Clusteroperationen und die Kapazitätsanpassung automatisiert und so den Aufwand reduziert.
Training und Feinabstimmung Bietet die Skalierungs- und Orchestrierungsfunktionen, die erforderlich sind, um sehr große Modelle effizient zu trainieren und gleichzeitig die Kosten zu minimieren.
  • Schnellere Startknoten: Eine Optimierung speziell für GPU-Arbeitslasten, die die Startzeiten von Knoten um bis zu 80 % reduziert.
  • Kueue: Ein Kubernetes-natives Jobwarteschlangensystem, das die Ressourcenzuweisung, die Planung, das Kontingentmanagement und die Priorisierung für Batch-Arbeitslasten verwaltet.

Nächste Schritte

  • Informationen zu Techniken zum Beschaffen von Rechenbeschleunigern wie GPUs oder TPUs für Ihre KI-/ML-Arbeitslasten in der GKE.

  • Informationen zur KI-/ML-Modellinferenz in der GKE.

  • Experimentelle Beispiele zur Nutzung der GKE zur Beschleunigung Ihrer KI-/ML-Initiativen in den GKE AI Labs.

  • Details zu Ihren KI-/ML-Arbeitslasten in der Cloud de Confiance Konsole, einschließlich Ressourcen wie JobSets, RayJobs, PyTorchJobs und Bereitstellungen für die Inferenzbereitstellung.