Wichtige Konzepte für Managed Service for Apache Spark

In diesem Dokument werden die wichtigsten Konzepte, grundlegenden Bausteine, Kernfunktionen und Vorteile von Managed Service for Apache Spark erläutert. Wenn Sie diese Grundlagen kennen, können Sie Managed Service for Apache Spark effektiv für Ihre Datenverarbeitungsaufgaben nutzen.

Das clusterbasierte Modell

Managed Service for Apache Spark in Clustern ist die standardmäßige, infrastrukturorientierte Methode zur Verwendung von Managed Service for Apache Spark. Sie erhalten die vollständige Kontrolle über einen dedizierten Satz virtueller Maschinen für Ihre Datenverarbeitungsaufgaben.

  • Cluster: Ein Cluster ist Ihre persönliche Datenverarbeitungs-Engine, die aus Cloud de Confiance by S3NS virtuellen Maschinen besteht. Sie erstellen einen Cluster, um Open-Source-Frameworks wie Apache Spark und Apache Hadoop auszuführen. Sie haben die volle Kontrolle über die Clustergröße, die Maschinentypen und die Konfiguration.
  • Jobs: Ein Job ist eine bestimmte Aufgabe, z. B. ein PySpark-Script oder eine Hadoop-Abfrage. Anstatt einen Job direkt in einem Cluster auszuführen, senden Sie den Job an Managed Service for Apache Spark, der die Jobausführung für Sie verwaltet. Sie können mehrere Jobs an den Cluster senden.
  • Workflowvorlagen: Eine Workflowvorlage ist eine wiederverwendbare Definition, mit der eine Reihe von Jobs (ein Workflow) orchestriert wird. Damit können Abhängigkeiten zwischen Jobs definiert werden, z. B. um einen Machine-Learning-Job erst auszuführen, wenn ein Job zur Datenbereinigung erfolgreich abgeschlossen wurde. Der Workflow kann auf einem vorhandenen Cluster oder auf einem temporären (sitzungsspezifischen) Cluster ausgeführt werden, der zum Ausführen des Workflows erstellt und nach Abschluss des Workflows gelöscht wird. Sie können die Vorlage verwenden, um den definierten Workflow bei Bedarf auszuführen.
  • Autoscaling-Richtlinien: Eine Autoscaling-Richtlinie enthält Regeln, die Sie definieren, um Worker-Maschinen basierend auf der Clusterarbeitslast zu einem Cluster hinzuzufügen oder daraus zu entfernen. So können Sie die Clusterkosten und -leistung dynamisch optimieren.

Anpassung der Umgebung

Managed Service for Apache Spark in Clustern bietet Clusterfunktionen und Komponenten, mit denen Sie Ihre Anwendungsumgebung anpassen können.

Notebook- und Entwicklungsumgebungen

Serverlose Notebooks und IDEs von Managed Service for Apache Spark sind mit integrierten Entwicklungsumgebungen verknüpft, in denen Sie Ihren Code schreiben und ausführen können.

  • BigQuery Studio und Workbench: Dies sind einheitliche Analyse- und Notebook-Umgebungen. Damit können Sie Code (z. B. in einem Jupyter-Notebook) schreiben und einen Managed Service for Apache Spark-Cluster oder eine serverlose Sitzung als leistungsstarke Backend-Engine verwenden, um Ihren Code für große Datasets auszuführen.
  • Managed Service for Apache Spark JupyterLab-Plug-in: Dieses offizielle JupyterLabextension dient als Steuerfeld für Serverless for Apache Spark in Ihrer Notebook-Umgebung. Sie können Cluster durchsuchen, erstellen und verwalten sowie Jobs senden, ohne die Jupyter-Oberfläche zu verlassen.
  • Google Cloud Data Agent Kit: Mit dem Data Agent Kit können Data Scientists, Engineers und Entwickler den gesamten Lebenszyklus ihrer Daten-Workloads in ihrer IDE verwalten. Das Data Agent Kit bietet Unterstützung für Managed Service for Apache Spark. So können Sie Code entwickeln, interaktive Sitzungen erstellen und Pipelines erstellen – direkt in VS Code oder einer unterstützten Agent-CLI.
  • Python-Connector für Managed Service for Apache Spark Connect: Diese Python-Bibliothek vereinfacht die Verwendung von Spark Connect mit Managed Service for Apache Spark. Sie übernimmt die Authentifizierung und Endpunktkonfiguration und macht es so viel einfacher, Ihre lokale Python-Umgebung, z. B. ein Notebook oder eine IDE, für die interaktive Entwicklung mit einem Remote-Cluster von Managed Service for Apache Spark zu verbinden.