Dokumen ini menjelaskan konsep utama, elemen penyusun dasar, fitur inti, dan manfaat Managed Service untuk Apache Spark. Memahami dasar-dasar ini akan membantu Anda menggunakan Managed Service untuk Apache Spark secara efektif untuk tugas pemrosesan data Anda.
Model berbasis cluster
Managed Service untuk Apache Spark di cluster adalah cara standar yang berfokus pada infrastruktur untuk menggunakan Managed Service untuk Apache Spark. Hal ini memberi Anda kontrol penuh atas sekumpulan virtual machine khusus untuk tugas pemrosesan data Anda.
- Cluster: Cluster adalah mesin pemrosesan data pribadi Anda, yang terdiri dari Cloud de Confiance by S3NS virtual machine. Anda membuat cluster untuk menjalankan framework open source seperti Apache Spark dan Apache Hadoop. Anda memiliki kontrol penuh atas ukuran cluster, jenis mesin, dan konfigurasi.
- Tugas: Tugas adalah tugas tertentu, seperti skrip PySpark atau kueri Hadoop. Daripada menjalankan tugas secara langsung di cluster, Anda mengirimkan tugas ke Managed Service untuk Apache Spark, yang mengelola eksekusi tugas untuk Anda. Anda dapat mengirimkan beberapa tugas ke cluster.
- Template Alur Kerja: Template alur kerja adalah definisi yang dapat digunakan kembali yang mengorkestrasi serangkaian tugas (alur kerja). Dapat menentukan dependensi antar-tugas, misalnya untuk menjalankan tugas machine learning hanya setelah tugas pembersihan data berhasil diselesaikan. Alur kerja yang dibuat dari template dapat dijalankan di cluster yang ada atau di cluster sementara (efemeral) yang dibuat untuk menjalankan alur kerja, lalu dihapus setelah alur kerja selesai. Anda dapat menggunakan template untuk menjalankan alur kerja yang ditentukan kapan pun diperlukan.
- Kebijakan penskalaan otomatis: Kebijakan penskalaan otomatis berisi aturan yang Anda tentukan untuk menambahkan atau menghapus mesin pekerja dari cluster berdasarkan beban kerja cluster guna mengoptimalkan biaya dan performa cluster secara dinamis.
Penyesuaian lingkungan
Managed Service untuk Apache Spark di cluster menawarkan fitur dan komponen cluster yang dapat Anda gunakan untuk menyesuaikan lingkungan aplikasi.
Lingkungan notebook dan pengembangan
Notebook dan IDE serverless Managed Service untuk Apache Spark ditautkan ke lingkungan pengembangan terintegrasi tempat Anda dapat menulis dan mengeksekusi kode.
- BigQuery Studio & Workbench: Ini adalah lingkungan analisis dan notebook terpadu. Anda dapat menulis kode (misalnya di notebook Jupyter) dan menggunakan cluster Managed Service untuk Apache Spark atau sesi serverless sebagai mesin backend yang canggih untuk menjalankan kode Anda pada set data besar.
- Plugin JupyterLab Managed Service untuk Apache Spark: Plugin resmi
JupyterLabextensionini berfungsi sebagai panel kontrol untuk Managed Service untuk Apache Spark serverless di dalam lingkungan notebook Anda. Fitur ini menyederhanakan alur kerja Anda dengan memungkinkan Anda menjelajahi, membuat, dan mengelola cluster serta mengirimkan tugas tanpa harus keluar dari antarmuka Jupyter. - Google Cloud Data Agent Kit: Data Agent Kit memungkinkan data scientist, engineer, dan developer mengelola seluruh siklus proses workload data mereka dalam IDE. Data Agent Kit menyediakan dukungan untuk Managed Service untuk Apache Spark, sehingga Anda dapat mengembangkan kode, membuat sesi interaktif, dan membangun pipeline langsung dari VS Code atau CLI agentik yang didukung.
- Managed Service untuk Apache Spark Connect Python Connector: Library Python ini menyederhanakan proses penggunaan Spark Connect dengan Managed Service untuk Apache Spark. Hal ini menangani autentikasi dan konfigurasi endpoint, sehingga mempermudah koneksi lingkungan Python lokal Anda, seperti notebook atau IDE, ke cluster Managed Service untuk Apache Spark jarak jauh untuk pengembangan interaktif.