במסמך הזה מוסברים המושגים המרכזיים, אבני הבניין הבסיסיות, התכונות העיקריות והיתרונות של Managed Service for Apache Spark. הבנת העקרונות האלה תעזור לכם להשתמש ביעילות ב-Managed Service for Apache Spark למשימות עיבוד הנתונים שלכם.
המודל מבוסס-האשכולות
Managed Service for Apache Spark on clusters (שירות מנוהל ל-Apache Spark באשכולות) הוא הדרך הרגילה והממוקדת בתשתית לשימוש ב-Managed Service for Apache Spark. הוא מאפשר לכם שליטה מלאה במערך ייעודי של מכונות וירטואליות למשימות עיבוד הנתונים.
- אשכולות: אשכול הוא מנוע לעיבוד מידע אישי, שמורכב Cloud de Confiance by S3NS ממכונות וירטואליות. אתם יוצרים אשכול כדי להריץ מסגרות קוד פתוח כמו Apache Spark ו-Apache Hadoop. יש לכם שליטה מלאה על גודל האשכול, סוגי המכונות וההגדרה.
- משימות (Jobs): משימה היא פעולה ספציפית, כמו סקריפט PySpark או שאילתת Hadoop. במקום להריץ משימה ישירות באשכול, שולחים את המשימה אל Managed Service for Apache Spark, שמנהל את ביצוע המשימה בשבילכם. אפשר לשלוח כמה משימות לאשכול.
- Workflow Templates: תבנית של תהליך עבודה היא הגדרה לשימוש חוזר שמתזמרת סדרה של משימות (תהליך עבודה). הוא יכול להגדיר תלות בין משימות, למשל להפעיל משימת למידת מכונה רק אחרי שמשימת ניקוי נתונים מסתיימת בהצלחה. אפשר להפעיל את תהליך העבודה מבוסס התבנית באשכול קיים או באשכול זמני (חולף) שנוצר כדי להפעיל את תהליך העבודה, ואז נמחק אחרי שתהליך העבודה מסתיים. אפשר להשתמש בתבנית כדי להפעיל את תהליך העבודה המוגדר בכל פעם שצריך.
- מדיניות של שינוי גודל אוטומטי: מדיניות של שינוי גודל אוטומטי מכילה כללים שאתם מגדירים כדי להוסיף או להסיר מכונות עובד מאשכול על סמך עומס העבודה באשכול, במטרה לבצע אופטימיזציה דינמית של העלות והביצועים של האשכול.
התאמה אישית של הסביבה
Managed Service for Apache Spark on clusters מציע תכונות של אשכולות ורכיבים שאפשר להשתמש בהם כדי להתאים אישית את סביבת האפליקציה.
סביבות פיתוח ונוטבוקים
מסמכי Notebook וסביבות פיתוח משולבות (IDE) של Managed Service for Apache Spark serverless מקושרים לסביבות פיתוח משולבות שבהן אפשר לכתוב ולהריץ את הקוד.
- BigQuery Studio ו-Workbench: אלה סביבות מאוחדות לניתוח נתונים ול-Notebook. הם מאפשרים לכם לכתוב קוד (לדוגמה, ב-Jupyter notebook) ולהשתמש באשכול של Managed Service for Apache Spark או בסשן בלי שרת (serverless) בתור מנוע קצה עורפי (backend) רב-עוצמה להרצת הקוד במערכי נתונים גדולים.
- Managed Service for Apache Spark JupyterLab Plugin: התוסף הרשמי הזה של
JupyterLabextensionמשמש כלוח בקרה ל-Managed Service for Apache Spark serverless בסביבת המחברת. הוא מפשט את תהליך העבודה בכך שהוא מאפשר לכם לעיין באשכולות, ליצור ולנהל אותם ולהגיש משימות בלי לצאת מהממשק של Jupyter. - Google Cloud Data Agent Kit: Data Agent Kit מאפשר למדעני נתונים, למהנדסים ולמפתחים לנהל את כל מחזור החיים של עומס העבודה של הנתונים בסביבת הפיתוח המשולבת שלהם. ערכת Data Agent Kit מספקת תמיכה ב-Managed Service for Apache Spark, ומאפשרת לכם לפתח קוד, ליצור סשנים אינטראקטיביים ולבנות צינורות נתונים ישירות מ-VS Code או מ-CLI נתמך של סוכן.
- Managed Service for Apache Spark Connect Python Connector: ספריית Python הזו מייעלת את תהליך השימוש ב-Spark Connect עם Managed Service for Apache Spark. הוא מטפל באימות ובהגדרת נקודות קצה, ולכן הרבה יותר פשוט לחבר את סביבת Python המקומית, כמו מחברת או IDE, לאשכול מרוחק של Managed Service for Apache Spark לפיתוח אינטראקטיבי.