ניהול צינורות עיבוד נתונים

במאמר הזה מוסבר איך לנהל צינורות נתונים של BigQuery, כולל איך להציג, לתזמן, לפרוס ולמחוק צינורות נתונים.

במסמך הזה מוסבר גם איך לצפות במטא-נתונים של פייפליינים בKnowledge Catalog ואיך לנהל אותם.

הצינורות מופעלים על ידי Dataform. אתם יכולים לארגן ולנהל צינורות נתונים שמאוחסנים בקבצים ותיקיות (תיקיות משתמשים ותיקיות צוות) או במאגרי Git של BigQuery Studio (תיקיות Git) (גרסת Preview).

לפני שמתחילים

  1. יצירת צינור עיבוד נתונים ב-BigQuery.
  2. כדי לנהל את המטא-נתונים של צינורות העברת נתונים ב-Knowledge Catalog, צריך לוודא ש-Dataplex API מופעל בפרויקט Cloud de Confiance .

התפקידים הנדרשים

כדי לקבל את ההרשאות שדרושות לניהול צינורות, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:

להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.

יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.

מידע נוסף על IAM ב-Dataform זמין במאמר בקרת גישה באמצעות IAM. מידע נוסף על תפקידים בתיקיות זמין במאמר יצירה וניהול של תיקיות. במאמר ניהול קוד באמצעות מאגרי Git ב-BigQuery Studio יש מידע נוסף על תפקידים במאגרי Git.

אם משתמשים בחשבון שירות בהתאמה אישית כדי להריץ צינורות, צריך להקצות לחשבון השירות הזה את התפקידים הבאים:

  • ‫BigQuery Job User (roles/bigquery.jobUser) בפרויקט
  • BigQuery Data Editor (roles/bigquery.dataEditor) בפרויקט או במערכי נתונים ספציפיים של BigQuery
  • ‫Dataplex Catalog Editor (roles/dataplex.catalogEditor) בפרויקט או בקבוצת הרשומות @bigquery

הצגת צינורות עיבוד נתונים

אפשר לראות ולבדוק צינורות שמאוחסנים בתיקיות או בתיקיות Git בחלונית Files. אפשר לראות צינורות עצמאיים וצינורות שנשמרו בתיקיות בחלונית Explorer. צינורות (Pipelines) שמאוחסנים בתיקיות Git לא מוצגים בחלונית Explorer.

הצגת צינורות הנתונים בחלונית Files

צינורות שמאוחסנים בתיקיות או בתיקיות Git מופיעים ישירות בחלונית Files (קבצים).

כדי לראות צינור שמאוחסן בתיקייה או בתיקיית Git, פועלים לפי השלבים הבאים:

  1. במסוף Cloud de Confiance , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים.

    אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.

  3. מרחיבים את התיקייה User, את תיקיית הצוות או את התיקייה של מאגר Git המקושר.

    צינורות מוצגים עם סמל צינור במקום סמל תיקייה רגיל.

  4. לוחצים על תיקיית צינור כדי לפתוח את Pipeline Viewer.

    Pipeline Viewer מציג את הגרף האציקלי המכוון (DAG) שעבר קומפילציה של משימות צינור עיבוד הנתונים, את סטטוס ההפעלה ואת כרטיסיות ההגדרות.

  5. מרחיבים את ספריית הצינור בדפדפן הקבצים כדי לעיין בספריות מקוננות (כמו definitions/) ובקבצים של משימות ספציפיות.

הצגת צינורות הנתונים בחלונית Explorer

כדי לראות רשימה של צינורות עצמאיים וצינורות שמאוחסנים בתיקיות:

  1. במסוף Cloud de Confiance , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    הכפתור המודגש של חלונית Explorer.

    אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.

  3. בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.

  4. בוחרים צינור כדי לפתוח אותו בכלי לצפייה בצינורות.

איך רואים הפעלות ידניות קודמות

כדי לראות הפעלות ידניות קודמות של צינור נתונים נבחר:

  1. במסוף Cloud de Confiance , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    הכפתור המודגש של חלונית Explorer.

  3. בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.

  4. לוחצים על Executions (הרצות).

  5. אופציונלי: כדי לרענן את רשימת ההרצות הקודמות, לוחצים על רענון.

הגדרת התראות על הפעלות שנכשלו של צינורות עיבוד נתונים

לכל צינור יש מזהה מאגר תואם ב-Dataform. כל הרצה של צינור נתונים ב-BigQuery מתועדת ב-Cloud Logging באמצעות מזהה המאגר המתאים של Dataform. אתם יכולים להשתמש ב-Cloud Monitoring כדי לעקוב אחרי מגמות ביומנים של Cloud Logging לגבי הרצות של צינורות עיבוד נתונים ב-BigQuery, ולקבל התראה כשמתקיימים תנאים שאתם מגדירים.

כדי לקבל התראות כשריצת צינור ב-BigQuery נכשלת, אפשר ליצור מדיניות התראות מבוססת-יומן עבור מזהה מאגר Dataform המתאים. הוראות מפורטות זמינות במאמר בנושא הגדרת התראות על הפעלות של תהליכי עבודה שנכשלו.

כדי למצוא את מזהה מאגר Dataform של הצינור:

  1. במסוף Cloud de Confiance , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    הכפתור המודגש של חלונית Explorer.

  3. בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.

  4. לוחצים על הגדרות.

    מזהה מאגר Dataform של צינור העברת הנתונים מוצג בחלק התחתון של הכרטיסייה הגדרות.

מחיקת צינור עיבוד נתונים

כדי למחוק צינור באופן סופי:

  1. במסוף Cloud de Confiance , עוברים לדף BigQuery. כניסה ל-BigQuery
  • כדי למחוק צינור שמאוחסן בתיקייה או בתיקיית Git, מבצעים את הפעולות הבאות:

    1. בחלונית הימנית, לוחצים על קבצים.

    2. בעץ הקבצים, מוצאים את תיקיית הצינור שרוצים למחוק.

    3. לוחצים על הצגת פעולות לצד תיקיית הצינור, ואז לוחצים על מחיקה.

    4. בתיבת הדו-שיח לאישור, לוחצים על מחיקה.

      תיקיית הצינור וכל המשימות והקבצים שכלולים בה נמחקים ממרחב העבודה.

  • כדי למחוק צינור שמופיע בחלונית Explorer:

    1. בחלונית הימנית, לוחצים על כלי הניתוחים:

      הכפתור המודגש של חלונית Explorer.

    2. בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.

    3. מחפשים את צינור הנתונים שרוצים למחוק.

    4. לוחצים על הצגת פעולות לצד הצינור, ואז לוחצים על מחיקה.

    5. לוחצים על Delete.

ניהול מטא-נתונים ב-Knowledge Catalog

ב-Knowledge Catalog אפשר לאחסן ולנהל מטא-נתונים של צינורות. צינורות זמינים כברירת מחדל ב-Knowledge Catalog, ללא צורך בהגדרה נוספת.

אתם יכולים להשתמש ב-Knowledge Catalog כדי לנהל צינורות עיבוד נתונים בכל המיקומים של צינורות עיבוד הנתונים. ניהול צינורות ב-Knowledge Catalog כפוף למכסות ומגבלות של Knowledge Catalog ולתמחור של Knowledge Catalog.

‫Knowledge Catalog מאחזר באופן אוטומטי את המטא-נתונים הבאים מצינורות:

  • שם נכס הנתונים
  • נכס האב של נתוני הנכס
  • מיקום נכס הנתונים
  • סוג נכס הנתונים
  • פרויקט Cloud de Confiance מתאים

‫Knowledge Catalog מתעד צינורות כרשומות עם ערכי הרשומות הבאים:

קבוצת רשומות במערכת
קבוצת הכניסה למערכת של צינורות עיבוד הנתונים היא @dataform. כדי לראות את הפרטים של רשומות בפייפליין ב-Knowledge Catalog, צריך להציג את dataform קבוצת רשומות המערכת. הוראות לצפייה ברשימה של כל הרשומות בקבוצת רשומות מופיעות במאמר צפייה בפרטים של קבוצת רשומות במסמכי התיעוד של Knowledge Catalog.
סוג רשומת המערכת
סוג הרשומה במערכת של צינורות הוא dataform-code-asset. כדי לראות את הפרטים של צינורות, צריך להציג את סוג הרשומה במערכת dataform-code-asset, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדה type בתוך ההיבט dataform-code-asset לערך WORKFLOW. לאחר מכן בוחרים רשומה של הצינור שנבחר. הוראות לצפייה בפרטים של סוג רשומה נבחר מופיעות במאמר צפייה בפרטים של סוג רשומה במסמכי התיעוד של Knowledge Catalog. הוראות להצגת פרטים של רשומה נבחרת מופיעות במאמר הצגת פרטים של רשומה במסמכי Knowledge Catalog.
סוג ההיבט של המערכת
סוג ההיבט של המערכת של צינורות הוא dataform-code-asset. כדי לספק הקשר נוסף לצינורות ב-Knowledge Catalog באמצעות הוספת הערות לרשומות של צינורות נתונים עם היבטים, צריך להציג את סוג ההיבט dataform-code-asset, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדה type בתוך ההיבט dataform-code-asset לערך WORKFLOW. הוראות להוספת הערות עם היבטים לרשומות מפורטות במאמר ניהול היבטים והעשרת מטא-נתונים במסמכי התיעוד של Knowledge Catalog.
סוג
הסוג של לוחות ציור של נתונים הוא WORKFLOW. הסוג הזה מאפשר לסנן צינורות בdataform-code-asset סוג הרשומה של המערכת ובסוג ההיבט dataform-code-assetבאמצעות השאילתה ב aspect:dataplex-types.global.dataform-code-asset.type=WORKFLOW מסנן מבוסס-היבטים.

הוראות לחיפוש נכסים ב-Knowledge Catalog מופיעות במאמר חיפוש נכסי נתונים ב-Knowledge Catalog בתיעוד של Knowledge Catalog.

העשרה של מטא-נתונים ושילוב של כרטיס ניקוד לאיכות הנתונים

‫Dataform יכול לפרסם את המטא-נתונים הבאים ב-Knowledge Catalog:

  • סוג ההיבט בדף 'סקירה כללית'
  • סוג היבט גנרי
  • סוג ההיבט של כרטיס המידע לאיכות הנתונים

הצהרות של Dataform משולבות באופן אוטומטי עם כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog. במהלך הביצוע של צינור הנתונים, התוצאות של כל הצהרות (assertions) Dataform מתפרסמות באופן אוטומטי ב-Knowledge Catalog. התוצאות האלה מאכלסות את כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog עם סטטוס של הצלחה או כישלון.

כדי לבדוק את הסטטוס של עדכון מטא-נתונים, פועלים לפי ההוראות במאמר בנושא הצגת הפעלות ידניות קודמות.

אחרי שהמטא-נתונים מסונכרנים, אפשר לחפש את הרשומה ב-Knowledge Catalog ולצפות בה. מידע נוסף זמין במאמר בנושא חיפוש משאבים.

המאמרים הבאים