יצירת צינורות עיבוד נתונים
במאמר הזה מוסבר איך ליצור צינורות ב-BigQuery. הצינורות מופעלים על ידי Dataform.
לפני שמתחילים
-
In the Cloud de Confiance console, on the project selector page, select or create a Cloud de Confiance project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Cloud de Confiance project.
Enable the BigQuery, Dataform, and Vertex AI APIs, if any are not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
דרישות של VPC Service Controls
אם אתם משתמשים ב-VPC Service Controls כדי להגן על צינורות העברת הנתונים, חשוב לדעת שהרצות של צינורות העברת נתונים מבוססות על Dataform. כשמגדירים את VPC Service Controls להפעלות מתוזמנות, צריך לוודא שמתקיימות הדרישות הבאות:
- צריך להגדיר את
dataform.restrictGitRemotesשירות מדיניות הארגון. - ההגבלות על Dataform ו-BigQuery צריכות להיות מוגדרות על ידי אותו גבול גזרה לשירות של VPC Service Controls.
- כדי לאפשר למשתמשים לבצע אימות באמצעות פרטי הכניסה של חשבון Google שלהם כשהם מתזמנים או מפעילים ידנית ריצות, צריך להוסיף את זהויות המשתמשים שלהם לכללי הכניסה. מידע נוסף זמין במאמרים בנושא עדכון מדיניות של תעבורת נתונים נכנסת ויוצאת בגבולות גזרה לשירות והפניה לכללים של תעבורת נתונים נכנסת.
שלבי הגדרה מפורטים ושיקולי אבטחה זמינים במאמר הגדרת VPC Service Controls ל-Dataform.
התפקידים הנדרשים לצינורות עיבוד נתונים
כדי לקבל את ההרשאות שדרושות ליצירת צינורות, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:
-
כדי ליצור פייפליינים: Code Creator (
roles/dataform.codeCreator) בפרויקט -
כדי לערוך ולהריץ צינורות עיבוד נתונים:
Dataform Editor (
roles/dataform.editor) בפרויקט -
כדי ליצור צינורות בתיקיות משתמש:
- יצירת קוד (
roles/dataform.codeCreator) בפרויקט - בעלים של הקוד (
roles/dataform.codeOwner) בתיקייה - Code Editor (
roles/dataform.codeEditor) בתיקייה
- יצירת קוד (
-
כדי ליצור צינורות בתיקיות צוות:
- משתמש עם הרשאת עריכה בתיקיית צוות (
roles/dataform.teamFolderContributor) בתיקיית הצוות - בעלים של תיקיית צוות (
roles/dataform.teamFolderOwner) בתיקיית הצוות
- משתמש עם הרשאת עריכה בתיקיית צוות (
-
כדי לקשר מאגר Git לתיקיות Git:
Developer Connect OAuth User (
roles/developerconnect.oauthUser) בפרויקט
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.
מידע נוסף על IAM ב-Dataform זמין במאמר בקרת גישה באמצעות IAM.
מידע נוסף על תפקידים בתיקיות זמין במאמר יצירה וניהול של תיקיות.
במאמר ניהול קוד באמצעות מאגרי Git ב-BigQuery Studio יש מידע נוסף על תפקידים במאגרי Git.
התפקידים הנדרשים לאפשרויות של נוטבוק
כדי לקבל את ההרשאות שנדרשות לבחירת תבנית של סביבת ריצה באפשרויות של מחברת, צריך לבקש מהאדמין להקצות לכם ב-IAM את התפקיד משתמש בסביבת ריצה של מחברת (roles/aiplatform.notebookRuntimeUser) בפרויקט.
כדי לקרוא הסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.
אם אין לכם את התפקיד הזה, אתם יכולים לבחור את הגדרות ברירת המחדל של זמן הריצה של מחברת.
שיקולי אבטחה לגבי צינורות עיבוד נתונים
נכסי קוד ב-BigQuery מבוססים על Dataform, ולכן חשוב לשים לב להשלכות האבטחה הבאות עבור משתמשים שיש להם גישה לנכסים האלה:
- הגישה לנכסי קוד מנוהלת על ידי הרשאות Dataform ברמת הפרויקט. משתמשים עם ההרשאה
dataform.repositories.list– שכלולה בתפקידים רגילים ב-BigQuery כמו BigQuery Job User, BigQuery Studio User ו-BigQuery User – יכולים לראות את כל נכסי הקוד בחלונית Explorer של הפרויקט Cloud de Confiance , בלי קשר לשאלה אם הם יצרו את הנכסים האלה או שהנכסים האלה שותפו איתם. כדי להגביל את הנראות, אפשר ליצור תפקידים בהתאמה אישית שלא כוללים את ההרשאהdataform.repositories.list. - יכול להיות שמשתמשים שיש להם הרשאת עריכה בנכסים האלה יוכלו לגשת לסודות ששותפו עם סוכן השירות של Dataform. כדי לאבטח את פרטי הכניסה, צריך להגביל את הגישה ליצירה ולעריכה למשתמשים מהימנים, ולהגביל את הסודות שסוכן השירות של Dataform יכול לגשת אליהם. מידע נוסף זמין במאמר גישה לסודות במהלך התקנת חבילות.
מידע נוסף זמין במאמר בנושא שיקולי אבטחה לגבי הרשאות ב-Dataform.
הגדרת אזור ברירת המחדל לנכסי קוד
כל נכסי הקוד החדשים בפרויקט Cloud de Confiance משתמשים באזור ברירת מחדל. אחרי שיוצרים את הנכס, אי אפשר לשנות את האזור שלו.
כדי להגדיר את אזור ברירת המחדל לנכסי קוד חדשים:
עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים:
לצד שם הפרויקט, לוחצים על View files panel actions (הצגת פעולות בחלונית הקבצים) > Switch code region (החלפת אזור קוד).
בוחרים את אזור הקוד שרוצים להשתמש בו כברירת מחדל.
לוחצים על Save.
רשימת האזורים הנתמכים מופיעה במאמר בנושא מיקומים ב-BigQuery Studio.
יצירת פייפליין
אפשר ליצור ולשמור צינורות בדרכים הבאות:
- בתיקיות: אפשר לארגן את צינורות הנתונים בתיקיות אישיות או בתיקיות של צוות בחלונית Files ב-BigQuery Studio.
- בתיקיות Git ב-BigQuery Studio (גרסת Preview): אירוח, ניהול גרסאות וניהול של כמה צינורות עצמאיים או צינורות ברמת הבסיס בתיקייה עם מאגר Git שמקושר באמצעות Developer Connect.
- מסרגל הכרטיסיות של העורך: יוצרים צינור מתוך התפריט + בעורך השאילתות.
- בדף 'צינורות וחיבורים' (תצוגה מקדימה): אפשר ליצור צינור באמצעות תהליך עבודה יעיל שספציפי ל-BigQuery.
יצירת פייפליין בתיקייה
אתם יכולים ליצור צינורות נתונים ולארגן אותם ישירות בתיקיות המשתמש האישיות או בתיקיות הצוות המשותפות ב-BigQuery Studio. מידע נוסף על תיקיות זמין במאמר ארגון נכסי קוד באמצעות תיקיות.
כדי ליצור צינור עיבוד בתיקייה, פועלים לפי השלבים הבאים:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים.
אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
כדי ליצור צינור, מבצעים אחת מהפעולות הבאות:
- בוחרים את תיקיית המשתמש או את תיקיית הצוות שבה רוצים למקם את הצינור, לוחצים על הלחצן + (יצירה) בסרגל הכלים ובוחרים באפשרות צינור.
- בעץ הקבצים, לוחצים על הצגת פעולות לצד שם התיקייה, בוחרים באפשרות יצירה > צינור עיבוד נתונים.
- פותחים תיקייה כדי לראות את התוכן שלה בחלונית הראשית, ולוחצים על Create Pipeline.
בתיבת הדו-שיח ליצירה, מזינים שם לצינור.
לוחצים על יצירה. תיקיית צינור חדשה מופיעה בעץ הקבצים עם הסמל Pipeline.
לוחצים על תיקיית הצינור כדי לפתוח את כלי הצגת הצינור, ואז מגדירים את הגדרות הצינור.
יצירת צינור עיבוד נתונים במאגר Git
אתם יכולים ליצור ולנהל צינורות ישירות בתיקיות שמשולבות עם Git ב-BigQuery Studio. תיקיית Git מייצגת מאגר GitHub או GitLab מרוחק שמקושר ל-BigQuery Studio באמצעות Developer Connect. אתם יכולים לארח ולארגן כמה צינורות עצמאיים במאגר Git אחד. צינורות של מאגרי Git תומכים בפריסות של Dataform לתזמון, להגדרות של גרסאות ולתיאום בין סביבות מרובות.
כדי ליצור צינור עיבוד נתונים בתיקיית Git, פועלים לפי השלבים הבאים:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
אם עדיין לא קישרתם את מאגר ה-Git, צריך ליצור מאגר Git ב-BigQuery Studio ולקשר אותו.
בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים.
בעץ הקבצים, מאתרים את תיקיית מאגר ה-Git המקושר או ספרייה מקוננת בתוכה.
לצד שם התיקייה, לוחצים על הצגת פעולות ובוחרים באפשרות יצירה > צינור עיבוד נתונים.
בתיבת הדו-שיח, מזינים את שם הצינור ולוחצים על שמירה.
נוצרת ספרייה חדשה של צינור, והיא מאותחלת עם קובצי ברירת המחדל:
-
workflow_settings.yaml: הגדרת צינור עיבוד נתונים. -
definitions/actions.yaml: הגדרות ריקות של משימות.
-
לוחצים על ספריית הצינור בדפדפן הקבצים כדי לפתוח את כלי הצפייה בצינור.
יצירת פייפליין מסרגל הכרטיסיות של העורך
כדי ליצור צינור דרך סרגל הכרטיסיות של העורך:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בסרגל הכרטיסיות של חלונית העריכה, לוחצים על החץ לצד הסימן + ואז על Pipeline.
אופציונלי: כדי לשנות את השם של צינור הנתונים, לוחצים על השם שלו ומקלידים שם חדש.
מגדירים את הגדרות צינור עיבוד הנתונים.
יצירת פייפליין מהדף 'פייפליינים וחיבורים'
אפשר להשתמש בדף Pipelines & Connections ב-BigQuery במסוף Cloud de Confiance כדי ליצור צינור Dataform שמשתמש בתהליך עבודה יעיל שספציפי ל-BigQuery. התכונה הזו נמצאת בגרסת טרום-השקה.
הוראות ליצירת צינור מהדף Pipelines & Connections (צינורות וחיבורים) ב-BigQuery זמינות במאמר יצירת נכס לשילוב נתונים.
הגדרת צינור עיבוד הנתונים
כדי להגדיר את ההגדרות של צינור הנתונים, פותחים את צינור הנתונים בכלי להצגת צינורות נתונים, לוחצים על הכרטיסייה הגדרות ומגדירים את הקטעים הבאים:
בקטע Authentication (אימות), בוחרים לאשר את הצינור באמצעות פרטי הכניסה של המשתמש לחשבון Google או לחשבון שירות.
כדי להשתמש בפרטי הכניסה של המשתמש בחשבון Google, בוחרים באפשרות Run with my user credentials (הפעלה עם פרטי הכניסה של המשתמש).
אופציונלי: בקטע Extended access options, בוחרים את השירותים הנוספים שנדרשים לצינור.
- Knowledge Catalog: מאפשר Cloud de Confiance עדכוני מטא-נתונים של Knowledge Catalog.
- Google Drive: מאפשר גישה לקבצים ב-Google Drive לקריאה בלבד.
Bigtable: מאפשר גישה לקריאה בלבד לנתונים ב-Google Bigtable.
כדי להשתמש בחשבון שירות, בוחרים באפשרות Run with selected service account ואז בוחרים חשבון שירות. אם אתם צריכים ליצור חשבון שירות, לוחצים על New service account (חשבון שירות חדש).
בקטע מיקום העיבוד, בוחרים מיקום עיבוד לצינור.
כדי להפעיל את הבחירה האוטומטית של מיקום, בוחרים באפשרות המיקום ייבחר אוטומטית. האפשרות הזו בוחרת מיקום על סמך קבוצות הנתונים שאליהן מתייחסת הבקשה. תהליך הבחירה הוא כזה:
- אם השאילתה מפנה למערכי נתונים מאותו מיקום, BigQuery משתמש במיקום הזה.
- אם השאילתה מפנה למערכי נתונים משני מיקומים שונים או יותר, מתרחשת שגיאה. פרטים נוספים על ההגבלה הזו זמינים במאמר בנושא שכפול של מערכי נתונים באזורים שונים.
- אם השאילתה לא מפנה למערכי נתונים, BigQuery משתמש כברירת מחדל ב
USמספר אזורים.
כדי לבחור אזור ספציפי, בוחרים באפשרות אזור ואז בוחרים אזור בתפריט אזור. אפשר גם להשתמש במשתנה המערכת
@@locationבשאילתה. מידע נוסף זמין במאמר בנושא ציון מיקומים.כדי לבחור אזור מרובה, בוחרים באפשרות Multi-region ובתפריט Multi-region בוחרים אזור מרובה.
המיקום של צינור העיבוד לא צריך להיות זהה למיקום ברירת המחדל לאחסון של נכסי קוד.
אפשרויות SQLX
כדי להגדיר את הגדרות ה-SQLX של צינור העיבוד, מבצעים את הפעולות הבאות בקטע SQLX options:
בשדה Default project, מזינים את השם של פרויקט קיים ב-Cloud de Confiance . הערך הזה משמש ל-
defaultProjectבקובץworkflow_settings.yamlול-defaultDatabaseבקובץdataform.json. משימות בצינור עיבוד הנתונים משתמשות בפרויקט ברירת המחדל במהלך ההרצה שלהן.אופציונלי: בשדה מערך נתונים שמוגדר כברירת מחדל, מחפשים מערך נתונים קיים ובוחרים בו. רשימת מערכי הנתונים הזמינים מסוננת לפי הפרויקט ומיקום העיבוד שנבחרו. הערך הזה משמש ל-
defaultDatasetבקובץworkflow_settings.yaml. קבוצת הנתונים שמוגדרת כברירת מחדל משמשת את המשימות של צינור עיבוד הנתונים במהלך ההפעלה שלהן.
אפשרויות הנוטבוק
כדי להוסיף מחברת לצינור, מבצעים את הפעולות הבאות בקטע Notebook options:
בשדה תבנית זמן הריצה, מאשרים את זמן הריצה של ברירת המחדל של הנוטבוק, או מחפשים זמן ריצה קיים ובוחרים אותו.
- כדי לראות את המפרטים של זמן הריצה שמוגדר כברירת מחדל, לוחצים על החץ הסמוך.
- כדי ליצור סביבת ריצה חדשה, אפשר לעיין במאמר בנושא יצירת תבנית של סביבת ריצה.
בשדה Cloud Storage bucket, לוחצים על Browse ובוחרים או יוצרים קטגוריה של Cloud Storage לאחסון הפלט של מחברות בצינור.
פועלים לפי השלבים במאמר בנושא הוספת חשבון משתמש למדיניות ברמת הקטגוריה כדי להוסיף את חשבון השירות המותאם אישית של Dataform כחשבון משתמש לקטגוריית Cloud Storage שבה אתם מתכננים לאחסן את הפלט של הרצות צינורות מתוזמנות, ומעניקים לחשבון המשתמש הזה את תפקיד האדמין של Storage (
roles/storage.admin).צריך להקצות לחשבון השירות המותאם אישית של Dataform שנבחר את תפקיד ה-IAM של אדמין ב-Storage בדלי שנבחר.
הוספת משימה לצינור
אפשר להוסיף כמה משימות לצינור, שיפעיל נכסי קוד ברצף ספציפי.
נכסי הקוד הנתמכים בצינורות כוללים:
- שאילתות SQL
- קובצי Notebook
- תהליכי הכנת נתונים
- טבלאות ותצוגות (משימות SQLX)
מוסכמות למתן שמות למשימות
כשנותנים שם למשימה בצינור עיבוד הנתונים, צריך לפעול לפי המוסכמות הבאות למתן שמות:
- שמות המשימות יכולים להכיל רק אותיות (a-z, A-Z), ספרות (0-9), קווים תחתונים (
_) ומקפים (-). - שמות המשימות צריכים להתחיל באות, במספר או בקו תחתון.
- אסור להשתמש בנקודות (
.) בשמות של משימות. כשנותנים שם למשימה או משנים את השם שלה, אסור לכלול סיומות של קבצים כמו.sqlאו.py. אם שם המשימה מכיל נקודה, לחצן הפעלה מושבת. - שמות המשימות יכולים להכיל תווים באורך כולל של עד 1,024 בייטים בקידוד UTF-8.
- שמות המשימות צריכים להיות ייחודיים בתוך מאגר הצינור.
- שמות המשימות הם תלויי אותיות רישיות.
הוספת משימה
כדי להוסיף משימה לצינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
כדי להוסיף נכס קוד, בוחרים באחת מהאפשרויות הבאות:
שאילתת SQL
אפשר ליצור שאילתה חדשה או לייבא שאילתה קיימת.
מבצעים אחת מהפעולות הבאות:
לוחצים על הוספת משימה ואז על שאילתה. אפשר ליצור שאילתה חדשה או לייבא שאילתה קיימת.
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים לחיצה ימנית על תיקיית הצינור בחלונית Files (קבצים) ובוחרים באפשרות Create Query (יצירת שאילתה).
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים על הלחצן Add task (הוספת משימה) ב-Pipeline Viewer (כלי לצפייה בצינורות).
אופציונלי: בחלונית פרטי משימת השאילתה, בתפריט הפעלה אחרי, בוחרים משימה שתקדים את השאילתה.
יצירת שאילתה חדשה
לצד עריכת שאילתה, לוחצים על תפריט החץ ובוחרים באפשרות בהקשר או בכרטיסייה חדשה.
מחפשים שאילתה קיימת.
בוחרים שם של שאילתה ולוחצים על Enter.
לוחצים על Save.
אופציונלי: כדי לשנות את שם השאילתה, לוחצים על שם השאילתה בחלונית של צינור הנתונים, לוחצים על עריכת שאילתה, לוחצים על שם השאילתה הקיים בחלק העליון של המסך ומקלידים שם חדש.
ייבוא שאילתה קיימת
לוחצים על תפריט החץ לצד Edit Query ואז על Import a copy.
מחפשים שאילתה קיימת לייבוא או בוחרים שאילתה קיימת מחלונית החיפוש. כשמייבאים שאילתה, המקור לא משתנה כי קובץ המקור של השאילתה מועתק לצינור.
לוחצים על עריכה כדי לפתוח את השאילתה המיובאת.
לוחצים על Save.
Notebook
אפשר ליצור נוטבוק חדש או לייבא נוטבוק קיים. כדי לשנות את ההגדרות של תבניות זמן הריצה של מחברות, אפשר לעיין במאמר בנושא אפשרויות של מחברות.
מבצעים אחת מהפעולות הבאות:
לוחצים על הוספת משימה ואז על Notebook.
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים לחיצה ימנית על תיקיית הצינור בחלונית Files (קבצים) ובוחרים באפשרות Create Notebook (יצירת מחברת).
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים על הלחצן Add task (הוספת משימה) ב-Pipeline Viewer (כלי לצפייה בצינורות).
- אופציונלי: בחלונית פרטי משימת המחברת, בתפריט הפעלה אחרי, בוחרים משימה שתקדים את המחברת.
יצירת נוטבוק חדש
לוחצים על תפריט החץ ליד עריכת המחברת ובוחרים באפשרות בהקשר או בכרטיסייה חדשה.
מחפשים נוטבוק קיים.
בוחרים שם למחברת ומקישים על Enter.
לוחצים על Save.
אופציונלי: כדי לשנות את השם של המחברת, לוחצים על שם המחברת בחלונית של צינור הנתונים, לוחצים על עריכת המחברת, לוחצים על השם הקיים של המחברת בחלק העליון של המסך ומקלידים שם חדש.
איך מייבאים נוטבוק קיים
לוחצים על התפריט חץ לצד עריכת מחברת ואז על ייבוא עותק.
מחפשים מחברת קיימת לייבוא או בוחרים מחברת קיימת מחלונית החיפוש. כשמייבאים מחברת, המקור לא משתנה כי קובץ המקור של המחברת מועתק לצנרת.
כדי לפתוח את המחברת המיובאת, לוחצים על עריכה.
לוחצים על Save.
תהליך הכנת נתונים
אפשר ליצור הכנת נתונים חדשה או לייבא הכנת נתונים קיימת.
מבצעים אחת מהפעולות הבאות:
לוחצים על הוספת משימה ובוחרים באפשרות הכנת נתונים.
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים לחיצה ימנית על תיקיית הצינור בחלונית Files (קבצים) ובוחרים באפשרות Create Data preparation (יצירת הכנה של נתונים).
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים על הלחצן Add task (הוספת משימה) ב-Pipeline Viewer (כלי לצפייה בצינורות).
אופציונלי: בחלונית פרטי משימת הכנת הנתונים, בתפריט הפעלה אחרי, בוחרים משימה שתקדים את הכנת הנתונים.
יצירת הכנת נתונים חדשה
לוחצים על תפריט החצים שלצד עריכת הכנת הנתונים ובוחרים באפשרות בהקשר או בכרטיסייה חדשה.
מחפשים תהליך קיים להכנת נתונים.
בוחרים שם להכנת הנתונים ולוחצים על Enter.
לוחצים על Save.
אופציונלי: כדי לשנות את השם של הכנת הנתונים, לוחצים על השם של הכנת הנתונים בחלונית של צינור הנתונים, לוחצים על עריכת הכנת הנתונים, לוחצים על השם בחלק העליון של המסך ומזינים שם חדש.
ייבוא של הכנת נתונים קיימת
לוחצים על התפריט הנפתח עם החץ ליד עריכת הכנת הנתונים ואז על ייבוא עותק.
מחפשים הכנה קיימת של נתונים לייבוא או בוחרים הכנה קיימת של נתונים מחלונית החיפוש. כשמייבאים תהליך הכנת נתונים, המקור המקורי לא משתנה כי קובץ המקור של תהליך הכנת הנתונים מועתק לצינור.
כדי לפתוח את הכנת הנתונים המיובאים, לוחצים על עריכה.
לוחצים על Save.
טבלה
- מבצעים אחת מהפעולות הבאות:
לוחצים על הוספת משימה ובוחרים באפשרות טבלה.
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים לחיצה ימנית על תיקיית הצינור בחלונית Files (קבצים) ובוחרים באפשרות Create Table (יצירת טבלה).
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים על הלחצן Add task (הוספת משימה) ב-Pipeline Viewer (כלי לצפייה בצינורות).
בחלונית יצירת טבלה חדשה, בוחרים באפשרות טבלה או טבלה מצטברת.
מוודאים מהו פרויקט ברירת המחדל של הטבלה או בוחרים פרויקט חדש.
מאמתים את מערך הנתונים שמוגדר כברירת מחדל לטבלה או בוחרים מערך נתונים חדש.
מזינים שם לטבלה.
בחלונית פרטי המשימה בטבלה, לוחצים על פתיחה כדי לפתוח את המשימה.
מגדירים את המשימה באמצעות ההגדרות בפרטים > הגדרה או בבלוק
configשל עורך הקוד בטבלה.
כדי לראות שינויים במטא-נתונים, משתמשים בכרטיסייה Configuration (הגדרה). בכרטיסייה הזו אפשר לערוך ערך ספציפי בבלוק config מעורך הקוד, כמו מחרוזת או מערך, שמעוצב כמו אובייקט JavaScript. השימוש בכרטיסייה הזו עוזר לכם להימנע משגיאות תחביר ולוודא שההגדרות שלכם נכונות.
אופציונלי: בתפריט Run after, בוחרים משימה שתקדים את הטבלה.
אפשר גם להגדיר את המטא-נתונים של משימת הצינור בבלוק config בכלי העריכה. מידע נוסף זמין במאמר בנושא יצירת טבלאות.
העורך מאמת את הקוד ומציג את סטטוס האימות.
- משתמשים במפתח
metadataכדי לציין מידע עבור Knowledge Catalog. תהליך ההעשרה הזה תומך במבני המטא-נתונים הבאים:
- סקירה כללית: מאמרי עזרה וסיכום טקסט של הערך.
- היבטים גנריים: פרטים סמנטיים כמו מערכת הטבלה וסוג המידע.
בדוגמה הבאה של הגדרות אפשר לראות איך מוסיפים סקירה כללית והיבטים כלליים של מטא-נתונים להגדרות של טבלה ב-Knowledge Catalog:
```javascript
config {
type: "table",
metadata: {
overview: "This table provides standardized trip data.",
extraProperties: {
generic: {
system: "BigQuery",
type: "fact table"
}
}
}
}
```
בקטע פרטים > שאילתות שעברו קומפילציה, אפשר לראות את ה-SQL שעבר קומפילציה מקוד ה-SQLX.
לוחצים על Run כדי להריץ את ה-SQL בצינור.
בודקים את תצוגת הנתונים המקדימה בקטע Query results.
הצגה
מבצעים אחת מהפעולות הבאות:
לוחצים על הוספת משימה ואז על תצוגה.
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים לחיצה ימנית על תיקיית הצינור בחלונית Files (קבצים) ובוחרים באפשרות Create View (יצירת תצוגה).
כשעובדים עם צינורות בתיקיות או בתיקיות Git, לוחצים על הלחצן Add task (הוספת משימה) ב-Pipeline Viewer (כלי לצפייה בצינורות).
בחלונית יצירה של חדש, בוחרים באפשרות תצוגה או תצוגה מהותית.
בודקים את פרויקט ברירת המחדל של התצוגה או בוחרים פרויקט חדש.
מאמתים את מערך הנתונים שמוגדר כברירת מחדל לתצוגה או בוחרים מערך נתונים חדש.
מזינים שם לתצוגה.
בחלונית 'הצגת פרטי המשימה', לוחצים על פתיחה כדי לפתוח את המשימה.
מגדירים את המשימה באמצעות ההגדרות בפרטים > הגדרה או בבלוק
configשל עורך הקוד לתצוגה המפורטת.
כדי לראות שינויים במטא-נתונים, משתמשים בכרטיסייה Configuration (הגדרה). בכרטיסייה הזו אפשר לערוך ערך ספציפי בבלוק config מעורך הקוד, כמו מחרוזת או מערך, שמעוצב כמו אובייקט JavaScript. השימוש בכרטיסייה הזו עוזר לכם להימנע משגיאות תחביר ולוודא שההגדרות שלכם נכונות.
אופציונלי: בתפריט Run after (הפעלה אחרי), בוחרים משימה שתקדים את התצוגה.
אפשר גם להגדיר את המטא-נתונים של משימת הצינור בבלוק config בכלי העריכה. מידע נוסף זמין במאמר יצירת תצוגה באמצעות Dataform Core.
העורך מאמת את הקוד ומציג את סטטוס האימות.
- משתמשים במפתח
metadataכדי לציין מידע עבור Knowledge Catalog. תהליך ההעשרה הזה תומך במבני המטא-נתונים הבאים:
- סקירה כללית: מאמרי עזרה וסיכום טקסט של הערך.
- היבטים גנריים: פרטים סמנטיים כמו מערכת הטבלה וסוג המידע.
בדוגמה הבאה של הגדרות אפשר לראות איך מוסיפים סקירה כללית והיבטים כלליים של מטא-נתונים להגדרות של טבלה ב-Knowledge Catalog:
```javascript
config {
type: "view",
metadata: {
overview: "This view provides standardized trip data.",
extraProperties: {
generic: {
system: "BigQuery",
type: "view"
}
}
}
}
```
בקטע פרטים > שאילתות שעברו קומפילציה, אפשר לראות את ה-SQL שעבר קומפילציה מקוד ה-SQLX.
לוחצים על Run כדי להריץ את ה-SQL בצינור.
בודקים את תצוגת הנתונים המקדימה בקטע Query results.
הצהרת מקור
לוחצים על הוספת משימה ובוחרים באפשרות הצהרת מקור.
בחלונית הצהרת מקור, מאשרים את פרויקט ברירת המחדל של מקור הנתונים או בוחרים פרויקט חדש.
בודקים את מערך הנתונים שמוגדר כברירת מחדל למקור הנתונים, או בוחרים מערך נתונים חדש.
בשדה טבלה / תצוגה, בוחרים את הטבלה או התצוגה שרוצים להשתמש בהן כמקור נתונים.
לוחצים על יצירה.
בחלונית הפרטים של המשימה 'הצהרת מקור', לוחצים על פתיחה כדי לפתוח את המשימה.
מגדירים את מקור הנתונים באמצעות ההגדרות בפרטים > הגדרה או בבלוק
configבעורך הקוד.מידע נוסף על הגדרת מקור נתונים זמין במאמר הצהרה על מקור נתונים.
העורך מאמת את הקוד ומציג את סטטוס האימות.
בדיקה של נתוני הצהרה
לוחצים על הוספת משימה ובוחרים באפשרות בדיקת איכות נתונים.
בחלונית יצירת ניתוח חדש, מוודאים שהפרויקט שמוגדר כברירת מחדל מתאים לבדיקת איכות הנתונים, או בוחרים פרויקט חדש.
מאמתים את מערך הנתונים שמוגדר כברירת מחדל לבדיקת איכות הנתונים, או בוחרים מערך נתונים חדש.
בשדה טבלה, מזינים שם לבדיקת איכות הנתונים.
לוחצים על יצירה.
בחלונית הפרטים של משימת בדיקת איכות הנתונים, לוחצים על פתיחה כדי לפתוח את המשימה.
מגדירים את הטענות לבדיקה באמצעות ההגדרות בפרטים > הגדרה או בבלוק
configשל עורך הקוד.מידע נוסף על הגדרת הצהרות זמין במאמר בנושא בדיקת איכות הנתונים.
אופציונלי: בתפריט Run after (הפעלה אחרי), בוחרים משימה שתקדים את בדיקת איכות הנתונים ברצף של צינור העיבוד.
העורך מאמת את הקוד ומציג את סטטוס האימות.
לוחצים על Run (הפעלה) כדי להפעיל את בדיקת איכות הנתונים כחלק מרצף הצינור.
בדיקת יחידה
לוחצים על הוספת משימה ובוחרים באפשרות בדיקת יחידה.
בשדה פעולה לבדיקה, בוחרים את הטבלה או התצוגה שרוצים לבדוק.
בשדה BigQuery Unit test (בדיקת יחידה ב-BigQuery), מזינים שם לבדיקת היחידה.
לוחצים על יצירה.
בחלונית פרטי המשימה, לוחצים על פתיחה כדי לפתוח את בדיקת היחידה.
מגדירים את מקורות הקלט ואת שורות הפלט הצפויות לבדיקת היחידה.
מידע נוסף על הגדרת בדיקות יחידה זמין במאמר בדיקת איכות הנתונים.
אופציונלי: כדי לוודא שהקלט והפלט הם מה שציפיתם, לוחצים על הפעלת המשימה ובוחרים הצהרות צפויות או בפועל.
לוחצים על Run (הפעלה) כדי להפעיל את בדיקת איכות הנתונים כחלק מרצף הצינור.
עריכת משימה בפייפליין
כדי לערוך משימה בצינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על המשימה שנבחרה.
כדי לשנות את המשימה הקודמת, בתפריט Run after (הפעלה אחרי), בוחרים משימה שתקדים את המשימה שלכם.
כדי לערוך את התוכן של המשימה שנבחרה, לוחצים על עריכה.
בכרטיסייה החדשה שנפתחת, עורכים את תוכן המשימה ושומרים את השינויים במשימה.
מחיקת משימה בצינור עיבוד נתונים
כדי למחוק משימה מצינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על המשימה שנבחרה.
בחלונית פרטי המשימה, לוחצים על מחיקה מחיקה.
שיתוף פייפליין
כדי לשתף צינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על שיתוף ואז על ניהול הרשאות.
לוחצים על הוספת משתמש או קבוצה.
בשדה New principals, מזינים את השם של משתמש או קבוצה אחת לפחות.
בקטע Assign Roles (הקצאת תפקידים), בוחרים תפקיד.
לוחצים על Save.
שיתוף קישור לצינור עיבוד נתונים
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על שיתוף ובוחרים באפשרות שיתוף הקישור. כתובת ה-URL של הצינור תועתק ללוח העריכה של המחשב.
הפעלת צינור עיבוד נתונים
כשמריצים צינור, אפשר להריץ את כל המשימות בצינור, לבחור ידנית משימות ספציפיות להרצה, להריץ משימות עם תגים נבחרים או להריץ בדיקות יחידה.
הרצת כל המשימות בצינור
כדי להריץ ידנית את הגרסה הנוכחית של צינור, בוחרים באחת מהאפשרויות הבאות:
המסוף
כדי להריץ את כל המשימות בצינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על הפעלה > הפעלת כל המשימות. אם בחרתם באפשרות Run with my user credentials (הפעלה עם פרטי הכניסה של המשתמש) עבור האימות, אתם צריכים לתת הרשאה לחשבון Google.
אופציונלי: כדי לבדוק את ההרצה, צופים בהרצות ידניות קודמות.
API
כדי להריץ צינור עיבוד נתונים באופן ידני, צריך לקמפל את סביבת העבודה שמוגדרת כברירת מחדל ולהשתמש בתוצאת הקומפילציה כדי ליצור הפעלה של תהליך עבודה.
כדי ליצור תוצאת קומפילציה לסביבת העבודה שמוגדרת כברירת מחדל, משתמשים בשיטה
projects.locations.repositories.compilationResults.create.מריצים את בקשת ה-API עם הפרטים הבאים:
curl -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ -d '{ "workspace": "projects/PROJECT_ID/locations/LOCATION/repositories/REPOSITORY_ID/workspaces/default" }' \ "https://dataform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/repositories/REPOSITORY_ID/compilationResults"מחליפים את מה שכתוב בשדות הבאים:
-
LOCATION: האזור Cloud de Confiance by S3NS של המאגר, לדוגמה,us-central1. אפשר למצוא את מיקום המאגר ב Cloud de Confiance מסוף. לשם כך, עוברים לחלונית Explorer, בוחרים את צינור הנתונים, פותחים את הכרטיסייה Settings ולוחצים על Open pipeline in Dataform. המיקום מופיע בכתובת ה-URL בפורמט/locations/LOCATION/. -
PROJECT_ID: המזהה הייחודי של הפרויקט ב-Cloud de Confiance . -
REPOSITORY_ID: המזהה הייחודי של מאגר Dataform, לדוגמה,my-secure-repo. אפשר למצוא את מזהה המאגר במסוף Cloud de Confiance . לשם כך, עוברים לחלונית Explorer, בוחרים את צינור הנתונים, פותחים את הכרטיסייה Settings ומציגים את השדה Dataform repository ID.
-
בגוף התגובה, מאתרים את השדה
nameומעתיקים את הערך שלו, למשל,projects/my-project/locations/us-central1/repositories/my-repo/compilationResults/12345-67890.מפעילים את צינור עיבוד הנתונים באמצעות השיטה
projects.locations.repositories.workflowInvocations.create.מריצים את בקשת ה-API עם הפרטים הבאים:
curl -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ -d '{ "compilationResult": "COMPILATION_RESULT" }' \ "https://dataform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/repositories/REPOSITORY_ID/workflowInvocations"מחליפים את מה שכתוב בשדות הבאים:
-
COMPILATION_RESULT: שם המשאב המלא של תוצאת הקומפילציה שהעתקתם בשלב הקודם. -
LOCATION: האזור Cloud de Confiance by S3NS של המאגר, לדוגמה,us-central1. -
PROJECT_ID: המזהה הייחודי של הפרויקט ב-Cloud de Confiance . -
REPOSITORY_ID: המזהה הייחודי של מאגר Dataform, לדוגמה,my-secure-repo.
-
הרצת משימות נבחרות בצינור
כדי להריץ משימות נבחרות בצינור, מבצעים את הפעולות הבאות:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על Run > Select tasks to run.
בחלונית Run (הפעלה), בקטע Authentication (אימות), מאשרים את ההרצה באמצעות פרטי הכניסה של המשתמש לחשבון Google או לחשבון שירות.
כדי להשתמש בפרטי הכניסה של המשתמש לחשבון Google, בוחרים באפשרות Run with user credentials.
Optional: In the **Extended access options** section, select the additional services that your pipeline requires: - **Knowledge Catalog**: Allows Cloud de Confiance Knowledge Catalog metadata updates. - **Google Drive**: Allows read-only access to Google Drive files. - **Bigtable**: Allows read-only access to Google Bigtable data.כדי להשתמש בחשבון שירות בהתאמה אישית, בוחרים באפשרות Run with selected service account ואז בוחרים חשבון שירות בהתאמה אישית.
אם אתם צריכים ליצור חשבון שירות, לוחצים על New service account (חשבון שירות חדש).
מוודאים שהאפשרות Selection of tasks (בחירת משימות) מסומנת.
בתפריט Select tasks to run (בחירת משימות להפעלה), מחפשים משימות ספציפיות ובוחרים את המשימות שרוצים להפעיל.
בטבלה משימות מפורטות המשימות שבחרתם. לוחצים על שם של משימה כדי לפתוח אותה ישירות בעורך ה-SQL.
אופציונלי: מגדירים את אפשרויות ההפעלה הבאות:
- Include dependencies (הכללת תלויות): בוחרים באפשרות הזו כדי להריץ את המשימות שנבחרו ואת התלויות שלהן.
- Include dependents (כולל תלויות): בוחרים באפשרות הזו כדי להריץ את המשימות שנבחרו ואת התלויות שלהן במורד הזרם.
- הפעלה עם רענון מלא: בוחרים באפשרות הזו כדי לבנות מחדש את כל הטבלאות מאפס.
- הפעלה כעבודה אינטראקטיבית עם עדיפות גבוהה (ברירת מחדל): בוחרים באפשרות הזו כדי להגדיר את העדיפות של עבודת השאילתה ב-BigQuery. כברירת מחדל, BigQuery מריץ שאילתות כמשימות של שאילתות אינטראקטיביות, שמיועדות להתחיל לפעול כמה שיותר מהר. אם לא מסמנים את האפשרות הזו, השאילתות מופעלות כעבודות של שאילתות באצווה, שהעדיפות שלהן נמוכה יותר.
לוחצים על Run. אם בחרתם בשיטת האימות Run with user credentials (הרצה עם פרטי כניסה של משתמש), אתם צריכים לתת הרשאה לחשבון Google (תצוגה מקדימה).
אופציונלי: כדי לבדוק את ההרצה, צופים בהרצות ידניות קודמות.
הרצת משימות עם תגים נבחרים בצינור
כדי להפעיל משימות עם תגים נבחרים בצינור, פועלים לפי השלבים הבאים:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על Run > Run by tag (הפעלה לפי תג), ואז מבצעים אחת מהפעולות הבאות:
- לוחצים על התג שרוצים להפעיל.
- לוחצים על Select tags to run (בחירת תגים להפעלה).
בחלונית Run (הפעלה), בקטע Authentication (אימות), מאשרים את ההרצה באמצעות פרטי הכניסה של המשתמש לחשבון Google או לחשבון שירות.
כדי להשתמש בפרטי הכניסה של המשתמש לחשבון Google, בוחרים באפשרות Run with user credentials.
Optional: In the **Extended access options** section, select the additional services that your pipeline requires: - **Knowledge Catalog**: Allows Cloud de Confiance Knowledge Catalog metadata updates. - **Google Drive**: Allows read-only access to Google Drive files. - **Bigtable**: Allows read-only access to Google Bigtable data.כדי להשתמש בחשבון שירות בהתאמה אישית, בוחרים באפשרות Run with selected service account ואז בוחרים חשבון שירות בהתאמה אישית.
אם אתם צריכים ליצור חשבון שירות, לוחצים על New service account (חשבון שירות חדש).
מוודאים שהאפשרות בחירת תגים מסומנת.
בתפריט Select tags to run (בחירת תגים להפעלה), מחפשים תגים ספציפיים ובוחרים את התגים שרוצים להפעיל.
בטבלה משימות מפורטות המשימות שבחרתם. לוחצים על שם של משימה כדי לפתוח אותה ישירות בעורך ה-SQL.
אופציונלי: מגדירים את אפשרויות ההפעלה הבאות:
- Include dependencies (הכללת תלויות): בוחרים באפשרות הזו כדי להריץ את המשימות שנבחרו ואת התלויות שלהן.
- Include dependents (כולל תלויות): בוחרים באפשרות הזו כדי להריץ את המשימות שנבחרו ואת התלויות שלהן במורד הזרם.
- הפעלה עם רענון מלא: בוחרים באפשרות הזו כדי לבנות מחדש את כל הטבלאות מאפס.
- הפעלה כעבודה אינטראקטיבית עם עדיפות גבוהה (ברירת מחדל): בוחרים באפשרות הזו כדי להגדיר את העדיפות של עבודת השאילתה ב-BigQuery. כברירת מחדל, BigQuery מריץ שאילתות כמשימות של שאילתות אינטראקטיביות, שמיועדות להתחיל לפעול כמה שיותר מהר. אם לא מסמנים את האפשרות הזו, השאילתות מופעלות כעבודות של שאילתות באצווה, שהעדיפות שלהן נמוכה יותר.
לוחצים על Run. אם בחרתם בשיטת האימות Run with user credentials (הרצה עם פרטי כניסה של משתמש), אתם צריכים לתת הרשאה לחשבון Google (תצוגה מקדימה).
אופציונלי: כדי לבדוק את ההרצה, צופים בהרצות ידניות קודמות.
הרצת בדיקות יחידה בצינור
מגדירים בדיקות יחידה ב-Dataform על ידי יצירת קובצי בדיקה .sqlx בספרייה definitions/ במאגר. אחרי שיוצרים בדיקות יחידה ב-Dataform, אפשר להריץ אותן ישירות בצינור BigQuery כדי לאמת את לוגיקת ההמרה של SQL מול מערכי נתונים מדומים.
כדי להריץ בדיקות יחידה בצינור:
במסוף Cloud de Confiance , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על הפעלה.
בחלונית Run (הפעלה), בקטע Authentication (אימות), מאשרים את ההרצה באמצעות פרטי הכניסה של המשתמש לחשבון Google או לחשבון שירות:
כדי להשתמש בפרטי הכניסה של המשתמש לחשבון Google (תצוגה מקדימה), בוחרים באפשרות Run with user credentials (הפעלה עם פרטי הכניסה של המשתמש).
Optional: In the **Extended access options** section, select the additional services that your pipeline requires: - **Knowledge Catalog**: Allows Cloud de Confiance Knowledge Catalog metadata updates. - **Google Drive**: Allows read-only access to Google Drive files. - **Bigtable**: Allows read-only access to Google Bigtable data.כדי להשתמש בחשבון שירות בהתאמה אישית, בוחרים באפשרות Run with selected service account ואז בוחרים חשבון שירות בהתאמה אישית.
כדי לראות את חשבונות השירות בתפריט, צריכה להיות לכם ההרשאה
iam.serviceAccounts.listברמת הפרויקט, שזמינה בתפקיד הצגת חשבונות שירות (roles/iam.serviceAccountViewer). אם אין לכם את ההרשאה הזו, אתם יכולים לבחור את חשבון השירות על ידי לחיצה על הזנה ידנית והזנת מזהה חשבון השירות.אם אתם צריכים ליצור חשבון שירות, לוחצים על New service account (חשבון שירות חדש).
בקטע Execution mode, בוחרים באפשרות Unit tests.
בוחרים אחת מהאפשרויות הבאות של היקף הביצוע:
- בחירת בדיקות יחידה: מחפשים ובודקים בדיקות יחידה ספציפיות מהצינור.
- בחירת תגים של בדיקות יחידה: סינון והרצה של בדיקות יחידה שהוקצו להן תגים ספציפיים.
- All Unit Tests: מריצים את כל בדיקות היחידה שהוגדרו בצינור.
אופציונלי: בקטע Execution options, מסמנים את התיבה Execute as interactive job with high priority כדי להריץ בדיקות יחידה באופן מיידי, תוך מתן עדיפות למהירות הביצוע.
אם לא מסמנים את תיבת הסימון Execute as interactive job with high priority (הפעלה כמשימה אינטראקטיבית עם עדיפות גבוהה), Dataform מפעיל בדיקות יחידה באמצעות משאבי אצווה כברירת מחדל, ונותן עדיפות לחיסכון בעלויות מחשוב.
לוחצים על Run. אם בחרתם בשיטת האימות Run with user credentials (הרצה עם פרטי כניסה של משתמש), אתם צריכים לתת הרשאה לחשבון Google (תצוגה מקדימה).
אופציונלי: כדי לבדוק את ההרצה, צופים בהרצות ידניות קודמות.
אישור חשבון Google
כדי לאמת את המשאב באמצעות פרטי הכניסה של המשתמש בחשבון Google, צריך להעניק באופן ידני הרשאה לצינורות של BigQuery לקבל את אסימון הגישה לחשבון Google ולגשת לנתוני המקור בשמכם. אתם יכולים לתת אישור ידני באמצעות ממשק תיבת הדו-שיח של OAuth. אם בוחרים באחת מאפשרויות הגישה המורחבת, צריך להעניק גישה לשירותים האלה – למשל, Google Drive או Knowledge Catalog.
צריך לתת הרשאה לצינורות של BigQuery רק פעם אחת.
כדי לבטל את ההרשאה שהענקתם, פועלים לפי השלבים הבאים:
- עוברים אל הדף של החשבון ב-Google.
- לוחצים על BigQuery Pipelines.
- לוחצים על הסרת הגישה.
אם צינור הנתונים מכיל מחברת, צריך גם לתת הרשאה באופן ידני ל-Colab Enterprise כדי לקבל את אסימון הגישה לחשבון Google ולגשת לנתוני המקור בשמכם. צריך לתת את ההרשאה רק פעם אחת. אפשר לבטל את ההרשאה הזו בדף של חשבון Google.