איך עובדים עם נתונים מ-Lakehouse ללא גבולות ב-BigQuery
Borderless Lakehouse הוא מנוע אחסון שמאחד Cloud de Confiance by S3NS שירותים בקוד פתוח כדי ליצור ממשק מאוחד לניתוח מתקדם ול-AI. הוא מספק את הבסיס לבניית lakehouse פתוח, מנוהל ועתיר ביצועים עם ניהול נתונים אוטומטי ושליטה מובנית באמצעות Apache Iceberg.
כשיוצרים טבלה ב-Lakehouse, אפשר להריץ עליה שאילתות באופן אוטומטי מ-BigQuery, והיא מוצגת בדף BigQuery במסוף Cloud de Confiance . גם מרחבי השמות והסכימות של Lakehouse ממופים אוטומטית למערכי נתונים ב-BigQuery.
ההבדלים בין משאבי Lakehouse לבין משאבים אחרים ב-BigQuery
אלה ההבדלים העיקריים בין Lakehouse לבין משאבי BigQuery רגילים:
- מערכי נתונים של Lakehouse מופיעים בדף BigQuery במסוף Cloud de Confiance לצד הסמל water.
- אי אפשר לשנות משאבי Lakehouse מ-BigQuery.
- למשאבי Lakehouse יש מטא-נתונים נוספים בקטע פרטים המתאים.
השוואה בין היכולות של טבלאות Iceberg
בעזרת הטבלה הבאה אפשר להשוות בין היכולות של טבלאות Apache Iceberg שמנוהלות על ידי קטלוג זמן הריצה של Lakehouse, לבין טבלאות Apache Iceberg שמנוהלות על ידי BigQuery.
| יכולת | טבלאות Apache Iceberg שמנוהלות על ידי קטלוג זמן הריצה של Lakehouse | טבלאות Apache Iceberg שמנוהלות על ידי BigQuery |
|---|---|---|
| Catalog | קטלוג זמן ריצה של Lakehouse (תואם לקטלוג REST של Iceberg) | BigQuery |
| אחסון | Cloud Storage | Cloud Storage |
| אפשר לגשת אליו דרך נקודת הקצה (endpoint) של קטלוג REST של Iceberg | כן | כן, באמצעות איחוד קטלוגים ב-BigQuery |
| יכולת פעולה הדדית של קריאה/כתיבה | ||
| שאילתות קריאה ב-BigQuery (SELECT, BQML, פונקציות AI) | נתמך | נתמך |
| BigQuery DML (INSERT, UPDATE, DELETE, MERGE) | נתמך (גרסת טרום-השקה) | נתמך (GA) |
| קריאות במנוע OSS | נתמך (GA) | נתמך (GA) (באמצעות איחוד קטלוגים של BigQuery) |
| כתיבות במנוע OSS | נתמך (GA) | לא נתמך |
| כתיבת סטרימינג של מנוע OSS (Kafka, Spark, Dataflow עם יעד Iceberg I/O) | נתמך (GA) | לא נתמך |
| יכולות מנוהלות ומתקדמות | ||
| ניהול שולחן (דחיסה, איסוף אשפה) | נתמך (גרסת טרום-השקה) | נתמך (GA) |
| כתיבה בסטרימינג ב-BigQuery (Storage Write API) | לא נתמך | נתמך (GA) |
| הזרמה/מינוי ב-Pub/Sub, הזרמה ב-Dataflow עם יעד קלט/פלט של BigQuery | לא נתמך | נתמך (GA) |
| BigQuery Change Data Capture (CDC) | לא נתמך | נתמך (גרסת טרום-השקה פרטית) |
| עסקאות מרובות הצהרות ב-BigQuery | לא נתמך | נתמך (גרסת טרום-השקה) |
| תוכנית התאוששות מאסון (DR) מנוהלת | לא נתמך | לא נתמך |
| אינדקס החיפוש | לא נתמך | לא נתמך |
| אינדקס וקטורים (כולל יצירה אוטומטית של הטמעה) | לא נתמך | לא נתמך |
| מסע בזמן | ||
| מסע בזמן (באמצעות מנועי OSS) | גמיש (מוגדר דרך מאפייני הטבלה) | לא נתמך |
| מסע בזמן (באמצעות BigQuery) | מוגבלת ל-7 ימים | מוגבלת ל-7 ימים |
| היסטוריית תמונות המצב וחזרה לתמונת מצב קודמת | נתמך | לא נתמך |
| משילות, אבטחה ושיתוף | ||
| תצוגות מורשות ב-BigQuery | לא נתמך | לא נתמך |
| אבטחה ברמת העמודה ב-BigQuery | לא נתמך | נתמך (GA) |
| הסוואת נתונים ותגי מדיניות ב-BigQuery | לא נתמך | נתמך (GA) |
| אבטחה ברמת השורה ב-BigQuery | לא נתמך | לא נתמך |
| שילוב עם Analytics Hub | לא נתמך | נתמך |
| יכולות של קטלוג הידע | ||
| קטלוג, חיפוש וגילוי של מטא-נתונים | נתמך | נתמך |
| שושלת נתונים | נתמך | נתמך |
| איכות הנתונים/פרופיל הנתונים | נתמך | נתמך |
| תובנות | נתמך | נתמך |
| יצירת תיאורים של עמודות וטבלאות על בסיס AI | נתמך | נתמך |
גישה לנתונים בענן
היכולת של Lakehouse לגשת לנתונים בענן מאפשרת לשלוח שאילתות לנתונים שמאוחסנים אצל ספקי ענן אחרים ישירות מ-BigQuery, בלי להעביר קבצים או ליצור צינורות ETL מורכבים. מידע על ההגדרה זמין במאמר שאילתות על נתונים מרחוק.