Datenaufbereitung verwalten
In diesem Dokument wird beschrieben, wie Sie Ihre BigQuery-Datenaufbereitungen verwalten, einschließlich Zugriff, Versionsverwaltung, Leistung und Metadaten. Außerdem wird beschrieben, wie Sie grundlegende Aufgaben ausführen, z. B. Ihre Datenvorbereitungen ansehen und herunterladen.
Datenvorbereitungen sind BigQuery-Ressourcen, die auf Dataform basieren. Weitere Informationen finden Sie unter BigQuery-Datenvorbereitung – Übersicht.
Hinweis
- Achten Sie darauf, dass Sie die Gemini for Google Cloud API aktiviert haben.
- Wenn Sie Metadaten zur Datenvorbereitung in Knowledge Catalog verwalten möchten, muss die Dataplex API in Ihrem Cloud de Confiance Projekt aktiviert sein.
Erforderliche Rollen
Nutzer, die die Daten vorbereiten, und die Dataform-Dienstkonten, mit denen die Jobs ausgeführt werden, benötigen die Berechtigungen, die durch die folgenden IAM-Rollen (Identity and Access Management) gewährt werden.
Nutzerzugriff für die Datenvorbereitung erhalten
Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Vorbereiten von Daten in BigQuery benötigen:
- BigQuery Studio-Nutzer (
roles/bigquery.studioUser) für das Projekt - Gemini für Google Cloud-Nutzer (
roles/cloudaicompanion.user) für das Projekt -
Auf die Quelltabellen zugreifen:
BigQuery Data Viewer (
roles/bigquery.dataViewer) für die Tabelle, das Dataset oder das Projekt -
Datenaufbereitungen freigeben:
Dataform Code Owner (
roles/dataform.codeOwner) für die Tabelle, das Dataset oder das Projekt
Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.
Weitere Informationen zu IAM für Datasets in BigQuery finden Sie unter Zugriff auf ein Dataset gewähren.Sie können diese Berechtigungen auch mit benutzerdefinierten Rollen oder anderen vordefinierten Rollen erhalten.
Zugriff zum Verwalten von Metadaten erhalten
Damit Sie die Berechtigungen erhalten, die Sie zum Verwalten von Metadaten zur Datenaufbereitung im Knowledge Catalog benötigen, müssen Sie die erforderlichen Knowledge Catalog-Rollen und die Berechtigung dataform.repositories.get haben.
Zugriff auf das Dataform-Dienstkonto gewähren
Damit das Dataform-Dienstkonto die erforderlichen Berechtigungen zum Ausführen von Datenaufbereitungen in BigQuery hat, bitten Sie Ihren Administrator, dem Dataform-Dienstkonto die folgenden IAM-Rollen zuzuweisen:
-
Auf die Quelltabellen zugreifen:
BigQuery Data Viewer (
roles/bigquery.dataViewer) für die Tabelle, das Dataset oder das Projekt -
Auf die Zieltabelle zugreifen:
BigQuery Data Editor (
roles/bigquery.dataEditor) für die Tabelle, das Dataset oder das Projekt
Das Dataform-Dienstkonto benötigt möglicherweise zusätzliche Berechtigungen, je nach Ihrer Datenvorbereitungspipeline. Weitere Informationen finden Sie unter Erforderlichen Zugriff für Dataform gewähren.
Sicherheitsaspekte für die Datenaufbereitung
Da Code-Assets in BigQuery auf Dataform basieren, sollten Sie die folgenden Sicherheitsaspekte für Nutzer mit Zugriff auf diese Assets berücksichtigen:
- Die Sichtbarkeit von Code-Assets unterliegt Dataform-Berechtigungen auf Projektebene. Nutzer mit der Berechtigung
dataform.repositories.list, die in Standard-BigQuery-Rollen wie BigQuery-Jobnutzer, BigQuery Studio-Nutzer und BigQuery-Nutzer enthalten ist, können alle Code-Assets im Bereich Explorer des Cloud de Confiance Projekts sehen, unabhängig davon, ob sie diese Assets erstellt haben oder diese Assets für sie freigegeben wurden. Wenn Sie die Sichtbarkeit einschränken möchten, können Sie benutzerdefinierte Rollen erstellen, die die Berechtigungdataform.repositories.listnicht enthalten. - Auf alle vertraulichen Informationen, die für den Dataform-Dienst-Agent freigegeben werden, können möglicherweise Nutzer zugreifen, die diese Assets bearbeiten können. Um Ihre Anmeldedaten zu schützen, sollten Sie den Zugriff auf das Erstellen und Bearbeiten auf vertrauenswürdige Nutzer beschränken und die für den Dataform-Dienst-Agent zugänglichen Secrets einschränken. Weitere Informationen finden Sie unter Secrets-Zugriff während der Paketinstallation.
Weitere Informationen finden Sie unter Sicherheitsaspekte für Dataform-Berechtigungen.
Vorhandene Datenvorbereitungen ansehen
So rufen Sie eine Liste der vorhandenen Datenaufbereitungen auf:
Rufen Sie die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Explorer:

Wenn der linke Bereich nicht angezeigt wird, klicken Sie auf Linken Bereich maximieren, um ihn zu öffnen.
Maximieren Sie im Bereich Explorer Ihr Projekt.
Klicken Sie auf Datenaufbereitung.
Datenvorbereitung durch inkrementelle Verarbeitung von Daten optimieren
So konfigurieren Sie, wie Ihre vorbereiteten Daten in eine Zieltabelle geschrieben werden:
Rufen Sie in der Cloud de Confiance Console die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Explorer:

Klicken Sie im Bereich Explorer auf Datenaufbereitung und wählen Sie dann die Datenaufbereitung aus.
Wählen Sie in der Symbolleiste der Datenaufbereitung Mehr > Schreibmodus aus.
Wählen Sie eine der Optionen aus. Weitere Informationen finden Sie unter Schreibmodus.
Klicken Sie auf Speichern.
Versionen der Datenvorbereitung
Sie können die Datenaufbereitung entweder innerhalb oder außerhalb eines Repositorys erstellen. Die Versionsverwaltung der Datenvorbereitung wird je nach Speicherort der Datenvorbereitung unterschiedlich gehandhabt.
Versionsverwaltung für die Datenvorbereitung in Repositories
Repositories sind Git-Repositories, die sich entweder in BigQuery oder bei einem Drittanbieter befinden. Sie können Arbeitsbereiche in Repositories verwenden, um die Versionsverwaltung für die Datenaufbereitung durchzuführen. Weitere Informationen finden Sie unter Versionsverwaltung für eine Datei verwenden.
Versionsverwaltung der Datenaufbereitung außerhalb von Repositories
Für BigQuery-Datenaufbereitungen, die sich nicht in Repositories befinden, können keine Versionen der Datenaufbereitung aufgerufen, verglichen oder wiederhergestellt werden.
So rufen Sie eine chronologische Liste der Versionen der Datenaufbereitung auf:
Rufen Sie die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Explorer:

Klicken Sie im Bereich Explorer auf Datenaufbereitung und wählen Sie dann die Datenaufbereitung aus.
Klicken Sie auf Versionsverlauf.
Datenvorbereitung herunterladen
So laden Sie eine Datenaufbereitung in einer SQLX-Datei herunter:
Rufen Sie in der Cloud de Confiance Console die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Explorer:

Maximieren Sie im Bereich Explorer Ihr Projekt und klicken Sie auf Datenaufbereitung.
Klicken Sie auf den Namen der Datenaufbereitung, die Sie herunterladen möchten.
Klicken Sie auf Herunterladen. Die Datenaufbereitung wird im SQLX-Dateiformat gespeichert, z. B.
NAME data preparation.dp.sqlx.
Datenvorbereitung hochladen
So laden Sie eine Datenaufbereitung aus einer SQLX-Datei hoch:
Rufen Sie in der Cloud de Confiance Console die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Explorer:

Maximieren Sie im Bereich Explorer Ihr Projekt.
Klicken Sie auf Datenvorbereitung und dann auf more_vert Aktionen ansehen > In die Datenvorbereitung hochladen.
Wählen Sie im Dialogfeld Datenvorbereitung hochladen eine Datei zum Hochladen aus oder geben Sie die URL der Datenvorbereitung ein.
Geben Sie einen Namen für die Datenaufbereitung ein.
Wählen Sie einen Ort für die Datenaufbereitung aus, an dem Ressourcen verwaltet und gespeichert werden.
Klicken Sie auf Hochladen.
Metadaten in Knowledge Catalog verwalten
Mit Knowledge Catalog können Sie Metadaten für die Datenaufbereitung speichern und verwalten. Datenaufbereitungen sind in Knowledge Catalog standardmäßig ohne zusätzliche Konfiguration verfügbar.
Mit Knowledge Catalog können Sie Datenvorbereitungen an allen BigQuery-Standorten verwalten. Die Verwaltung von Datenaufbereitungen in Knowledge Catalog unterliegt den Kontingenten und Limits für Knowledge Catalog und den Knowledge Catalog-Preisen.
Knowledge Catalog ruft automatisch die folgenden Metadaten aus Datenaufbereitungen ab:
- Name des Daten-Assets
- Übergeordnetes Data Asset
- Speicherort des Daten-Assets
- Datentyp-Asset
- Entsprechendes Cloud de Confiance Projekt
In Knowledge Catalog werden Datenaufbereitungen als Einträge mit den folgenden Eintragswerten protokolliert:
- Systemeintragsgruppe
- Die Systemeintragsgruppe für die Datenvorbereitung ist
@dataform. Wenn Sie Details zu Einträgen zur Datenvorbereitung in Knowledge Catalog aufrufen möchten, müssen Sie die System-Eintragsgruppedataformaufrufen. Eine Anleitung dazu, wie Sie eine Liste aller Einträge in einer Eintragsgruppe aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details einer Eintragsgruppe ansehen. - Systemeintragstyp
- Der Systemeintragstyp für die Datenvorbereitung ist
dataform-code-asset. Wenn Sie Details zu Datenaufbereitungen aufrufen möchten, müssen Sie den System-Eintragstypdataform-code-assetaufrufen, die Ergebnisse mit einem aspektbasierten Filter filtern und das Feldtypeim Aspektdataform-code-assetaufDATA_PREPARATIONfestlegen. Wählen Sie dann einen Eintrag der ausgewählten Datenaufbereitung aus. Eine Anleitung dazu, wie Sie Details zu einem ausgewählten Eintragstyp aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details zu einem Eintragstyp aufrufen. Eine Anleitung dazu, wie Sie die Details eines ausgewählten Eintrags aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details eines Eintrags ansehen. - Systemaspekttyp
- Der Systemaspekttyp für die Datenaufbereitung ist
dataform-code-asset. Wenn Sie Datenaufbereitungseinträgen in Knowledge Catalog durch Anmerkungen mit Aspekten zusätzlichen Kontext hinzufügen möchten, sehen Sie sich den Aspekttypdataform-code-assetan, filtern Sie die Ergebnisse mit einem aspektbasierten Filter und legen Sie das Feldtypeim Aspektdataform-code-assetaufDATA_PREPARATIONfest. Eine Anleitung zum Annotieren von Einträgen mit Aspekten finden Sie in der Knowledge Catalog-Dokumentation unter Aspekte verwalten und Metadaten anreichern. - Typ
- Der Typ für Daten-Canvas ist
DATA_PREPARATION. Mit diesem Typ können Sie Datenaufbereitungen im Systemeingabetypdataform-code-assetund im Aspekttypdataform-code-assetfiltern, indem Sie die Abfrageaspect:dataplex-types.global.dataform-code-asset.type=DATA_PREPARATIONin einem aspektbasierten Filter verwenden.
Eine Anleitung zum Suchen nach Assets finden Sie in der Knowledge Catalog-Dokumentation unter Nach Daten-Assets in Knowledge Catalog suchen.