Eseguire la migrazione dei metadati dai cataloghi di dati esterni alle tabelle del catalogo REST di Lakehouse per Apache Iceberg
Questo documento spiega come eseguire la migrazione dei metadati dai cataloghi di dati esterni alle tabelle del catalogo REST di Lakehouse per Apache Iceberg. BigQuery Migration Service supporta la migrazione dei metadati dai seguenti metastore esterni:
- Metastore Apache Hive
- Cataloghi REST Apache Iceberg
Limitazioni
- Le migrazioni dei metadati dai cataloghi di dati esterni alle tabelle del catalogo REST di Lakehouse per Apache Iceberg sono una sincronizzazione una tantum. Questa funzionalità non supporta sincronizzazioni continue o periodiche, pertanto le scritture eseguite dopo la migrazione non sono visibili fino a quando non esegui di nuovo la migrazione.
- Gli spazi dei nomi nidificati non sono supportati.
- Il catalogo REST Iceberg supporta solo i file di dati Parquet.
- Lakehouse non supporta le tabelle Apache Iceberg V3.
- Le migrazioni dei metadati dai cataloghi di dati esterni alle tabelle del catalogo REST di Lakehouse per Apache Iceberg supportano solo le migrazioni di un massimo di 10.000 tabelle. Se il tuo carico di lavoro richiede l'elaborazione di più di 10.000 tabelle, ti consigliamo di suddividerlo in più migrazioni.
- Le migrazioni dei metadati dai cataloghi di dati esterni alle tabelle del catalogo REST di Lakehouse per Apache Iceberg non supportano l'utilizzo di policy dell'organizzazione per applicare la condivisione con limitazioni di dominio.
Prima di iniziare
Prima di poter eseguire la migrazione dei metadati dai cataloghi di dati esterni, devi completare i passaggi descritti nelle sezioni seguenti.
Abilitare le API
Abilita le API BigLake, BigQuery Data Transfer, BigQuery Migration, Secret Manager e Storage Transfer.
Ruoli richiesti per abilitare le API
Per abilitare le API, devi disporre dell'autorizzazione serviceusage.services.enable. Se hai
creato il progetto, probabilmente hai già questa autorizzazione tramite il
ruolo Proprietario (roles/owner). In caso contrario, puoi ottenere questa autorizzazione tramite il
ruolo Amministratore Service Usage (roles/serviceusage.serviceUsageAdmin).
Scopri come concedere i ruoli.
Quando abiliti l'API Data Transfer, viene creato un service agent.
Configurare le autorizzazioni
- All'utente o al account di servizio che crea il trasferimento deve essere concesso il ruolo Amministratore BigQuery (
roles/bigquery.admin). Se utilizzi un account di servizio, questo viene utilizzato solo per creare il trasferimento. Quando abiliti l'API Data Transfer, viene creato un agente di servizio (P4SA).
Per assicurarti che l'agente di servizio disponga delle autorizzazioni necessarie per eseguire un trasferimento di metastore Hive, chiedi all'amministratore di concedere i seguenti ruoli IAM all'agente di servizio nel progetto:
- Amministratore Storage Transfer (
roles/storagetransfer.admin) - Service Usage Consumer (
roles/serviceusage.serviceUsageConsumer) - Amministratore spazio di archiviazione (
roles/storage.admin) -
Per eseguire la migrazione dei metadati al catalogo runtime di Lakehouse (catalogo REST Iceberg o catalogo Hive):
Amministratore BigLake (
roles/biglake.admin) -
Per eseguire la migrazione dei metadati a Dataproc Metastore:
Proprietario dei metadati di Dataproc Metastore (
roles/metastore.metadataOwner)
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
L'amministratore potrebbe anche essere in grado di concedere all'agente di servizio le autorizzazioni richieste tramite ruoli personalizzati o altri ruoli predefiniti.
- Amministratore Storage Transfer (
Se utilizzi un account di servizio, concedi all'agente di servizio il ruolo
roles/iam.serviceAccountTokenCreatorcon il seguente comando:gcloud iam service-accounts add-iam-policy-binding SERVICE_ACCOUNT --member serviceAccount:service-PROJECT_NUMBER@gcp-sa-bigquerydatatransfer.s3ns-system.iam.gserviceaccount.com --role roles/iam.serviceAccountTokenCreator
Concedi all'agente di servizio Storage Transfer Service (
project-PROJECT_NUMBER@storage-transfer-service.s3ns-system.iam.gserviceaccount.com) i seguenti ruoli nel progetto:roles/storage.admin- Se esegui la migrazione da un ambiente on-premise/HDFS, devi concedere anche il ruolo
roles/storagetransfer.serviceAgent.
Puoi anche configurare autorizzazioni più granulari. Per ulteriori informazioni, consulta la seguente guida:
Ruoli e autorizzazioni utente richiesti
Per assicurarti che l'agente di servizio disponga delle autorizzazioni necessarie per creare, modificare ed eseguire una migrazione delle tabelle del catalogo REST di Lakehouse per Apache Iceberg, chiedi all'amministratore di concedere i seguenti ruoli IAM all'agente di servizio per l'utente:
- Utente Service Account (
roles/iam.serviceAccountUser) - Editor di gestione delle migrazioni (
roles/bigquerymigration.migrationEditor)
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
L'amministratore potrebbe anche essere in grado di concedere all'agente di servizio le autorizzazioni richieste tramite ruoli personalizzati o altri ruoli predefiniti.
Ruoli e autorizzazioni del account di servizio richiesti
Per assicurarti che il account di servizio fornito dal cliente disponga delle autorizzazioni necessarie per creare, modificare ed eseguire una migrazione delle tabelle del catalogo REST di Lakehouse per Apache Iceberg, chiedi all'amministratore di concedere i seguenti ruoli IAM al account di servizio fornito dal cliente:
-
Accesso al collegamento di rete:
Amministratore rete Compute (
roles/compute.networkAdmin) nel account di servizio -
Accesso a BigQuery Data Transfer Service:
Amministratore BigQuery (
roles/bigquery.admin) nel account di servizio -
Accesso alle risorse di Lakehouse:
Editor BigLake (
roles/biglake.editor) nel account di servizio -
Accesso ai secret:
Funzione di accesso ai secret di Secret Manager (
roles/secretmanager.secretAccessor) nel secret fornito dal cliente
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
L'amministratore potrebbe anche essere in grado di concedere al account di servizio fornito dal cliente le autorizzazioni richieste tramite ruoli personalizzati o altri ruoli predefiniti.
Devi anche creare un'identità di servizio per BigQuery Migration Service e concedergli il ruolo roles/iam.serviceAccountTokenCreator.
Per creare l'identità di servizio, esegui questo comando:
gcloud beta services identity create --service=bigquerymigration.googleapis.com --project=PROJECT_ID
Per concedere il ruolo all'agente di servizio, esegui questo comando:
gcloud iam service-accounts add-iam-policy-binding SERVICE_ACCOUNT --member serviceAccount:service-PROJECT_NUMBER@gcp-sa-bqms.s3ns-system.iam.gserviceaccount.com --role roles/iam.serviceAccountTokenCreator --project PROJECT_ID
Sostituisci quanto segue:
SERVICE_ACCOUNT: l'ID del account di servizio fornito dal clientePROJECT_ID: l'ID progettoPROJECT_NUMBER: il numero del progetto
Configurare il secret
Se esegui la migrazione a un catalogo REST Apache Iceberg, devi creare un secret per autorizzare la migrazione. Il secret deve essere formattato nel seguente modo:
{
"client_id": "CLIENT_ID",
"client_secret": "CLIENT_SECRET<",
"polaris_realm": "POLARIS_REALM"
"scope": "SCOPE"
}Sostituisci quanto segue:
CLIENT_ID: l'ID client OAuth 2.0CLIENT_SECRET: il client secret OAuth 2.0POLARIS_REALM: il realm per il catalogo Polaris. Questo campo è obbligatorio solo per Apache Polaris. Ad esempio,FINANCE.SCOPE: (facoltativo) l'ambito OAuth 2.0. Il valore predefinito èPRINCIPAL_ROLE:ALL.
Creare un catalogo Lakehouse
Crea un catalogo Lakehouse. I metadati di cui è stata eseguita la migrazione vengono archiviati nel bucket Cloud Storage che hai specificato quando hai creato il catalogo.
Eseguire la migrazione dei metadati
Per avviare una migrazione dei metadati alle tabelle del catalogo REST di Lakehouse Iceberg:
Nellaconsole, vai alla pagina Migrazione > Servizi. Cloud de Confiance
In Registra o esegui la migrazione di Open Lakehouse, fai clic su Crea migrazione.
In Configurazione della migrazione, segui questi passaggi:
- Per il tipo di catalogo, seleziona un catalogo esterno.
In Regione, seleziona una regione. La regione selezionata determina dove viene eseguita l'orchestrazione della migrazione e il trasferimento dei dati. Determina anche dove il servizio di migrazione utilizza o crea risorse, come collegamenti di rete o secret.
Sono supportati solo i secret regionali. La regione del secret deve corrispondere alla regione in questo campo.
In Nome visualizzato della migrazione, inserisci un nome per questa migrazione.
In Configurazione del sistema di origine, segui questi passaggi:
- In URL, inserisci l'URL dell'endpoint di base che funge da punto di ingresso per il metastore Apache Iceberg o Apache Hive.
- In Service account, seleziona un account di servizio dall'elenco. Se non specificato, questa migrazione viene eseguita utilizzando le credenziali utente.
- (Facoltativo) In Collegamento di rete, seleziona un collegamento di rete.
Fai clic su Continua.
Al termine della migrazione dei metadati, i metadati dei cataloghi esterni vengono archiviati nel bucket Cloud Storage che hai specificato quando hai creato il catalogo Lakehouse.
Prezzi
Il trasferimento dei metadati alle tabelle del catalogo REST di Lakehouse Iceberg non comporta costi. Una volta trasferiti i metadati, vengono applicati i prezzi di Lakehouse.