Descobrir e catalogar dados do Cloud Storage
Este documento explica como usar a descoberta automática do Knowledge Catalog, um recurso do BigQuery que permite verificar dados em buckets do Cloud Storage para extrair e catalogar metadados. Como parte da verificação de descoberta, a descoberta automática cria tabelas externas ou do BigLake para dados estruturados e tabelas de objetos para dados não estruturados. Com as tabelas do BigLake e as tabelas externas, é possível consultar dados estruturados em repositórios de dados externos. Consulte Introdução às tabelas do BigLake e Introdução às tabelas externas. Já as tabelas de objetos fornecem um índice de metadados sobre dados não estruturados no Cloud Storage. Consulte Introdução às tabelas de objetos. Esses dados centralizados facilitam insights, segurança e governança de dados com tecnologia de IA.
Para usar a descoberta automática de dados do Cloud Storage, crie e execute uma verificação de descoberta.
A descoberta automática também é chamada de descoberta independente.
Visão geral da verificação de descoberta
Uma verificação de descoberta faz o seguinte:
- Verifica os dados no bucket do Cloud Storage ou caminho.
- Agrupa dados estruturados e semiestruturados em tabelas.
- Coleta metadados, como nome da tabela, esquema e definição de partição.
- Cria e atualiza tabelas externas do BigLake, externas que não são do BigLake ou de objetos do BigLake no BigQuery usando o esquema e a definição de partição.
Dados estruturados e semiestruturados
Os dados estruturados e semiestruturados incluem formatos como Avro, Parquet e CSV. A verificação de descoberta registra grupos desses arquivos como tabelas externas do BigLake. A verificação só detecta arquivos se eles estiverem em pastas com o mesmo formato de dados e um esquema compatível.
- Caso de uso: centralizar arquivos estruturados e fortemente tipados no BigQuery para executar consultas analíticas de SQL sem definir esquemas manualmente.
- Fluxo de trabalho:
- Organize seus arquivos estruturados em pastas. Verifique se os arquivos em cada pasta compartilham o mesmo formato de dados e têm um esquema compatível.
- Crie uma verificação de descoberta e forneça o ID da conexão de recursos do Cloud de Confiance .
- A verificação agrupa os dados e os registra como tabelas externas do BigLake.
- Consulte as tabelas publicadas diretamente no BigQuery usando SQL.
Formatos compatíveis
- Parquet
- Avro
- ORC
- JSON (apenas o formato delimitado por nova linha)
- CSV (mas não arquivos CSV com linhas de comentários)
Formatos de compactação
Para dados estruturados e semiestruturados, a verificação de descoberta é compatível com os seguintes formatos de compactação:
Compactação interna para os seguintes formatos:
Compactação Exemplo de extensão de arquivo Formato aceito gzip .gz.parquetParquet lz4 .lz4.parquetParquet Snappy .snappy.parquetParquet, ORC, Avro lzo .lzo.parquetParquet, ORC Compactação externa para arquivos JSON e CSV:
- gzip
- bzip2
Dados não estruturados
Para dados não estruturados, como imagens e vídeos, a verificação de descoberta detecta e registra grupos de arquivos que compartilham o mesmo formato de arquivo de dados. Os arquivos precisam estar em pastas com o mesmo formato. Por exemplo, gs://images/group1 precisa conter apenas imagens GIF, e gs://images/group2 precisa conter apenas imagens JPEG para que a verificação de descoberta detecte e registre duas tabelas de objetos do BigLake.
- Caso de uso: catalogar arquivos não estruturados, como imagens ou documentos, para realizar inferências de machine learning usando o BigQuery ML ou funções remotas.
- Fluxo de trabalho:
- Organize seus arquivos não estruturados em pastas. Verifique se os arquivos em cada pasta têm o mesmo formato.
- Crie uma verificação de descoberta.
- A verificação agrupa os dados não estruturados e os registra como tabelas de objetos do BigLake.
- Faça inferência nos seus arquivos não estruturados diretamente no BigQuery.
Formatos compatíveis
A verificação de descoberta é compatível com os seguintes formatos não estruturados:
- Imagem (como JPEG, PNG e BMP)
- Documentos (como PDF, apresentações de slides e relatórios de texto)
- Áudio ou vídeo (como WAV, MP3 e MP4)
Para mais informações, consulte arquivos de objetos compatíveis.
Formatos de compactação
Para tabelas de objetos, a compactação é gerenciada principalmente por metadados de objetos do Cloud Storage, em vez de configurações internas do BigQuery.
- Compactação de metadados padrão: o BigQuery reconhece automaticamente arquivos compactados com gzip e bzip2 se eles usarem as extensões padrão .gz ou .bz2.
- Content-Encoding: é possível usar os metadados Content-Encoding gzip no Cloud Storage para veicular arquivos compactados e manter o tipo de conteúdo original.
- Compactação interna de mídia: formatos inerentemente compactados (como JPEG para imagens, MP3 para áudio e MP4 para vídeo) são compatíveis de forma nativa.
Registro e disponibilidade de tabelas
As tabelas descobertas são registradas no BigQuery como um dos seguintes tipos, dependendo do formato de dados e da configuração de verificação:
- Tabelas de objetos do BigLake. Criado para dados não estruturados, como imagens e vídeos.
- Tabelas externas do BigLake. Criado para dados estruturados e semiestruturados quando você fornece um ID de conexão de recurso Cloud de Confiance durante a configuração da verificação.
- Tabelas externas (não BigLake): criadas para dados estruturados e semiestruturados se você não fornecer um ID de conexão de recurso.
Com esse registro, os dados ficam disponíveis para análise no BigQuery. O armazenamento em cache de metadados para tabelas do BigLake e tabelas de objetos também é ativado. Todas as tabelas do BigLake são ingeridas automaticamente no Knowledge Catalog para pesquisa e descoberta.
Para começar a trabalhar com as tabelas recém-registradas, você pode:
- Execute uma consulta no BigQuery.
- Pesquise recursos no Knowledge Catalog.
Limitações e cotas
Uma verificação de descoberta não é compatível com os formatos de tabela Apache Iceberg e Delta Lake.
Para saber o limite de tabelas que uma verificação de descoberta pode processar, consulte Cotas e limites.
Antes de começar
Ativar a API Dataplex.
Funções necessárias para ativar APIs
Para ativar APIs, você precisa da permissão serviceusage.services.enable. Se você
criou o projeto, provavelmente já tem essa permissão com o papel de
Proprietário (roles/owner). Caso contrário, é possível receber essa permissão com o papel de
Administrador do Service Usage (roles/serviceusage.serviceUsageAdmin).
Saiba como conceder papéis.
Papéis necessários para a conta de serviço do Knowledge Catalog
Antes de começar, atribua as permissões do IAM à conta de serviço do Knowledge Catalog no seu projeto.
service-PROJECT_NUMBER@gcp-sa-dataplex.s3ns-system.iam.gserviceaccount.com
Substitua PROJECT_NUMBER pelo projeto em que a
API Dataplex está ativada.
Para garantir que a conta de serviço do Knowledge Catalog tenha as permissões necessárias para criar e executar uma verificação de descoberta, peça ao administrador para conceder os seguintes papéis do IAM à conta de serviço do Knowledge Catalog:
- Agente de serviço do Dataplex Discovery (
roles/dataplex.discoveryServiceAgent) no bucket de armazenamento - Agente de serviço de publicação do Dataplex Discovery (
roles/dataplex.discoveryPublishingServiceAgent) no projeto do usuário -
Criar tabelas do BigLake:
Agente de serviço de publicação do BigLake do Dataplex Discovery (
roles/dataplex.discoveryBigLakePublishingServiceAgent) na conexão do BigQuery
Para mais informações sobre a concessão de papéis, consulte Gerenciar o acesso a projetos, pastas e organizações.
Esses papéis predefinidos contêm as permissões necessárias para criar e executar uma verificação de descoberta. Para acessar as permissões exatas necessárias, expanda a seção Permissões necessárias:
Permissões necessárias
As seguintes permissões são necessárias para criar e executar uma verificação de descoberta:
-
bigquery.datasets.createno projeto da fonte de dados -
storage.buckets.getno bucket da fonte de dados -
storage.objects.getno bucket da fonte de dados -
storage.objects.listno bucket da fonte de dados -
bigquery.datasets.getno projeto da fonte de dados -
Forneça uma conexão:
-
bigquery.connections.delegatena conexão do BigQuery -
bigquery.connections.usena conexão do BigQuery
-
O administrador também pode conceder essas permissões à conta de serviço do Knowledge Catalog com papéis personalizados ou outros papéis predefinidos.
Papéis obrigatórios para a conta de serviço de conexão do BigQuery
Para garantir que a conta de serviço de conexão do BigQuery tenha as permissões
necessárias para criar uma verificação de descoberta,
peça ao administrador para conceder o papel do IAM de
Agente de serviço de descoberta do Dataplex (roles/dataplex.discoveryServiceAgent) à conta de serviço de conexão do BigQuery no bucket do Cloud Storage.
Esse papel predefinido contém as permissões necessárias para criar uma verificação de descoberta. Para acessar as permissões exatas necessárias, expanda a seção Permissões necessárias:
Permissões necessárias
As seguintes permissões são necessárias para criar uma verificação de descoberta:
-
bigquery.datasets.createno projeto da fonte de dados -
storage.buckets.getno bucket da fonte de dados -
storage.objects.getno bucket da fonte de dados -
storage.objects.listno bucket da fonte de dados -
bigquery.datasets.getno projeto da fonte de dados -
Forneça uma conexão:
-
bigquery.connections.delegatena conexão do BigQuery -
bigquery.connections.usena conexão do BigQuery
-
O administrador também pode conceder essas permissões à conta de serviço do BigQuery Connection com papéis personalizados ou outros papéis predefinidos.
Funções necessárias para usuários finais
Para receber as permissões necessárias para criar e gerenciar verificações de descoberta de dados, peça ao administrador para conceder a você os seguintes papéis do IAM no bucket do Cloud Storage:
-
Acesso total aos recursos do DataScan:
Administrador do DataScan Dataplex (
roles/dataplex.dataScanAdmin): seu projeto -
Acesso de gravação aos recursos do DataScan:
Editor do DataScan Dataplex (
roles/dataplex.dataScanEditor): seu projeto -
Acesso de leitura aos recursos do DataScan, exceto os resultados:
Leitor do DataScan Dataplex (
roles/dataplex.dataScanViewer): seu projeto -
Acesso de leitura aos recursos do DataScan, incluindo os resultados:
Leitor de dados do DataScan Dataplex (
roles/dataplex.dataScanDataViewer): seu projeto
Para mais informações sobre a concessão de papéis, consulte Gerenciar o acesso a projetos, pastas e organizações.
Esses papéis predefinidos contêm as permissões necessárias para criar e gerenciar verificações de descoberta de dados. Para acessar as permissões exatas necessárias, expanda a seção Permissões necessárias:
Permissões necessárias
As seguintes permissões são necessárias para criar e gerenciar verificações de descoberta de dados:
-
Crie um DataScan:
dataplex.datascans.createno seu projeto -
Excluir uma DataScan:
dataplex.datascans.deleteno seu projeto ou em um recurso DataScan -
Ver detalhes do DataScan sem os resultados:
dataplex.datascans.getno seu projetor, um recurso do DataScan -
Ver detalhes da DataScan, incluindo resultados:
dataplex.datascans.getDatano seu projeto ou em um recurso da DataScan -
Listar DataScans:
dataplex.datascans.listno seu projeto ou em um recurso DataScan -
Execute uma DataScan:
dataplex.datascans.runno seu projeto ou em um recurso DataScan -
Atualize a descrição de uma DataScan:
dataplex.datascans.updateno seu projetor, um recurso DataScan -
Confira as permissões do IAM do DataScan:
dataplex.datascans.getIamPolicyno seu projeto ou em um recurso do DataScan -
Defina as permissões do IAM no DataScan:
dataplex.datascans.setIamPolicyno seu projeto ou em um recurso DataScan
Essas permissões também podem ser concedidas com funções personalizadas ou outros papéis predefinidos.
Criar uma verificação de descoberta
Para descobrir dados, crie e execute uma verificação de descoberta. É possível definir uma programação para a verificação ou executá-la sob demanda.
Quando a verificação de descoberta é executada, ela cria um novo conjunto de dados no BigQuery que corresponde ao bucket do Cloud Storage verificado. O nome do conjunto de dados do BigQuery é o mesmo do bucket do Cloud Storage. Caracteres inválidos no nome do bucket
são substituídos por um sublinhado. Se o nome do conjunto de dados não estiver disponível, um sufixo será
adicionado (por exemplo, _discovered_001). O conjunto de dados contém as
tabelas externas do BigLake ou que não são do BigLake
criadas pela verificação de descoberta para análise posterior.
Console
No Cloud de Confiance console, acesse a página Criação de metadados.
Na guia Descoberta do Cloud Storage, clique em Criar.
No painel Criar verificação de descoberta, configure os detalhes sobre os dados a serem verificados.
Digite um nome para a verificação.
No campo ID da verificação, insira um ID exclusivo que siga as convenções de nomenclatura de recursos em Cloud de Confiance. Se você não fornecer um ID, a verificação de descoberta vai gerar um.
Opcional: forneça uma descrição da verificação.
Para especificar o bucket do Cloud Storage que contém os arquivos a serem verificados, no campo Bucket, procure e selecione o bucket.
Opcional: defina os dados a serem incluídos ou excluídos da verificação de descoberta fornecendo uma lista de padrões glob para filtragem de arquivos.
- Incluir: se apenas um subconjunto dos dados precisar ser verificado, forneça uma lista de padrões glob que correspondam aos objetos a serem incluídos.
- Excluir: forneça uma lista de padrões glob que correspondam aos objetos a serem excluídos.
Por exemplo, se você quiser excluir
gs://test_bucket/foo/..da verificação de descoberta, insira**/foo/**como o caminho de exclusão. As aspas causam erros. Não se esqueça de inserir**/foo/**em vez de"**/foo/**".Se você fornecer padrões de inclusão e exclusão, os de exclusão serão aplicados primeiro.
Em Opções de dados não estruturados, selecione Ativar inferência semântica.
Essa opção é obrigatória se você quiser ver insights de dados não estruturados no Knowledge Catalog. Para mais informações, consulte Sobre os insights de dados não estruturados.
Opcional: em Projeto, selecione o projeto do conjunto de dados do BigQuery que contém as tabelas externas do BigLake ou não BigLake criadas pela verificação de descoberta. Se não for fornecido, o conjunto de dados será criado no projeto que contém o bucket do Cloud Storage.
Em Tipo de local, selecione Região ou Multirregião (o que estiver disponível) em que o conjunto de dados de publicação do BigQuery será criado.
Para criar tabelas do BigLake com base nos dados verificados, no campo ID da conexão, forneça o ID da conexão do recurso Cloud de Confiance . Para mais informações, consulte Conexões de recursos doCloud de Confiance no BigQuery.
É possível criar um novo ID de conexão no mesmo local do conjunto de dados do BigQuery, que é compatível com o local do bucket do Cloud Storage.
Se você não fornecer um ID de conexão de recurso, a verificação de descoberta criará tabelas externas que não são do BigLake. Para entender as diferenças entre esses tipos de tabelas externas e por que o serviço de descoberta pode escolher um em vez de outro, consulte a comparação de diferenças comportamentais.
Na seção Frequência de descoberta, configure quando você quer que a verificação de descoberta seja executada:
Repetir: a verificação é executada em uma programação predefinida. Informe o horário de início, os dias para executar a verificação e a frequência, como "a cada hora".
Sob demanda: a verificação é executada sob demanda.
Opcional: na seção Especificações JSON ou CSV, especifique como a verificação deve processar arquivos JSON e CSV. Clique em Especificações JSON ou CSV.
- Para configurar as opções de JSON, selecione Ativar opções de análise JSON.
- Desativar inferência de tipo: se a verificação de descoberta deve inferir tipos de dados ao verificar dados. Se você desativar a inferência de tipo para dados JSON, todas as colunas serão registradas como tipos primitivos, como string, número ou booleano.
- Formato de codificação: a codificação de caracteres dos dados, como UTF-8, US-ASCII ou ISO-8859-1. Se você não especificar um valor, o UTF-8 será usado como padrão.
- Para configurar as opções de CSV, selecione Ativar opções de análise de CSV.
- Desativar inferência de tipo: se a verificação de descoberta deve inferir tipos de dados ao verificar dados. Se você desativar a inferência de tipo para dados CSV, todas as colunas serão registradas como strings.
- Linhas de cabeçalho: o número de linhas de cabeçalho,
0ou1. Se você especificar o valor0, a verificação de descoberta vai inferir cabeçalhos e extrair os nomes das colunas do arquivo. O padrão é0; - Caractere delimitador de coluna: o caractere usado para separar valores. Forneça um único caractere,
\r(retorno de carro) ou\n(nova linha). O padrão é uma vírgula (,). - Formato de codificação: a codificação de caracteres dos dados, como
UTF-8,US-ASCIIouISO-8859-1. Se você não especificar um valor, o UTF-8 será usado como padrão.
- Para configurar as opções de JSON, selecione Ativar opções de análise JSON.
Clique em Criar (para uma verificação programada), Executar agora (para uma verificação sob demanda) ou Criar e executar (para uma verificação única).
- Verificação programada: é executada de acordo com a programação definida.
- Verificação sob demanda: é executada uma vez inicialmente quando você a cria, e pode ser executada a qualquer momento. A verificação de descoberta pode levar vários minutos para ser executada.
- Verificação única: é executada automaticamente. Ele é excluído automaticamente quando atinge o limite de time to live (TTL) definido, um valor que determina a duração em que uma verificação de descoberta permanece ativa após a execução. O valor do TTL pode variar de 0 segundos (exclusão imediata) a 365 dias. Uma verificação de descoberta sem um TTL especificado é excluída automaticamente após 24 horas.
gcloud
Para criar uma verificação de descoberta, use o comando gcloud dataplex datascans create data-discovery.
gcloud dataplex datascans create data-discovery --location=LOCATION --data-source-resource=BUCKET_PATH
Substitua:
LOCATION: o local em que você quer criar a verificação de descobertaBUCKET_PATH: o caminho do Cloud Storage do bucket que você quer verificar
REST
Para criar uma verificação de descoberta, use o método dataScans.create.
Consultar tabelas publicadas do BigLake
Depois de executar a verificação de descoberta, as tabelas do BigLake são publicadas em um novo conjunto de dados no BigQuery. As tabelas ficam disponíveis para análise no BigQuery usando SQL ou no Serviço gerenciado para Apache Spark usando Apache Spark ou HiveQL.
SQL
É possível visualizar ou consultar tabelas no BigQuery. Para mais informações sobre como executar consultas no BigQuery, consulte Executar uma consulta.
Apache Spark
Para consultar tabelas do BigLake usando o Spark SQL em um job sem servidor do Serviço Gerenciado para Apache Spark, siga estas etapas:
Crie um script do PySpark semelhante ao exemplo a seguir:
from pyspark.sql import SparkSession session = ( SparkSession.builder.appName("testing") .config("viewsEnabled","true") .config("materializationDataset", "DATASET_ID") .config("spark.hive.metastore.bigquery.project.id", "PROJECT_ID") .config("spark.hive.metastore.client.factory.class", "com.google.cloud.bigquery.metastore.client.BigQueryMetastoreClientFactory") .enableHiveSupport() .getOrCreate() ) session.sql("show databases").show() session.sql("use TABLE_NAME").show() session.sql("show tables").show() sql = "SELECT * FROM DATASET_ID.TABLE_ID LIMIT 10" df = session.read.format("bigquery").option("dataset", "DATASET_ID").load(sql) df.show()
Substitua:
DATASET_ID: ID do conjunto de dados para o qual os usuários têm permissão de criaçãoPROJECT_ID: ID do projeto com a tabela do BigLakeTABLE_NAME: nome da tabela do BigLakeTABLE_ID: ID da tabela do BigLake
Gerenciar tabelas publicadas do BigLake
As tabelas publicadas do BigLake são criadas e gerenciadas no BigQuery pela verificação de descoberta. Por padrão, a verificação de descoberta processa a descoberta de novos dados, as inferências e a evolução de esquema sempre que as verificações programadas ou sob demanda são executadas. Para indicar que os metadados são gerenciados pela verificação, ela publica tabelas com o rótulo metadata-managed-mode definido como discovery-managed.
Se você quiser gerenciar o esquema e outros metadados, como opções de CSV ou JSON, defina o rótulo metadata-managed-mode como user_managed. Assim, o
esquema permanece inalterado quando a próxima verificação de descoberta é executada. Essa abordagem pode ser útil em cenários em que o esquema inferido pela verificação de descoberta está incorreto ou é diferente do esperado para uma determinada tabela. Quando o rótulo metadata-managed-mode é definido como user_managed, o custo pode ser reduzido.
Para atualizar o rótulo, edite o valor da chave de rótulo
metadata-managed-mode para user_managed em vez de discovery-managed. Nesse caso, a verificação de descoberta não atualiza o esquema da tabela enquanto o rótulo user_managed estiver anexado a ela.
Atualizar tabelas publicadas do BigLake
Para tabelas do BigLake publicadas usando os jobs de verificação de descoberta com a configuração padrão, o esquema e outros metadados são atualizados automaticamente a cada execução do job de verificação de descoberta na frequência programada.
Para atualizar uma tabela do BigLake publicada, siga estas etapas:
No console do Cloud de Confiance , acesse a página BigQuery.
No painel à esquerda, clique em Explorer:

Se o painel esquerdo não aparecer, clique em Expandir painel esquerdo para abrir.
No painel Explorer, expanda o projeto, clique em Conjuntos de dados e selecione um conjunto de dados.
Clique em Visão geral > Tabelas e selecione a tabela.
Na guia Detalhes, na seção Marcadores, verifique se o marcador metadata-managed-mode está definido como user_managed. Se estiver definido como um valor diferente, siga estas etapas:
Clique em Editar detalhes.
Ao lado da chave metadata-managed-mode, no campo valor, insira
user_managed.
Excluir tabelas publicadas do BigLake
Para excluir uma tabela publicada do BigLake, siga estas etapas:
Exclua os arquivos de dados da tabela no bucket do Cloud Storage.
No console do Cloud de Confiance , acesse a página BigQuery.
No painel à esquerda, clique em Explorer:

No painel Explorer, expanda o projeto, clique em Conjuntos de dados e selecione um conjunto de dados.
Clique em Visão geral > Tabelas e selecione a tabela.
No painel Detalhes, na seção Marcadores, verifique se o marcador metadata-managed-mode não está definido como
user_managed. Se estiver definido comouser_managed, siga estas etapas:Clique em Editar detalhes .
Ao lado da chave metadata-managed-mode, no campo valor, insira
discovery-managed.
Clique em Executar. A verificação de descoberta é executada sob demanda.
Depois que a verificação de descoberta é executada, a tabela do BigLake é excluída no BigQuery e não fica disponível para listagem ou consulta pelo Spark.
Executar uma verificação de descoberta sob demanda
Para executar uma verificação de descoberta sob demanda, selecione uma das seguintes opções.
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, clique na verificação de descoberta que você quer executar.
Clique em Executar agora.
gcloud
Para executar uma verificação de descoberta, use o
comando gcloud dataplex datascans run:
gcloud dataplex datascans runDATASCAN\ --location=LOCATION
Substitua as seguintes variáveis:
LOCATION: a região Cloud de Confiance by S3NS em que a verificação de descoberta foi criada.DATASCAN: o nome da verificação de descoberta.
REST
Para executar uma verificação de descoberta sob demanda, use o
método dataScans.run
na API Dataplex.
Listar verificações de descoberta
Para listar suas verificações de descoberta, selecione uma das seguintes opções.
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, as verificações de descoberta criadas no projeto são listadas.
gcloud
gcloud dataplex datascans list --location=LOCATION --project=PROJECT_ID
Substitua:
LOCATION: o local do projetoPROJECT_ID: o ID do projeto do Cloud de Confiance
REST
Para recuperar a lista de verificações de descoberta no seu projeto, use o método dataScans.list
na API Dataplex.
Ver uma verificação de descoberta
Para conferir uma verificação de descoberta, selecione uma das seguintes opções:
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, clique na verificação de descoberta para conferir os detalhes.
- A seção Detalhes da verificação mostra detalhes sobre a verificação de descoberta.
- A seção Status da verificação mostra os resultados da descoberta do job de verificação mais recente.
gcloud
gcloud dataplex datascans jobs describe JOB \
--location=LOCATION \
--datascan=DATASCAN \
--view=FULLSubstitua:
JOB: o ID do job de verificação de descoberta.LOCATION: a região Cloud de Confiance by S3NS em que a verificação de descoberta foi criada.DATASCAN: o nome da verificação de descoberta a que o job pertence.
REST
Para conferir os resultados de uma verificação de descoberta de dados, use o
método dataScans.get
na API Dataplex.
Conferir resultados históricos da verificação de descoberta
Para conferir os resultados históricos da verificação de descoberta, selecione uma das seguintes opções:
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, clique na verificação de descoberta para conferir os detalhes.
Clique no painel Histórico de verificações. O painel Histórico de verificação fornece informações sobre jobs anteriores, incluindo o número de registros verificados em cada job, o status de cada job e o horário em que os jobs foram executados.
Para ver informações detalhadas sobre uma tarefa, clique nela na coluna código da tarefa.
gcloud
gcloud dataplex datascans jobs list \
--location=LOCATION \
--datascan=DATASCANSubstitua:
LOCATION: a região Cloud de Confiance by S3NS em que a verificação de descoberta foi criada.DATASCAN: o nome da verificação de descoberta a que o job pertence.
REST
Para conferir todos os jobs de uma verificação de descoberta, use o
método dataScans.jobs.list
na API Dataplex.
Atualizar uma verificação de descoberta
Para mudar a programação de uma verificação de descoberta, por exemplo, de sob demanda para recorrente, atualize a verificação.
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, clique em Ações > Editar na verificação de descoberta que você quer atualizar.
Edite os valores.
Clique em Salvar.
gcloud
Para atualizar uma verificação de descoberta, use o comando gcloud dataplex datascans update data-discovery.
gcloud dataplex datascans update data-discovery SCAN_ID --location=LOCATION --description=DESCRIPTION
Substitua:
SCAN_ID: o ID da verificação de descoberta que você quer atualizar.LOCATION: a região Cloud de Confiance by S3NS em que a verificação de descoberta foi criada.DESCRIPTION: a nova descrição da verificação de descoberta
REST
Para atualizar uma verificação de descoberta, use o
método dataScans.patch
na API Dataplex.
Excluir uma verificação de descoberta
Para excluir uma verificação de descoberta, selecione uma das seguintes opções:
Console
No console do Cloud de Confiance , acesse a página BigQuery.
No menu de navegação, clique em Governança > Curadoria de metadados.
No painel Descoberta do Cloud Storage, clique em Ações > Excluir na verificação de descoberta que você quer excluir.
Clique em Excluir.
gcloud
gcloud dataplex datascans delete SCAN_ID --location=LOCATION --async
Substitua:
SCAN_ID: o ID da verificação de descoberta que você quer excluir.LOCATION: a região Cloud de Confiance by S3NS em que a verificação de descoberta foi criada.
REST
Para excluir uma verificação de descoberta, use o
método dataScans.delete
na API Dataplex.