Resolver problemas de transferências de dados
Nesta página, explicamos como resolver problemas ao transferir ou carregar dados no BigQuery. É possível resolver erros comuns relacionados ao Serviço de transferência de dados do BigQuery, conexões de rede em Cloud de Confiance by S3NS, Amazon Web Services (AWS), Cloud SQL e redes de nuvem privada virtual (VPC), além de jobs de carregamento de dados CSV do Cloud Storage.
Resolver problemas nas configurações de transferência
Para informações sobre como resolver problemas com o serviço de transferência de dados do BigQuery, consulte Resolver problemas nas configurações de transferência.
Se você configurar ou executar transferências de fontes de dados externas ou de parceiros, consulte Resolver problemas na configuração de transferências de terceiros.
Diagnosticar jobs com visualizações do INFORMATION_SCHEMA
É possível consultar a visualização INFORMATION_SCHEMA.JOBS para diagnosticar jobs de carga e consultas de transferência com falha ou lentos quase em tempo real. Quando um job de carregamento ou uma consulta de transferência falha, inspecione as colunas error_result e errors para identificar a causa raiz, como incompatibilidades de esquema, limites de cota ou erros de permissão.
O exemplo a seguir consulta INFORMATION_SCHEMA.JOBS para recuperar detalhes de erros de jobs de carregamento com falha nas últimas 24 horas:
SELECT job_id, creation_time, user_email, error_result.reason AS error_reason, error_result.message AS error_message, errors FROM `region-REGION`.INFORMATION_SCHEMA.JOBS WHERE job_type = 'LOAD' AND state = 'DONE' AND error_result IS NOT NULL AND creation_time > TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL 1 DAY) ORDER BY creation_time DESC;
Substitua <var>REGION</var> pelo nome da região do conjunto de dados, como us ou
europe-west1.
Resolver problemas de conexão de rede de transferência
Ao transferir dados de provedores de nuvem externos ou instâncias de banco de dados privadas, o roteamento de rede ou as regras de firewall podem bloquear a conectividade. Use as seções a seguir para resolver problemas com anexos de VPN e conexões de rede particular.
VPN e anexos de rede da AWSCloud de Confiance
Se você tiver problemas para configurar a conexão de rede, faça o seguinte:
- Verifique se as conexões VPN estão funcionando no console da AWS e no console do Cloud de Confiance .
- Verifique os registros da VPN em busca de erros ou pacotes descartados.
- Verifique se as tabelas de rotas na AWS e no Cloud de Confiance estão configuradas corretamente.
- Verifique se as portas necessárias estão abertas nos grupos de segurança da AWS e nas regras de firewall do Cloud de Confiance .
Para mais informações sobre como configurar anexos de VPN, consulte Criar uma VPN e um anexo de rede do AWSCloud de Confiance .
Acesso à instância do Cloud SQL
Se você tiver problemas para configurar a rede, faça o seguinte:
- Verifique se o peering de VPC está estabelecido e se as rotas estão configuradas corretamente.
- Verifique se as regras de firewall permitem o tráfego nas portas necessárias.
- Verifique os registros do proxy do Cloud SQL em busca de erros e confira se ele está sendo executado corretamente.
- Verifique se a conexão de rede está configurada e conectada corretamente.
Para mais informações sobre como configurar o acesso privado ao banco de dados, consulte Conectar-se a uma instância do Cloud SQL.
Resolver problemas ao carregar arquivos CSV
Ao carregar dados CSV do Cloud Storage no BigQuery, os jobs podem falhar devido a erros de formatação, limites de tamanho de arquivo ou problemas de detecção automática de esquema. Use as seções a seguir para resolver erros comuns de carregamento de CSV.
Resolver erros de análise
Se houver um problema ao analisar os arquivos CSV, o
recurso errors do job de carregamento será
preenchido com os detalhes do erro.
Geralmente, esses erros identificam o início da linha problemática com um deslocamento
de byte. Para arquivos descompactados, é possível usar gcloud storage com o argumento --recursive para
acessar a linha relevante.
Por exemplo, você executa o
comando bq load
e recebe um erro:
bq load
--skip_leading_rows=1 \
--source_format=CSV \
mydataset.mytable \
gs://my-bucket/mytable.csv \
'Number:INTEGER,Name:STRING,TookOffice:STRING,LeftOffice:STRING,Party:STRING'
O erro na saída é semelhante ao seguinte:
Waiting on bqjob_r5268069f5f49c9bf_0000018632e903d7_1 ... (0s)
Current status: DONE
BigQuery error in load operation: Error processing job
'myproject:bqjob_r5268069f5f49c9bf_0000018632e903d7_1': Error while reading
data, error message: Error detected while parsing row starting at position: 1405.
Error: Data between close quote character (") and field separator.
File: gs://my-bucket/mytable.csv
Failure details:
- gs://my-bucket/mytable.csv: Error while reading data,
error message: Error detected while parsing row starting at
position: 1405. Error: Data between close quote character (") and
field separator. File: gs://my-bucket/mytable.csv
- Error while reading data, error message: CSV processing encountered
too many errors, giving up. Rows: 22; errors: 1; max bad: 0; error
percent: 0
Com base no erro anterior, há um erro de formato no arquivo.
Para ver o conteúdo do arquivo, execute o
comando gcloud storage cat:
gcloud storage cat 1405-1505 gs://my-bucket/mytable.csv --recursive
O resultado será o seguinte:
16,Abraham Lincoln,"March 4, 1861","April 15, "1865,Republican 18,Ulysses S. Grant,"March 4, 1869", ...
Com base na saída do arquivo, o problema é uma aspa incorreta em
"April 15, "1865.
Arquivos CSV compactados
A depuração de erros de análise é mais desafiadora para arquivos CSV compactados, já que o deslocamento de byte informado se refere ao local no arquivo não compactado.
O comando gcloud storage cat a seguir transmite o arquivo do Cloud Storage, descompacta o arquivo, identifica o deslocamento de byte adequado e imprime a linha com o erro de formato:
gcloud storage cat gs://my-bucket/mytable.csv.gz | gunzip - | tail -c +1406 | head -n 1
O resultado será o seguinte:
16,Abraham Lincoln,"March 4, 1861","April 15, "1865,Republican
Resolver erros de cota
Use as informações desta seção para resolver problemas de erros de cota ou limite relacionados ao carregamento de arquivos CSV no BigQuery.
Se você carregar um arquivo CSV grande usando o comando bq load com a
sinalização --allow_quoted_newlines,
poderá encontrar esse erro.
Mensagem de erro
Input CSV files are not splittable and at least one of the files is larger than
the maximum allowed size. Size is: ...
Resolução
Para resolver esse erro, faça o seguinte:
- Defina a sinalização
--allow_quoted_newlinescomofalse. - Divida o arquivo CSV em partes menores que tenham menos de 4 GB.
Para mais informações sobre os limites aplicáveis quando você carrega dados no BigQuery, consulte Jobs de carregamento.
Resolver problemas de detecção automática de esquema
Ao detectar automaticamente o esquema de arquivos CSV, você pode encontrar o seguinte erro:
Erro: Error while reading data, error message: CSV processing encountered
too many errors, giving up.
Esse erro pode ocorrer quando o arquivo CSV tem uma linha de cabeçalho com valores de string, e o BigQuery não a detectou como um cabeçalho. É possível usar a opção
--skip_leading_rows para ignorar a linha de cabeçalho.