Monitorar clusters e jobs do Serviço Gerenciado para Apache Spark

Este documento aborda ferramentas e técnicas que podem ser usadas para monitorar a integridade e o desempenho de clusters e jobs do Spark Gerenciado.

Interfaces da Web de código aberto

Muitos componentes de código aberto do Serviço gerenciado para Apache Spark, como o Apache Hadoop e o Apache Spark, oferecem interfaces da Web. Essas interfaces podem ser usadas para monitorar recursos do cluster e a performance do job. Por exemplo, é possível usar a UI do usuário do YARN Resource Manager para conferir a alocação de recursos do aplicativo YARN em um cluster do Serviço Gerenciado para Apache Spark.

Servidor de histórico persistente

As interfaces da Web de código aberto em execução em um cluster ficam disponíveis enquanto o cluster está em execução, mas são encerradas quando você exclui o cluster. Para conferir os dados do cluster e do job depois que um cluster é excluído, crie um servidor de histórico permanente (PHS, na sigla em inglês).

Exemplo: você encontra um erro ou uma lentidão no job que quer analisar. Você para ou exclui o cluster de jobs e, em seguida, visualiza e analisa os dados do histórico de jobs usando o PHS.

Depois de criar um PHS, ative-o em um cluster do Serviço Gerenciado para Apache Spark ou em uma carga de trabalho em lote do Serviço Gerenciado para Apache Spark ao criar o cluster ou enviar a carga de trabalho em lote. Um PHS pode acessar dados de histórico de jobs executados em vários clusters, permitindo monitorar jobs em um projeto em vez de monitorar UIs separadas em execução em clusters diferentes.

Registros do Serviço Gerenciado para Apache Spark

O Serviço gerenciado para Apache Spark coleta os registros gerados pelo Apache Hadoop, Spark, Hive, ZooKeeper e outros sistemas de código aberto em execução nos seus clusters e os envia para o Logging. Esses registros são agrupados com base na origem deles, o que permite selecionar e visualizar os registros de interesse. Por exemplo, os registros do YARN NodeManager e do Spark Executor gerados em um cluster são rotulados separadamente. Consulte os registros do Serviço Gerenciado para Apache Spark para mais informações sobre o conteúdo e as opções de registro do Serviço Gerenciado para Apache Spark.

Cloud Logging

O Logging é um sistema de gerenciamento de registros em tempo real totalmente gerenciado. Ele fornece armazenamento para registros ingeridos de serviços do Cloud de Confiance e ferramentas para pesquisar, filtrar e analisar registros em grande escala. Os clusters do Serviço Gerenciado para Apache Spark geram vários registros, incluindo registros do agente de serviço do Serviço Gerenciado para Apache Spark, registros de inicialização do cluster e registros de componentes OSS, como registros do YARN NodeManager.

O registro em registros é ativado por padrão nos clusters do Serviço Gerenciado para Apache Spark e nas cargas de trabalho em lote do Serviço Gerenciado para Apache Spark. Os registros são exportados periodicamente para o Logging, onde permanecem após a exclusão do cluster ou a conclusão da carga de trabalho.

Métricas do Serviço Gerenciado para Apache Spark

As métricas de cluster e job do Serviço Gerenciado para Apache Spark, com o prefixo dataproc.googleapis.com/, consistem em dados de série temporal que fornecem insights sobre a performance de um cluster, como utilização da CPU ou status do job. As métricas personalizadas do Serviço Gerenciado para Apache Spark, com prefixo custom.googleapis.com/, incluem métricas emitidas por sistemas de código aberto em execução no cluster, como a métrica running applications do YARN. Ter insights sobre as métricas do Serviço Gerenciado para Apache Spark pode ajudar você a configurar seus clusters de maneira eficiente. A configuração de alertas baseados em métricas ajuda a reconhecer e responder a problemas rapidamente.

As métricas de cluster e job do Serviço Gerenciado para Apache Spark são coletadas por padrão sem custo financeiro. A coleta de métricas personalizadas é cobrada dos clientes. É possível ativar a coleta de métricas personalizadas ao criar um cluster. A coleta de métricas do Spark do Serviço Gerenciado para Apache Spark é ativada por padrão em cargas de trabalho em lote do Spark.

Cloud Monitoring

O Monitoring usa metadados e métricas do cluster, incluindo métricas de HDFS, YARN, job e operação, para fornecer visibilidade sobre a integridade, o desempenho e a disponibilidade dos clusters e jobs do Serviço Gerenciado para Apache Spark. Use o Monitoring para analisar métricas, adicionar gráficos, criar painéis e alertas.

Metrics Explorer

Use o Metrics Explorer para conferir as métricas do Serviço Gerenciado para Apache Spark. As métricas de cluster, job e lote do Serviço Gerenciado para Apache Spark estão listadas nos recursos Cloud Managed Service for Apache Spark Cluster, Cloud Managed Service for Apache Spark Job e Cloud Managed Service for Apache Spark Batch. As métricas personalizadas do Serviço Gerenciado para Apache Spark estão listadas no recurso VM Instances, categoria Custom.

Gráficos

É possível usar o Metrics Explorer para criar gráficos que visualizam as métricas do Serviço Gerenciado para Apache Spark.

Exemplo: você cria um gráfico para ver o número de aplicativos Yarn ativos em execução nos clusters e adiciona um filtro para selecionar as métricas visualizadas por nome ou região do cluster.

Painéis

Você pode criar painéis para monitorar clusters e jobs do Serviço Gerenciado para Apache Spark usando métricas de vários projetos e diferentes produtos do Cloud de Confiance . É possível criar painéis no console Cloud de Confiance na página Visão geral dos painéis clicando, criando e salvando um gráfico da página Metrics Explorer.

Alertas

É possível criar alertas de métricas do Serviço Gerenciado para Apache Spark para receber avisos oportunos sobre problemas de cluster ou de job.

A seguir