Surveiller les clusters et les jobs Managed Service pour Apache Spark

Ce document présente les outils et techniques que vous pouvez utiliser pour surveiller l'état et les performances des clusters et des jobs Managed Spark.

Interfaces Web Open Source

De nombreux composants Open Source des clusters Managed Service pour Apache Spark, tels qu'Apache Hadoop et Apache Spark, fournissent des interfaces Web. Ces interfaces peuvent être utilisées pour surveiller les ressources du cluster et les performances des jobs. Par exemple, vous pouvez utiliser l'UI du gestionnaire de ressources YARN pour afficher l'allocation des ressources d'application YARN sur un cluster Managed Service pour Apache Spark.

Serveur d'historique persistant

Les interfaces Web Open Source exécutées sur un cluster sont disponibles lorsque le cluster est en cours d'exécution, mais elles s'arrêtent lorsque vous supprimez le cluster. Pour afficher les données de cluster et de job après la suppression d'un cluster, vous pouvez créer un serveur d'historique persistant (PHS, Persistent History Server).

Exemple : Vous rencontrez une erreur ou un ralentissement de job que vous souhaitez analyser. Vous arrêtez ou supprimez le cluster de jobs, puis vous affichez et analysez les données de l'historique des jobs à l'aide de votre PHS.

Après avoir créé un PHS, vous l'activez sur un cluster Managed Service pour Apache Spark ou une charge de travail par lot Managed Service pour Apache Spark lorsque vous créez le cluster ou envoyez la charge de travail par lot. Un serveur d'historique persistant peut accéder aux données d'historique des tâches exécutées sur plusieurs clusters, ce qui vous permet de surveiller les tâches d'un projet au lieu de surveiller des interfaces utilisateur distinctes exécutées sur différents clusters.

Journaux Managed Service pour Apache Spark

Managed Service pour Apache Spark collecte les journaux générés par Apache Hadoop, Spark, Hive, ZooKeeper et d'autres systèmes Open Source exécutés sur vos clusters, et les envoie à Logging. Ces journaux sont regroupés en fonction de leur source, ce qui vous permet de sélectionner et d'afficher ceux qui vous intéressent. Par exemple, les journaux YARN NodeManager et Spark Executor générés sur un cluster sont étiquetés séparément. Pour en savoir plus sur le contenu et les options des journaux Managed Service pour Apache Spark, consultez Journaux Managed Service pour Apache Spark.

Cloud Logging

Logging est un système de gestion des journaux en temps réel entièrement géré. Il fournit un espace de stockage pour les journaux ingérés à partir des services Cloud de Confiance et des outils permettant de rechercher, de filtrer et d'analyser les journaux à grande échelle. Les clusters Managed Service pour Apache Spark génèrent plusieurs journaux, y compris les journaux de l'agent de service Managed Service pour Apache Spark, les journaux de démarrage du cluster et les journaux des composants OSS, tels que les journaux YARN NodeManager.

La journalisation est activée par défaut sur les clusters Managed Service pour Apache Spark et les charges de travail par lot Managed Service pour Apache Spark. Les journaux sont exportés régulièrement vers Logging, où ils sont conservés après la suppression du cluster ou la fin de la charge de travail.

Métriques Managed Service pour Apache Spark

Les métriques de cluster et de job Managed Service pour Apache Spark, préfixées par dataproc.googleapis.com/, se composent de données de séries temporelles qui fournissent des informations sur les performances d'un cluster, telles que l'utilisation du processeur ou l'état du job. Les métriques personnalisées Managed Service pour Apache Spark, préfixées par custom.googleapis.com/, incluent les métriques émises par les systèmes Open Source exécutés sur le cluster, comme la métrique running applications de YARN. Obtenir des insights sur les métriques Managed Service pour Apache Spark peut vous aider à configurer efficacement vos clusters. La configuration d'alertes basées sur des métriques peut vous aider à identifier et à résoudre rapidement les problèmes.

Les métriques des clusters et des jobs Managed Service pour Apache Spark sont collectées par défaut et sans frais. La collecte de métriques personnalisées est facturée aux clients. Vous pouvez activer la collecte de métriques personnalisées lorsque vous créez un cluster. La collecte des métriques Spark Managed Service pour Apache Spark est activée par défaut sur les charges de travail par lot Spark.

Cloud Monitoring

La surveillance utilise les métadonnées et les métriques des clusters, y compris les métriques HDFS, YARN, de job et d'opération, pour fournir une visibilité sur l'état, les performances et la disponibilité des clusters et des jobs Managed Service pour Apache Spark. Vous pouvez utiliser Monitoring pour explorer les métriques, ajouter des graphiques, créer des tableaux de bord et configurer des alertes.

Explorateur de métriques

Vous pouvez utiliser l'explorateur de métriques pour afficher les métriques Managed Service pour Apache Spark. Les métriques de cluster, de job et de lot Managed Service pour Apache Spark sont listées sous les ressources Cloud Managed Service for Apache Spark Cluster, Cloud Managed Service for Apache Spark Job et Cloud Managed Service for Apache Spark Batch. Les métriques personnalisées Managed Service pour Apache Spark sont listées sous la ressource VM Instances, catégorie Custom.

Graphiques

Vous pouvez utiliser l'explorateur de métriques pour créer des graphiques qui visualisent les métriques Managed Service pour Apache Spark.

Exemple : Vous créez un graphique pour afficher le nombre d'applications Yarn actives exécutées sur vos clusters, puis vous ajoutez un filtre pour sélectionner les métriques visualisées par nom de cluster ou par région.

Tableaux de bord

Vous pouvez créer des tableaux de bord pour surveiller les clusters et les jobs Managed Service pour Apache Spark à l'aide de métriques provenant de plusieurs projets et de différents produits Cloud de Confiance . Vous pouvez créer des tableaux de bord dans la console Cloud de Confiance à partir de la page Aperçu des tableaux de bord en cliquant sur un graphique de la page Explorateur de métriques, puis en le créant et en l'enregistrant.

Alertes

Vous pouvez créer des alertes sur les métriques Managed Service pour Apache Spark afin d'être averti rapidement des problèmes liés aux clusters ou aux jobs.

Étapes suivantes