En este documento, se analizan las herramientas y las técnicas que puedes usar para supervisar el estado y el rendimiento de los clústeres y trabajos de Managed Spark.
Interfaces web de código abierto
Muchos componentes de código abierto del clúster de Managed Service para Apache Spark, como Apache Hadoop y Apache Spark, proporcionan interfaces web. Estas interfaces se pueden usar para supervisar los recursos del clúster y el rendimiento del trabajo. Por ejemplo, puedes usar la IU del administrador de recursos de YARN para ver la asignación de recursos de la aplicación de YARN en un clúster de Managed Service para Apache Spark.
Servidor de historial persistente
Las interfaces web de código abierto que se ejecutan en un clúster están disponibles cuando el clúster se está ejecutando, pero se cierran cuando borras el clúster. Para ver los datos del clúster y del trabajo después de que se borra un clúster, puedes crear un servidor de historial persistente (PHS).
Ejemplo: Te encuentras con un error o una ralentización del trabajo que deseas analizar. Detén o borra el clúster de trabajo y, luego, consulta y analiza los datos del historial de trabajos con tu PHS.
Después de crear un PHS, lo habilitas en un clúster de Managed Service para Apache Spark o en una carga de trabajo por lotes de Managed Service para Apache Spark cuando creas el clúster o envías la carga de trabajo por lotes. Un PHS puede acceder a los datos del historial de los trabajos ejecutados en varios clústeres, lo que te permite supervisar los trabajos en un proyecto en lugar de supervisar IU separadas que se ejecutan en diferentes clústeres.
Registros de Managed Service para Apache Spark
Managed Service para Apache Spark recopila los registros generados por Apache Hadoop, Spark, Hive, ZooKeeper y otros sistemas de código abierto que se ejecutan en tus clústeres, y los envía a Logging. Estos registros se agrupan según la fuente de los registros, lo que te permite seleccionar y ver los registros que te interesan: por ejemplo, los registros de YARN NodeManager y Spark Executor generados en un clúster se etiquetan por separado. Consulta los registros de Managed Service para Apache Spark para obtener más información sobre el contenido y las opciones de los registros de Managed Service para Apache Spark.
Cloud Logging
Logging es un sistema de administración de registros en tiempo real completamente administrado. Proporciona almacenamiento para los registros transferidos desde los servicios de Cloud de Confiance y herramientas para buscar, filtrar y analizar registros a gran escala. Los clústeres de Managed Service para Apache Spark generan varios registros, incluidos los registros del agente de servicio de Managed Service para Apache Spark, los registros de inicio del clúster y los registros de componentes de OSS, como los registros de YARN NodeManager.
El registro está habilitado de forma predeterminada en los clústeres de Managed Service para Apache Spark y las cargas de trabajo por lotes de Managed Service para Apache Spark. Los registros se exportan periódicamente a Logging, donde persisten después de que se borra el clúster o se completa la carga de trabajo.
Métricas de Managed Service para Apache Spark
Las métricas de clúster y de trabajo de Managed Service para Apache Spark, que tienen el prefijo dataproc.googleapis.com/, constan de datos de series temporales que proporcionan estadísticas sobre el rendimiento de un clúster, como la utilización de la CPU o el estado del trabajo. Las métricas personalizadas de Managed Service para Apache Spark, con el prefijo custom.googleapis.com/, incluyen métricas emitidas por sistemas de código abierto que se ejecutan en el clúster, como la métrica running applications de YARN. Obtener estadísticas sobre las métricas de Managed Service para Apache Spark puede ayudarte a configurar tus clústeres de manera eficiente. Configurar alertas basadas en métricas puede ayudarte a reconocer los problemas y responder a ellos rápidamente.
Las métricas de los trabajos y clústeres de Managed Service para Apache Spark se recopilan de forma predeterminada y sin cargo. La recopilación de métricas personalizadas se cobra a los clientes. Puedes habilitar la recopilación de métricas personalizadas cuando creas un clúster. La recopilación de métricas de Spark de Managed Service para Apache Spark está habilitada de forma predeterminada en las cargas de trabajo por lotes de Spark.
Cloud Monitoring
Monitoring usa metadatos y métricas del clúster, incluidas las métricas de HDFS, YARN, trabajo y operación, para proporcionar visibilidad del estado, el rendimiento y la disponibilidad de los clústeres y trabajos de Managed Service para Apache Spark. Puedes usar Monitoring para explorar métricas, agregar gráficos, crear paneles y generar alertas.
Explorador de métricas
Puedes usar el Explorador de métricas para ver las métricas de Managed Service para Apache Spark. Las métricas de clústeres, trabajos y lotes de Managed Service para Apache Spark se enumeran en los recursos Cloud Managed Service for Apache Spark Cluster, Cloud
Managed Service for Apache Spark Job y Cloud Managed Service for Apache Spark
Batch. Las métricas personalizadas de Managed Service para Apache Spark se enumeran en el recurso VM Instances, categoría Custom.
Gráficos
Puedes usar el Explorador de métricas para crear gráficos que visualicen las métricas de Managed Service para Apache Spark.
Ejemplo: Creas un gráfico para ver la cantidad de aplicaciones de Yarn activas que se ejecutan en tus clústeres y, luego, agregas un filtro para seleccionar las métricas visualizadas por nombre del clúster o región.
Paneles
Puedes crear paneles para supervisar los clústeres y los trabajos de Managed Service para Apache Spark con métricas de varios proyectos y diferentes productos de Cloud de Confiance . Puedes crear paneles en la consola de Cloud de Confiance desde la página Descripción general de los paneles. Para ello, haz clic en un gráfico de la página Explorador de métricas, créalo y, luego, guárdalo.
Alertas
Puedes crear alertas de métricas de Managed Service para Apache Spark para recibir avisos oportunos sobre problemas del clúster o del trabajo.
¿Qué sigue?
- Obtén más información sobre las investigaciones potenciadas por IA con Gemini Cloud Assist.
- Soluciona problemas de creación de clústeres.
- Consulta los datos de diagnóstico del clúster.