Surveiller la distribution des instances dans les MIG

Ce document décrit les avantages, les cas d'utilisation et les procédures de surveillance de la distribution des instances de machine virtuelle (VM) dans les groupes d'instances gérés (MIG). Les procédures expliquent comment afficher, personnaliser et interroger le tableau de bord Surveillance de la distribution des instances de MIG GCE dans Cloud Monitoring.

Lorsque votre MIG utilise la flexibilité de l'emplacement pour distribuer les instances sur plusieurs zones, la flexibilité des instances pour spécifier plusieurs types de machines compatibles, ou les deux, le MIG sélectionne et provisionne dynamiquement les instances en fonction de la disponibilité des ressources en temps réel. Pour observer ce comportement dynamique au moment de l'exécution sur tous vos MIG, vous pouvez utiliser le tableau de bord Surveillance de la distribution des instances de MIG GCE. Ce tableau de bord préconfiguré offre une visibilité en temps réel sur la façon dont vos instances sont distribuées entre les zones et les types de machines au fil du temps. Le tableau de bord affiche également les instances en cours d'exécution (actives) et celles qui ne le sont pas (inactives), ainsi que le nombre total d'instances sur la période. Par exemple, vous pouvez interpréter les métriques du tableau de bord pour diagnostiquer l'allocation de capacité, l'équilibre zonal et le comportement de secours.

Avantages de la surveillance de la distribution des instances dans les MIG

Lorsque votre MIG déploie des instances sur plusieurs zones d'un groupe régional, ou lorsque vous spécifiez plusieurs types de machines et plusieurs niveaux dans une stratégie de flexibilité des instances, la distribution réelle des emplacements et des types de machines change dynamiquement en fonction de la disponibilité des ressources.

La surveillance de la distribution de vos instances au moment de l'exécution vous permet d'effectuer les opérations suivantes :

  • Améliorer l'obtention et atténuer les contraintes de capacité : vérifiez si votre MIG obtient correctement des ressources lors du scaling out. La création d'instances dans les niveaux de secours montre que votre stratégie de flexibilité des instances atténue efficacement les contraintes de capacité temporaires. Toutefois, si votre groupe a constamment du mal à atteindre sa taille cible malgré ces secours, envisagez d'étendre les types de machines autorisés ou d'ajouter des zones pour réduire la probabilité d'erreurs de disponibilité des ressources à l'avenir.

  • Vérifier la flexibilité de l'emplacement et l'équilibre zonal : vérifiez qu'un MIG régional équilibre la capacité entre les zones comme prévu (EVEN ou BALANCED), ou observez comment la capacité évolue dynamiquement entre les zones lorsque vous utilisez les formes de distribution cible ANY ou ANY_SINGLE_ZONE.

  • Équilibrer les coûts et les performances : en suivant les types de machines sélectionnés pour les MIG avec flexibilité des instances, vous pouvez mieux comprendre vos dépenses et vos performances, et rechercher des opportunités d'amélioration. Par exemple, si vos instances offrent systématiquement des performances supérieures à celles requises par votre charge de travail, vérifiez si votre charge de travail peut tolérer la priorisation des options à moindre coût. Si vous constatez des problèmes de performances, vous pouvez également envisager de privilégier les types de machines hautes performances plutôt que de répartir votre charge de travail sur plusieurs machines, en fonction de l'obtention.

Pour en savoir plus sur la façon dont le tableau de bord de surveillance vous aide à répondre aux questions d'observabilité, consultez la section Interpréter le tableau de bord de ce document.

Surveiller la distribution des instances de MIG

Vous pouvez surveiller la distribution des instances dans un MIG de l'une des manières suivantes :

  • Utilisez le tableau de bord Cloud Monitoring pour afficher une représentation visuelle de la distribution des instances. Pour en savoir plus, consultez la section À propos du tableau de bord de surveillance de ce document.

  • Interrogez les métriques sous-jacentes de manière programmatique à l'aide de PromQL comme alternative basée sur le code qui vous permet d'intégrer les données de distribution des instances dans vos tableaux de bord d'observabilité personnalisés ou vos outils de surveillance externes, tels que Grafana. Pour en savoir plus, consultez la section Interroger de manière programmatique à l'aide de PromQL de ce document.

À propos du tableau de bord de surveillance

Cloud Monitoring fournit des tableaux de bord préconfigurés dans la catégorie Services Google. Pour les MIG, le tableau de bord Surveillance de la distribution des instances de MIG GCE fournit les quatre graphiques spécialisés suivants :

  • Distribution des instances par zone : graphique affichant le nombre d'instances regroupées par zone, indiquant la flexibilité de l'emplacement et la distribution zonale dans vos régions.

  • Distribution des instances par type de machine : graphique affichant le nombre d'instances regroupées par type de machine, indiquant comment votre groupe alloue la capacité entre différents types et tailles de machines.

  • Instances actives par rapport aux instances inactives : graphique affichant le nombre d'instances regroupées selon qu'elles sont actives ou inactives. Une instance active est entièrement opérationnelle et en cours d'exécution (RUNNING). Une instance inactive est une instance qui n'est pas en cours d'exécution, mais qui n'a pas été supprimée. Cela inclut les instances en cours de création (PROVISIONING, STAGING), mises en pause (SUSPENDED) ou arrêtées (STOPPED, TERMINATED).

  • Nombre total d'instances : graphique affichant le nombre total d' instances dans le MIG sur la période.

Par défaut, le tableau de bord agrège les données de tous les MIG de votre projet. Pour afficher un seul MIG, vous pouvez filtrer par MIG (instance_group). Si votre projet contient des MIG portant le même nom dans plusieurs emplacements, appliquez un filtre de région (region) ou de zone (zone) pour cibler un MIG spécifique.

Les graphiques du tableau de bord Surveillance de la distribution des instances de MIG GCE s'appuient sur des métriques et des libellés de métadonnées système Compute Engine standards, tels que compute.googleapis.com/instance/cpu/utilization et metadata.system_labels.machine_type. Ces métriques système et ces libellés de métadonnées sont automatiquement collectés par Cloud Monitoring pour toutes les instances Compute Engine. Vous n'avez pas besoin d'installer l'agent Ops ni de configurer la télémétrie invité personnalisée dans vos instances pour afficher les graphiques de distribution des instances, de zone, de type de machine ou d'état dans ce tableau de bord.

Rôles requis

Afficher et personnaliser le tableau de bord

Vous pouvez afficher le tableau de bord Surveillance de la distribution des instances de MIG GCE depuis la Cloud de Confiance console, puis, si vous le souhaitez, le copier et le personnaliser pour surveiller des régions, des zones ou des MIG spécifiques.

  1. Pour afficher le tableau de bord préconfiguré Surveillance de la distribution des instances de MIG GCE, procédez comme suit :

    1. Dans la Cloud de Confiance console, accédez à la page Surveillance > Tableaux de bord.

      Accéder à la page Tableaux de bord

    2. Dans le filtre, recherchez le tableau de bord Surveillance de la distribution des instances de MIG GCE , puis sélectionnez-le. Vous pouvez également trouver ce tableau de bord dans le menu Type > catégorie Services Google.

    Vous pouvez utiliser le tableau de bord tel quel ou le copier pour le personnaliser davantage.

  2. Facultatif : Pour personnaliser le tableau de bord, vous devez d'abord le copier, puis le modifier comme suit :

    1. Pour copier, cliquez sur Copier le tableau de bord.

    2. Modifiez le tableau de bord copié et modifiez son nom, ses graphiques, appliquez des filtres et configurez des structures de mise en page personnalisées selon vos besoins.

    Vous pouvez afficher le tableau de bord copié ou personnalisé dans le menu Type > catégorie Personnalisé.

Pour en savoir plus sur la personnalisation du tableau de bord, consultez les pages suivantes de la documentation Cloud Monitoring :

Appliquer des filtres de tableau de bord

Le tableau de bord Surveillance de la distribution des instances de MIG GCE inclut des variables de filtre intégrées qui vous permettent d'explorer des sous-ensembles spécifiques de votre MIG :

  • Région (region) : filtrez les graphiques pour afficher les instances dans une ou plusieurs régions spécifiques Cloud de Confiance by S3NS .

  • Zone (zone) : filtrez les graphiques pour observer la distribution zonale et vérifier si les instances sont équilibrées ou si la capacité évolue entre des zones spécifiques.

  • Groupe d'instances (instance_group) : filtrez les graphiques pour isoler un seul MIG lorsque votre projet contient plusieurs MIG.

Pour appliquer un filtre dans la Cloud de Confiance console, cliquez sur le bouton Filtrer en haut de votre tableau de bord copié , sélectionnez la propriété de filtre (telle que region, zone ou instance_group), puis sélectionnez les valeurs de votre choix.

Pour en savoir plus sur l'utilisation des filtres, consultez Ajouter des filtres temporaires à un tableau de bord personnalisé dans la documentation Cloud Monitoring.

Configurer les annotations d'événements

Lorsque vous analysez les modifications de la distribution des instances entre les zones et les types de machines, la configuration des annotations pour les événements de cycle de vie ou les déploiements vous aide à corréler les changements de capacité avec des activités opérationnelles spécifiques. Par exemple, vous pouvez ajouter des annotations aux chronologies des graphiques pour mettre en évidence des événements tels que les suivants :

  • Mises à jour de la configuration du MIG, telles que la modification de la forme de distribution cible, de instanceSelections ou de l'ordre rank.

  • Mises à jour progressives ou réparations d'instances initiées dans le groupe.

  • Événements de panne zonale simulés ou réels.

  • Décisions d'autoscaling.

Pour en savoir plus sur les types d'événements disponibles et sur l'ajout d'annotations, consultez les pages suivantes de la documentation Cloud Monitoring :

Interpréter le tableau de bord

Lorsque vous affichez le tableau de bord de distribution des instances de votre MIG, suivez les conseils ci-dessous pour répondre aux questions courantes d'observabilité et interpréter le comportement dynamique de l'emplacement et du type de machine.

Pourquoi mes instances s'exécutent-elles dans des zones spécifiques ou évoluent-elles entre les zones ?

Si le graphique Distribution des instances par zone indique une distribution inégale entre les zones d'un MIG régional ou des changements soudains de capacité entre les emplacements, vérifiez les facteurs de flexibilité de l'emplacement suivants :

  • Forme de distribution cible : vérifiez la forme de distribution cible que vous avez configurée. Si votre MIG est configuré avec ANY ou ANY_SINGLE_ZONE, il donne la priorité aux zones où la capacité ou les réservations inutilisées sont les plus facilement disponibles plutôt que d'équilibrer les instances de manière uniforme. Si votre MIG utilise BALANCED, le groupe tente de maintenir un nombre d'instances équilibré entre les zones, mais peut placer temporairement des instances dans d'autres zones si une zone spécifique connaît une pénurie de capacité temporaire.

  • Redistribution de la capacité régionale : en cas de pénurie de capacité temporaire, en raison d'événements tels qu'une panne zonale localisée, un MIG régional configuré pour la haute disponibilité recherche et alloue automatiquement des instances de remplacement dans d'autres zones de la région. Le tableau de bord reflétera cette flexibilité de l'emplacement sous la forme d'une baisse du nombre d'instances pour la zone concernée et d'une augmentation correspondante dans les autres zones.

Pourquoi mon MIG s'exécute-t-il sur des types de machines de secours ?

Si votre MIG utilise la flexibilité des instances et que le graphique Distribution des instances par type de machine indique que votre groupe crée et exécute activement des instances sur des types de machines moins prioritaires (valeur de niveau plus élevée) au lieu de votre sélection principale, tenez compte des causes potentielles suivantes :

  • Contraintes de ressources temporaires : si les types de machines principaux connaissent une forte demande ou des contraintes de ressources temporaires, le MIG revient automatiquement aux sélections secondaires pour s'assurer que votre capacité cible est atteinte. Même lorsque les types de machines préférés sont à nouveau disponibles, le MIG continue d'utiliser les types de machines de secours et ne revient pas de manière proactive à ceux préférés.

  • Limites de quotas : vérifiez que votre Cloud de Confiance by S3NS projet dispose d'un quota de processeurs virtuels et de ressources suffisant pour votre série de machines préférée dans la région sélectionnée. Si le quota est épuisé pour le type de machine principal, le MIG provisionne à partir des sélections secondaires disponibles.

Pour en savoir plus, consultez Comment un MIG sélectionne les types de machines.

Interroger de manière programmatique à l'aide de PromQL

Pour surveiller la distribution des instances dans un MIG, vous pouvez également interroger les métriques sous-jacentes de manière programmatique à l'aide de PromQL pour Cloud Monitoring. L'interrogation programmatique vous permet d'intégrer les données de distribution des instances dans vos tableaux de bord d'observabilité personnalisés ou vos outils de surveillance externes, tels que Grafana. Vous pouvez utiliser PromQL pour interroger les instances par zone ou par type de machine.

Exécutez les requêtes PromQL dans l'éditeur de code comme décrit dans la section suivante.

Accéder à l'éditeur de code

Vous pouvez accéder à PromQL depuis les pages suivantes de la Cloud de Confiance console :

  • Explorateur de métriques
  • Ajouter un widget lors de la création de tableaux de bord

Pour ouvrir l'éditeur de code lorsque vous utilisez l'explorateur de métriques, procédez comme suit :

  1. Dans la Cloud de Confiance console, accédez à la  page Explorateur de métriques :

    Accéder à l'Explorateur de métriques

    Si vous utilisez la barre de recherche pour trouver cette page, sélectionnez le résultat dont le sous-titre est Monitoring.

  2. Dans la barre d'outils du volet de création de requêtes, sélectionnez le  PromQL bouton.

  3. Saisissez votre requête dans le champ de texte, puis cliquez sur Exécuter la requête. Les sections suivantes fournissent des exemples de requêtes.

Pour en savoir plus sur l'éditeur de code, consultez Utiliser l'éditeur de code pour PromQL dans la documentation Cloud Monitoring.

Interroger les instances actives par zone

Pour interroger les instances actives par zone, exécutez la requête suivante dans l' éditeur de code :

count by (zone) (compute_googleapis_com:instance_cpu_utilization{metadata_system_instance_group="YOUR_MIG_NAME"})

Remplacez YOUR_MIG_NAME par le nom de votre MIG.

Interroger les instances actives par type de machine

Pour interroger les instances actives par type de machine, exécutez la requête suivante dans l' éditeur de code :

count by (metadata_system_machine_type) (compute_googleapis_com:instance_cpu_utilization{metadata_system_instance_group="YOUR_MIG_NAME"})

Remplacez YOUR_MIG_NAME par le nom de votre MIG.

Étape suivante