מעקב אחרי התפלגות המופעים ב-MIG

במסמך הזה מתוארים היתרונות, תרחישי השימוש והנהלים למעקב אחרי חלוקת מופעי מכונות וירטואליות (VM) בקבוצות של מופעי מכונות מנוהלים (MIG). ההליכים כוללים הסברים על הצגה, התאמה אישית והרצת שאילתות בלוח הבקרה GCE MIG Instance Distribution Monitoring ב-Cloud Monitoring.

כשקבוצת ה-MIG משתמשת בגמישות במיקום כדי לפזר את המופעים על פני כמה אזורים, בגמישות במופעים כדי לציין כמה סוגי מכונות תואמים, או בשניהם, קבוצת ה-MIG בוחרת ומקצה מופעים באופן דינמי על סמך זמינות המשאבים בזמן אמת. כדי לראות את ההתנהגות הדינמית הזו בזמן הריצה בכל קבוצות ה-MIG, אפשר להשתמש במרכז הבקרה GCE MIG Instance Distribution Monitoring. לוח הבקרה הזה מוגדר מראש ומספק תצוגה בזמן אמת של אופן חלוקת המכונות הווירטואליות בין אזורים וסוגי מכונות לאורך זמן. במרכז הבקרה מוצגים גם מופעים פעילים ומופעים לא פעילים, וגם המספר הכולל של המופעים במהלך התקופה. לדוגמה, אפשר לפרש את המדדים בלוח הבקרה כדי לאבחן את הקצאת הקיבולת, האיזון האזורי והתנהגות הגיבוי.

היתרונות של מעקב אחרי התפלגות המופעים ב-MIG

כשקבוצת ה-MIG פורסת מופעים בכמה תחומים בקבוצה אזורית, או כשמציינים כמה סוגי מכונות ודירוגים במדיניות גמישות של מופעים, החלוקה בפועל של המיקומים וסוגי המכונות משתנה באופן דינמי בהתאם לזמינות המשאבים.

מעקב אחרי ההפצה של מופע זמן הריצה עוזר לכם:

  • שיפור הזמינות והפחתת מגבלות הקיבולת: בודקים אם ה-MIG מקבל משאבים בהצלחה כשמבצעים הגדלה אופקית. היצירה של מופעים בדרגות חזרה מצביעה על כך שמדיניות הגמישות של המופעים מצליחה לצמצם ביעילות את מגבלות הקיבולת הזמניות. אבל אם הקבוצה שלכם מתקשה באופן עקבי להגיע לגודל היעד למרות הגיבויים האלה, כדאי להרחיב את סוגי המכונות המותרים או להוסיף עוד אזורים כדי להקטין את הסיכוי לשגיאות זמינות משאבים בעתיד.

  • בדיקה של גמישות המיקום ואיזון בין אזורים: מוודאים ש-MIG אזורי מאזן את הקיבולת בין האזורים כמו שרציתם (EVEN או BALANCED), או בודקים איך הקיבולת משתנה באופן דינמי בין האזורים כשמשתמשים בצורות חלוקת היעד ANY או ANY_SINGLE_ZONE.

  • איזון בין עלות לביצועים: מעקב אחרי סוגי המכונות שנבחרו עבור קבוצות MIG עם גמישות בבחירת המופעים מאפשר לכם להבין טוב יותר את ההוצאות והביצועים, ולחפש הזדמנויות לשיפור. לדוגמה, אם המופעים שלכם מספקים באופן עקבי ביצועים טובים יותר ממה שנדרש לעומס העבודה, כדאי לבדוק אם עומס העבודה יכול להסתדר עם אפשרויות שעלותן נמוכה יותר. לחלופין, אם אתם מבחינים בבעיות בביצועים, כדאי לתת עדיפות לסוגי מכונות עם ביצועים גבוהים, במקום לפצל את עומס העבודה בין יותר מכונות.

בקטע הסבר על לוח הבקרה במאמר הזה מוסבר איך לוח הבקרה של Monitoring עוזר לענות על שאלות בנושא יכולת צפייה.

מעקב אחר התפלגות של מופעי MIG

אפשר לעקוב אחרי חלוקת המופעים בקבוצת MIG באחת מהדרכים הבאות:

  • משתמשים בלוח הבקרה של Cloud Monitoring כדי לראות ייצוג חזותי של פיזור המופעים. מידע נוסף מופיע במאמר מידע על לוח הבקרה של המעקב.

  • יצירת שאילתה למדדים הבסיסיים באופן פרוגרמטי באמצעות PromQL כחלופה מבוססת-קוד שמאפשרת לכם לשלב את נתוני הפצת המופעים בלוחות בקרה מותאמים אישית של יכולת צפייה או בכלי מעקב חיצוניים, כמו Grafana. מידע נוסף זמין במאמר שליחת שאילתות באופן פרוגרמטי באמצעות PromQL.

מידע על לוח הבקרה למעקב

שירות Cloud Monitoring מספק לוחות בקרה שהוגדרו מראש בקטגוריה Google Services. במקרה של קבוצות MIG, לוח הבקרה GCE MIG Instance Distribution Monitoring כולל את ארבעת התרשימים הייעודיים הבאים:

  • התפלגות המופעים לפי אזור: תרשים שמוצג בו מספר המופעים שמקובצים לפי אזור, כדי להראות את הגמישות במיקום ואת ההתפלגות האזורית באזורים שלכם.

  • Instance distribution by machine type: תרשים שמציג את מספר המופעים שמקובצים לפי סוג המכונה, ואיך הקבוצה מקצה קיבולת לסוגים ולגדלים שונים של מכונות.

  • מקרים פעילים לעומת מקרים לא פעילים: תרשים שבו מוצג מספר המקרים, מקובצים לפי פעילים או לא פעילים. מופע פעיל הוא מופע שפועל באופן מלא (RUNNING). מופע לא פעיל הוא מופע שלא פועל אבל לא נמחק. זה כולל מופעים שנמצאים בתהליך יצירה (PROVISIONING, STAGING), מושהים (SUSPENDED) או מושבתים (STOPPED, TERMINATED).

  • המספר הכולל של מופעים: תרשים שבו מוצג המספר הכולל של המופעים ב-MIG במהלך התקופה.

כברירת מחדל, מרכז הבקרה צובר נתונים מכל קבוצות ה-MIG בפרויקט. כדי לראות MIG יחיד, אפשר לסנן לפי MIG‏ (instance_group). אם הפרויקט מכיל MIG עם שם זהה בכמה מיקומים, אפשר להחיל מסנן של אזור (region) או אזור זמינות (zone) כדי להתמקד ב-MIG ספציפי.

התרשימים בלוח הבקרה GCE MIG Instance Distribution Monitoring מבוססים על תוויות ועל מדדים סטנדרטיים של מטא-נתונים של מערכת Compute Engine, כמו compute.googleapis.com/instance/cpu/utilization ו-metadata.system_labels.machine_type. מדדי המערכת ותוויות המטא-נתונים האלה נאספים באופן אוטומטי על ידי Cloud Monitoring עבור כל המופעים של Compute Engine. כדי לראות את התרשימים של חלוקת המכונות, האזור, סוג המכונה או המצב בלוח הבקרה הזה, לא צריך להתקין את סוכן תפעול או להגדיר טלמטריה מותאמת אישית של אורחים בתוך המכונות.

התפקידים הנדרשים

הצגה והתאמה אישית של לוח הבקרה

אפשר להציג את לוח הבקרה GCE MIG Instance Distribution Monitoring במסוףCloud de Confiance , ואז להעתיק אותו ולהתאים אותו אישית כדי לעקוב אחרי אזורים, אזורים או קבוצות MIG ספציפיים.

  1. כדי להציג את לוח הבקרה שהוגדר מראש GCE MIG Instance Distribution Monitoring:

    1. במסוף Cloud de Confiance , נכנסים לדף Monitoring > Dashboards.

      מעבר למרכזי השליטה

    2. במסנן, מחפשים את מרכז הבקרה GCE MIG Instance Distribution Monitoring ובוחרים אותו. אפשר גם למצוא את לוח הבקרה הזה בתפריט סוג > הקטגוריה שירותי Google.

    אפשר להשתמש במרכז הבקרה כמו שהוא או להעתיק אותו כדי להתאים אותו אישית.

  2. אופציונלי: כדי להתאים אישית את מרכז הבקרה, קודם צריך להעתיק אותו ואז לערוך אותו באופן הבא:

    1. כדי להעתיק, לוחצים על העתקת לוח הבקרה.

    2. עורכים את מרכז הבקרה שהועתק ומשנים את השם, התרשימים, המסננים ומבני הפריסה המותאמים אישית לפי הצורך.

    אפשר לראות את מרכז הבקרה שהועתק או הותאם אישית בתפריט סוג > הקטגוריה בהתאמה אישית.

מידע נוסף על התאמה אישית של לוח הבקרה זמין בדפים הבאים במאמרי העזרה של Cloud Monitoring:

החלת מסננים על מרכז הבקרה

לוח הבקרה GCE MIG Instance Distribution Monitoring כולל משתני סינון מובנים שמאפשרים לכם להתמקד בקבוצות משנה ספציפיות של ה-MIG:

  • אזור (region): סינון התרשימים כדי להציג מקרים באזור ספציפי אחד או יותרCloud de Confiance by S3NS .

  • אזור (zone): סינון תרשימים כדי לראות את ההתפלגות האזורית ולוודא שהאיזון בין המכונות תקין או שהקיבולת משתנה באזורים מסוימים.

  • קבוצת מופעים (instance_group): אפשר לסנן את התרשימים כדי לבודד קבוצת מופעים מנוהלים (MIG) אחת, אם הפרויקט מכיל כמה קבוצות כאלה.

כדי להחיל מסנן במסוף Cloud de Confiance , לוחצים על הלחצן Filter בחלק העליון של לוח הבקרה שהועתק, בוחרים את מאפיין המסנן (למשל region,‏ zone או instance_group) ואת הערכים הרצויים.

מידע נוסף על שימוש במסננים זמין במאמר הוספת מסננים זמניים ללוח בקרה בהתאמה אישית במאמרי העזרה של Cloud Monitoring.

הגדרת הערות לאירועים

כשמנתחים שינויים בחלוקת המופעים בין אזורים וסוגי מכונות, הגדרת הערות לאירועים או לפריסות במחזור החיים עוזרת לקשר בין שינויים בקיבולת לבין פעילויות תפעוליות ספציפיות. לדוגמה, אתם יכולים להוסיף הערות לציר הזמן של התרשים כדי להדגיש אירועים, כמו:

  • עדכונים בהגדרות של MIG, כמו שינוי הצורה של חלוקת היעד, instanceSelections או סדר rank.

  • הפעלת עדכונים מתגלגלים או תיקונים של מופעים בתוך הקבוצה.

  • אירועי הפסקת חשמל אזוריים אמיתיים או מדומה.

  • החלטות לגבי שינוי אוטומטי של קנה מידה.

מידע נוסף על סוגי האירועים הזמינים ועל הוספת הערות זמין בדפים הבאים במסמכי התיעוד של Cloud Monitoring:

הסבר על הנתונים שמוצגים בלוח הבקרה

כשצופים בלוח הבקרה של הפצת מופעי MIG, אפשר להיעזר בהנחיות הבאות כדי לענות על שאלות נפוצות לגבי יכולת הצפייה ולפרש את ההתנהגות של מיקום דינמי וסוג מכונה.

למה המופעים שלי פועלים באזורים ספציפיים או עוברים בין אזורים?

אם בתרשים Instance distribution by zone (התפלגות המופעים לפי אזור) מוצגת התפלגות לא אחידה בין אזורים ב-MIG אזורי או שינויים פתאומיים בקיבולת במיקומים שונים, כדאי לבדוק את הגורמים הבאים שמשפיעים על הגמישות במיקום:

  • צורה של התפלגות היעד: בודקים את הצורה של התפלגות היעד שהגדרתם. אם ה-MIG מוגדר עם ANY או ANY_SINGLE_ZONE, ה-MIG נותן עדיפות לאזורים שבהם הקיבולת או ההזמנות שלא נעשה בהן שימוש זמינות יותר, במקום לאזן את המכונות באופן שווה. אם ה-MIG משתמש ב-BALANCED, הקבוצה מנסה לשמור על איזון בין מספר המופעים באזורים שונים, אבל יכול להיות שהיא תציב באופן זמני מופעים באזורים חלופיים אם באזור מסוים יש מחסור זמני בקיבולת.

  • חלוקה מחדש של קיבולת אזורית: במהלך מחסור זמני בקיבולת, בגלל אירועים כמו הפסקת חשמל מקומית באזור מסוים, קבוצת MIG אזורית שהוגדרה לזמינות גבוהה מוצאת באופן אוטומטי מופעים חלופיים ומקצה אותם באזורים חלופיים באזור. הגמישות הזו במיקום תבוא לידי ביטוי בלוח הבקרה כירידה במספר המקרים באזור המושפע ועלייה מקבילה באזורים חלופיים.

למה ה-MIG שלי פועל על סוגי מכונות חלופיים?

אם קבוצת ה-MIG שלכם משתמשת בגמישות של מכונות, והתרשים חלוקת המכונות לפי סוג מראה שהקבוצה יוצרת ומריצה באופן פעיל מכונות מסוגים עם העדפה נמוכה יותר (ערך דירוג גבוה יותר) במקום הבחירה העיקרית שלכם, כדאי לשקול את הסיבות האפשריות הבאות:

  • מגבלות זמניות על משאבים: אם יש ביקוש גבוה לסוגי מכונות ראשיים או מגבלות זמניות על משאבים, ה-MIG עובר אוטומטית לבחירות משניות כדי להבטיח שהקיבולת הרצויה תושג. גם כשסוגי המכונות המועדפים זמינים שוב, קבוצת ה-MIG ממשיכה להשתמש בסוגי המכונות החלופיים ולא עוברת באופן יזום בחזרה לסוגי המכונות המועדפים.

  • מגבלות מכסה: מוודאים שלפרויקט Cloud de Confiance by S3NS יש מספיק מכסת משאבים ו-vCPU לסדרת המכונות המועדפת באזור שנבחר. אם המכסה של סוג המכונה הראשי מוצתה, ה-MIG יוקצה מתוך הבחירות המשניות הזמינות.

מידע נוסף זמין במאמר איך קבוצת MIG בוחרת סוגי מכונות.

שליחת שאילתות באופן פרוגרמטי באמצעות PromQL

כדי לעקוב אחרי חלוקת המופעים ב-MIG, אפשר גם לשלוח שאילתות על המדדים הבסיסיים באופן פרוגרמטי באמצעות PromQL ל-Cloud Monitoring. יצירת שאילתות באופן פרוגרמטי מאפשרת לכם לשלב את נתוני הפצת המופעים במרכזי בקרה מותאמים אישית של יכולת התבוננות או בכלי ניטור חיצוניים, כמו Grafana. אפשר להשתמש ב-PromQL כדי לשלוח שאילתות על מופעים לפי אזור או לפי סוג מכונה.

מריצים את שאילתות PromQL בעורך הקוד, כמו שמתואר בקטע הבא.

גישה לעורך הקוד

אפשר לגשת ל-PromQL מהדפים הבאים במסוף Cloud de Confiance :

  • Metrics Explorer
  • הוספת ווידג'ט כשיוצרים מרכזי שליטה

כדי לפתוח את עורך הקוד כשמשתמשים ב-Metrics Explorer:

  1. נכנסים לדף  Metrics explorer במסוף Cloud de Confiance :

    כניסה אל Metrics Explorer

    אם משתמשים בסרגל החיפוש כדי למצוא את הדף הזה, בוחרים בתוצאה שבה הכותרת המשנית היא Monitoring.

  2. בסרגל הכלים של חלונית Query builder, לוחצים על הלחצן  PromQL.

  3. מקלידים את השאילתה בשדה הטקסט ולוחצים על הפעלת שאילתה. בקטעים הבאים מופיעות דוגמאות לשאילתות.

מידע נוסף על עורך הקוד זמין במאמר שימוש בעורך הקוד עבור PromQL במסמכי התיעוד של Cloud Monitoring.

שאילתה לגבי מופעים פעילים לפי אזור

כדי להריץ שאילתה על מופעים פעילים לפי אזור, מריצים את השאילתה הבאה בעורך הקוד:

count by (zone) (compute_googleapis_com:instance_cpu_utilization{metadata_system_instance_group="YOUR_MIG_NAME"})

מחליפים את YOUR_MIG_NAME בשם של קבוצת ה-MIG.

שאילתות לגבי מופעים פעילים לפי סוג מכונה

כדי לשאול על מופעים פעילים לפי סוג המכונה, מריצים את השאילתה הבאה בעורך הקוד:

count by (metadata_system_machine_type) (compute_googleapis_com:instance_cpu_utilization{metadata_system_instance_group="YOUR_MIG_NAME"})

מחליפים את YOUR_MIG_NAME בשם של קבוצת ה-MIG.

המאמרים הבאים