מעקב אחרי מכונות וירטואליות

במאמר הזה נסביר איך לגשת למדדים של מכונות וירטואליות (VM) ולצפות בהם. במאמר מוסבר גם איך לבדוק את מדדי המכונות הווירטואליות כדי לקבל מידע נוסף על המכונות הווירטואליות או לפתור בעיות ספציפיות במכונה וירטואלית.

מעקב אחרי מכונות וירטואליות (VM) הוא חיוני לתחזוקת משאבי ה-VM. בכרטיסייה Observability במסוף Cloud de Confiance Compute Engine מוצגת סקירה כללית של מדדי מכונות וירטואליות. בכרטיסייה הזו מוצגת מרכז בקרה מוגדר מראש שמבוסס על נתוני טלמטריה, כדי שתוכלו לעקוב אחרי המכונות הווירטואליות ולקבל החלטות מושכלות לגבי המשאבים של Compute Engine. אפשר גם להתאים אישית את לוח הבקרה המוגדר מראש כדי להציג רק את המדדים הספציפיים שרוצים.

כל המכונות הווירטואליות כוללות נתונים בסיסיים על ניצול התהליכים כשהן נוצרות. עם זאת, התקנה של סוכן תפעול מספקת תובנות מעמיקות יותר לגבי התנהגות המכונה הווירטואלית.

מידע נוסף על יצירת מדיניות התראות של Monitoring, על שימוש ב-Metrics Explorer ועל אופן הפעולה של Monitoring ומדדים ב- Cloud de Confiance by S3NSזמין במאמרים בנושא Cloud Monitoring.

לפני שמתחילים

אופציונלי: מתקינים את Ops Agent כדי לאסוף נתונים מפורטים יותר מהמכונות של Compute Engine.

כדי לבדוק באילו מכונות וירטואליות מותקן סוכן תפעול:

  1. במסוף Cloud de Confiance , עוברים אל לוחות בקרה של Monitoring.

    מעבר ללוחות הבקרה של Monitoring

  2. בוחרים באפשרות VM instances (מכונות וירטואליות) מרשימת לוחות הבקרה.

  3. לוחצים על רשימה כדי לראות את המכונות הווירטואליות כרשימה.

    כל המכונות הווירטואליות בפרויקט מוצגות. בעמודה סוכן מוצג הסטטוס של התקנת סוכן התפעול. בדף הזה אפשר להתקין או לעדכן את הסוכן.

  4. אופציונלי: כדי לעדכן את לוח הבקרה מוגדר מראש כך שיוצגו בו אירועים, כמו אירועים שמציינים עדכון של קבוצת מופעי מכונה מנוהלים, לוחצים על ואז על בחירת אירועים וממלאים את תיבת הדו-שיח.

    מידע נוסף על אירועים זמין במאמר בנושא סוגי אירועים.

גישה למדדי יכולת הצפייה במכונה וירטואלית

אפשר לגשת למידע על מכונה וירטואלית אחת או יותר באמצעות הכרטיסייה Observability במסוף Cloud de Confiance . כברירת מחדל, במרכז בקרה מוגדר מראש מוצגים מדדי המכונה הווירטואלית. אם רוצים לראות רק את המדדים הספציפיים שמעניינים אתכם, אפשר ליצור מרכז בקרה בהתאמה אישית.

הצגת מדדי יכולת הצפייה של מכונה וירטואלית אחת

מדדים בסיסיים של מכונות וירטואליות, כמו ניצול המעבד (CPU) ותנועה ברשת, זמינים לכם כשאתם יוצרים את המכונה הווירטואלית. מדדים לניצול הזיכרון והתהליכים זמינים רק אם מותקן סוכן התפעול, שהוא הסוכן העיקרי לאיסוף טלמטריה מהמכונות של Compute Engine.

כדי לראות את המדדים של מכונה וירטואלית אחת:

  1. נכנסים לדף VM instances במסוף Cloud de Confiance .

    כניסה לדף VM instances

  2. בוחרים מכונה וירטואלית כדי לפתוח את הדף פרטים.

  3. לוחצים על הכרטיסייה Observability כדי להציג מידע על המכונה הווירטואלית.

  4. אופציונלי: אפשר לאפס את מסגרת הזמן של שעה אחת שמוגדרת כברירת מחדל ולשנות אותה למסגרת הזמן שרוצים לעקוב אחריה.

  5. אופציונלי: כדי לעדכן את לוח הבקרה מוגדר מראש כך שיוצגו בו אירועים, כמו אירועים שמציינים עדכון של קבוצת מופעי מכונה מנוהלים, לוחצים על ואז על בחירת אירועים וממלאים את תיבת הדו-שיח.

    מידע נוסף על אירועים זמין במאמר בנושא סוגי אירועים.

המידע באיור 1 מציג פרטים של מכונה וירטואלית ללא סוכן תפעול שהותקן במכונה הווירטואלית. שימו לב שבגרפים Memory (זיכרון) ו-Disk Space Utilization (ניצול שטח הדיסק) לא מוצגים נתונים.

הכרטיסייה Observability (יכולת צפייה) למכונה וירטואלית אחת ללא התקנה של סוכן תפעול.
איור 1: הכרטיסייה Observability של מכונה וירטואלית אחת בלי סוכן תפעול מותקן.

הצגת מדדי יכולת התצפית של כמה מכונות וירטואליות

ניראות ברמת ה-Fleet מציגה את המדדים של חמשת המכונות הווירטואליות המובילות עם ניצול התהליכים הגבוה ביותר. חמשת המכונות הווירטואליות המובילות שמוצגות משתנות בהתאם למדד. יכול להיות שלא תראו את אותם חמישה מכונות וירטואליות לכל תהליך. למרות שיש יותר נתונים ברמת הצי לעומת כמות הנתונים שזמינה למכונה וירטואלית אחת, בלי להתקין את Ops Agent, התקנת הסוכן מספקת יותר נתונים למטרות פתרון בעיות בעתיד.

כדי לראות את המדדים של כמה מכונות וירטואליות:

  1. נכנסים לדף VM instances במסוף Cloud de Confiance .

    כניסה לדף VM instances

  2. לוחצים על הכרטיסייה Observability (יכולת תצפית).

  3. אופציונלי: מאפסים את מסגרת הזמן של שעה אחת שמוגדרת כברירת מחדל למסגרת הזמן שרוצים לעקוב אחריה.

  4. מסננים את התוצאות לפי אחת או יותר מהאפשרויות הבאות:

    • מזהה
    • שם
    • סוג המכונה
    • תחום (zone)
    • אזור
    • קבוצת מופעים
    • תוויות
    • מדינה

המידע באיור 2 מציג דוגמה לכרטיסייה Observability (ניראות) כש-Ops Agent (סוכן תפעול) מותקן בכמה מכונות וירטואליות בפרויקט. שימו לב שיש מדדים נוספים שזמינים לגבי מכונות ה-VM האלה.

כמה מכונות וירטואליות עם סוכן התפעול מותקן.
איור 2: כמה מכונות וירטואליות עם סוכן התפעול המותקן.

הצגת מדדים מפורטים של מכונה וירטואלית

כל מדד של תהליך במכונה וירטואלית מיוצג על ידי קו בתרשים. בדוגמה הבאה, סוכן התפעול מותקן במכונת ה-VM‏ uptime-demo. נתוני השימוש בזיכרון זמינים לצורך פתרון בעיות. אם מכונה וירטואלית לא מופיעה בכרטיס, אפשר לסנן לפי שם המכונה הווירטואלית כדי למצוא מכונה וירטואלית ספציפית.

כדי לאחזר את המידע על המכונה הווירטואלית הזו או על מכונה וירטואלית אחרת מתוך חמש המכונות הווירטואליות המובילות, מבצעים את הפעולות הבאות בכרטיסייה Observability (יכולת תצפית):

  1. מציבים את הסמן מעל קו התרשים של מכונה וירטואלית כלשהי. מופיע כרטיס עם רשימה של חמשת המכונות הווירטואליות המובילות שמשתמשות בתהליך, וכל אחת מהן מציגה מדד.
  2. כדי לקבל מידע נוסף על ההתנהגות של המכונה הווירטואלית, לוחצים על קו הגרף של המכונה הווירטואלית או על שם ספציפי של מכונה וירטואלית ברשימה.

המכונה הווירטואלית uptime-demo שמוצגת בכרטיס באיור 3 חושפת כמה מדדים שאולי דורשים בדיקה.

קו התרשים מייצג מכונה וירטואלית. כדי לקבל מידע נוסף על מכונה וירטואלית ספציפית, לוחצים עליה.
איור 3: קו הגרף מייצג מכונה וירטואלית. אפשר ללחוץ עליו כדי לקבל מידע נוסף על מכונה וירטואלית ספציפית.

לוחצים על מכונת ה-VM‏ uptime-demo כדי לפתוח את הדף VM Details שמוצג באיור 4, שבו מופיע המידע הבא:

  • סטטוס סוכן התפעול.
  • האפשרויות שמופיעות בהקשר של יצירת התראות, בדיקת אירועים או יצירת בדיקות זמינות.
  • אפשרות להצגת הפרטים של ההגדרות, המדדים והיומנים של מכונת ה-VM.
בדף הפרטים של מכונה וירטואלית מופיע מידע על מכונה וירטואלית ספציפית.
איור 4: בדף 'פרטי מכונה וירטואלית' מופיע מידע על מכונה וירטואלית ספציפית.

יצירת לוח בקרה בהתאמה אישית כדי לראות מדדים ספציפיים

כברירת מחדל, בכרטיסייה Observability (יכולת תצפית) ב-Compute Engine מוצגת לוח בקרה מוגדר מראש עם מדדים בסיסיים של מכונות וירטואליות. כדי לראות רק את המדדים הספציפיים שמעניינים אתכם, אתם יכולים לשנות את מרכז הבקרה המוגדר מראש ולשמור אותו כמרכז בקרה בהתאמה אישית. אפשר להתאים אישית את לוח הבקרה לפי הצורך.

כדי ליצור מרכז בקרה בהתאמה אישית:

  1. נכנסים לדף VM instances במסוף Cloud de Confiance .

    כניסה לדף VM instances

  2. עוברים לכרטיסייה יכולת צפייה באופן הבא:

    • למכונה וירטואלית אחת: בדף VM instances, לוחצים על שם המכונה הווירטואלית כדי לפתוח את הדף Details שלה, ואז לוחצים על הכרטיסייה Observability של אותה מכונה וירטואלית.
    • לכמה מכונות וירטואליות: בדף VM instances, לוחצים על הכרטיסייה Observability.
  3. אם התפריט הנפתח מרכז בקרה מופעל, מרכזי בקרה בהתאמה אישית זמינים. כדי לשנות תצוגה בהתאמה אישית, בוחרים תצוגה בהתאמה אישית מהתפריט הנפתח, ואז בסרגל הכלים של מרכז הבקרה לוחצים על .

  4. אחרת, כדי להתאים אישית את מרכז הבקרה המוגדר מראש, לוחצים על בסרגל הכלים של לוח הבקרה.

    ‫Compute Engine יוצר עותק של מרכז הבקרה המוגדר מראש, ואז פותח את העותק במצב עריכה.

  5. בכלי העריכה, אפשר להוסיף את הוויזואליזציות ללוח הבקרה, לשנות אותן, למחוק אותן, לשנות את המיקום שלהן או לשנות את הגודל שלהן. ההמחשות האלה נקראות ביחד ווידג'טים. מידע נוסף על סוגי הווידג'טים השונים זמין במאמר סקירה כללית על לוחות בקרה.

    • כדי להוסיף ווידג'ט, לוחצים על הוספת ווידג'ט בסרגל הכלים של מרכז הבקרה ומבצעים את ההגדרה.

      לדוגמה, כדי להציג את היומנים עם נתוני המדדים, לוחצים על הוספת ווידג'ט, בוחרים באפשרות יומנים ואז לוחצים על החלה.

    • כדי לשנות ווידג'ט, מציבים את מצביע העכבר על הווידג'ט כדי להפעיל את סרגל הכלים, לוחצים על עריכת הווידג'ט ואז משתמשים בתיבת הדו-שיח הגדרת הווידג'ט. כדי להחיל את השינויים על לוח הבקרה, לוחצים על החלה בסרגל הכלים. כדי לבטל את השינויים, לוחצים על ביטול.

    • כדי למחוק ווידג'ט, מציבים את מצביע העכבר על הווידג'ט כדי להפעיל את סרגל הכלים, לוחצים על אפשרויות נוספות של התרשים ואז בוחרים באפשרות מחיקה.

    • כדי לשנות את המיקום של הווידג'ט, משתמשים במצביע כדי לגרור את הווידג'ט באמצעות הכותרת שלו למיקום חדש.

    • כדי לשנות את הגודל של הווידג'ט, משתמשים במצביע כדי לשנות את המיקום של הפינה השמאלית של הווידג'ט.

  6. אחרי שמסיימים לשנות את לוח הבקרה, לוחצים על שמירה.

  7. בתיבת הדו-שיח לאישור השינויים, לוחצים על הצגת לוח הבקרה המותאם אישית כדי לעבור לתצוגה המותאמת אישית.

    כדי לחזור לתצוגה המוגדרת מראש, בוחרים באפשרות מוגדר מראש מתוך התפריט הנפתח מרכז הבקרה.

בדיקת מדדי משאבים

כדי לקבל מידע נוסף על כל מדד של משאב, לוחצים על כל תהליך בתפריט של הכרטיסייה Observability:

  • אפשר לבדוק את השימוש במעבד (CPU), בתהליכים, בזיכרון, במאיצים, בתנועה ברשת ובדיסק.

  • כדי לזהות אירועים במערכת ולהציג אותם, מחפשים ביומנים את נתוני היומן.

  • מוסיפים שילובים של צד שלישי ובודקים אם יש שילובים קיימים שהוגדרו.

בהמשך הקטע הזה מפורטות דוגמאות לאופן שבו תהליכים מסוימים עשויים להשפיע על עומסי העבודה. המידע הזה מניח ש-סוכן תפעול מותקן במכונות הווירטואליות.

ניצול יחידת העיבוד המרכזית (CPU)

דוגמה לשימוש קיצוני במעבד יכולה להיות כששרת נמצא בעומס כבד באופן לא צפוי, למשל כשאתר חווה עלייה פתאומית בתנועה או כשמתבצע עיבוד נתונים בקנה מידה גדול. במצבים כאלה, יכול להיות שהמעבד יפעל בקיבולת של 100% במשך תקופה ממושכת, מה שיכול לגרום להאטה בשרת או לחוסר תגובה.

בדוגמה הזו, הבעיה היא רוויה. אם ניצול המעבד שלכם הוא 100%, יכול להיות שזה בסדר לעומסי העבודה שלכם, אבל כדאי לבדוק מדדים אחרים כדי להבין אם נדרשת התערבות. במקרה כזה, כדאי ליצור מדיניות התראות כדי לקבל התראה כשיש עלייה חדה בניצול המעבד של מכונה וירטואלית.

אם יש לכם את ההרשאות המתאימות, אתם יכולים להתחבר למכונות הווירטואליות באמצעות SSH כדי לבדוק את הבעיה. עם זאת, אם סוכן Ops מותקן, תוכלו לראות נתונים היסטוריים נוספים שיעזרו לכם לפתור בעיות.

ניצול תהליכים

דוגמה להתנהגות קיצונית של תהליך היא מצב שבו תהליך צורך כמות מוגזמת של משאבים כמו מעבד, זיכרון או קלט/פלט של דיסק, עד כדי כך שהוא גורם לירידה בביצועים או אפילו לקריסה של המכונה הווירטואלית.

לדוגמה, אם תהליך שפועל במכונה וירטואלית חווה דליפת זיכרון, הוא עלול להתחיל לצרוך כמויות גדולות יותר ויותר של זיכרון לאורך זמן, ובסופו של דבר לגרום למכונה הווירטואלית להיגמר הזיכרון ולקרוס. באופן דומה, אם תהליך מסוים משתמש בדיסק באופן אינטנסיבי, הוא עלול לגרום לרוויה של קלט/פלט בדיסק של המכונה הווירטואלית, וכך להאט את זמני התגובה של תהליכים אחרים.

שימוש בזיכרון

מסדי נתונים צריכים כמות גדולה של זיכרון כדי לבצע פעולות כמו יצירת אינדקסים, מיון וצירוף טבלאות.

דוגמה לשימוש גבוה בזיכרון במכונה וירטואלית היא כשמריצים שרת מסד נתונים, כמו Cloud SQL ל-MySQL או Cloud SQL ל-PostgreSQL, עם מערך נתונים גדול. אם הזיכרון הזמין של המכונה הווירטואלית קטן מדי, טעינה מחדש של מערך נתונים לזיכרון עלולה לגרום להאטה בפעילות של מסד הנתונים או לקריסה שלו.

מאיצים

אם למכונה הווירטואלית מצורף מאיץ (GPU או TPU), בכרטיסייה יכולת צפייה יש קטע מאיצים שבו מוצגים מדדים שרלוונטיים לסוג המאיץ. בלוח הבקרה של המאיצים אפשר לראות פרטים כמו ביצועים, ניצול ומעקב אחרי הזיכרון.

מידע על מדדי GPU זמין במאמרים הבאים:

מידע על מדדי TPU זמין במאמר מעקב אחרי יחידות TPU במאמרי העזרה של Cloud TPU.

ביצועי הרשת

בעיות בביצועי הרשת נובעות מגורמים שונים: עומס, מגבלות רוחב פס, בעיות בחומרה או בתוכנה וזמן אחזור. כדי לאבחן את הבעיה, צריך לעקוב אחרי מדדי הביצועים של הרשת, לפתור בעיות בחומרה ובתוכנה ולנתח את דפוסי התעבורה ברשת כדי לזהות את שורש הבעיה ולפתור אותה.

ניצול הדיסק

ניצול גבוה של הדיסק במכונה וירטואלית (VM) מתרחש כשכמות גדולה של נתונים נקראת מהדיסק הווירטואלי או נכתבת אליו, וכתוצאה מכך יש עיכוב בגישה לדיסק והשפעה אפשרית על הביצועים של המכונה הווירטואלית.

מעקב אחרי מדדי ניצול הדיסק, כמו פעולות קלט/פלט (I/O) בדיסק לשנייה (IOPS), אורך תור הדיסק וזמן התגובה הממוצע של הדיסק, יכול לעזור לזהות ולנתח בעיות של ניצול גבוה של הדיסק במכונה וירטואלית.

בדיקת יומנים ואירועים במערכת

בדף All Logs (כל היומנים) מופיעים נתוני יומן לגבי המשאבים שלכם. ממיינים לפי חומרה כדי לזהות בעיות ולבדוק את המטען הייעודי (payload).

ביומני ביקורת מתועדים אירועים אדמיניסטרטיביים שמתרחשים במשאבים שלכם. היומנים יכולים להראות לכם מה קרה והפעיל את האירוע. כמה יומנים נרשמים ונשמרים באותה שורה. לדוגמה, אם יש 20 יומנים זהים, המידע מאוחסן בשורה אחת ולא ב-20 שורות נפרדות.

אפשר לחשוב על System Events כעל מונח כללי לאירועים שמתרחשים ברמה גבוהה יותר, אבל עשויים להשפיע על משאבי Compute Engine. אירוע מערכת מתרחש כשמופעלת שגיאה שלא קשורה לאירוע מתוכנן. אירועי המערכת מתועדים ביומן ברמת הצי.

שימוש בשילובים עם צד שלישי

‫Monitoring מספק שילובים עם אפליקציות של צד שלישי. השילובים האלה מאפשרים לכם לאסוף נתוני טלמטריה מאפליקציות כמו Apache Web Server, ‏ Cloud SQL ל-MySQL, ‏ Memorystore ל-Redis ואחרות, עבור פריסות שפועלות ב-Compute Engine וב-GKE. כשמשתמשים ב-Compute Engine, סוכן התפעול אוסף טלמטריה של צד שלישי.

המאמרים הבאים