שליטה בעלויות באמצעות מכסות של טוקנים
במאמר הזה מוסבר איך להגדיר ולנהל מגבלות יומיות על מספר האסימונים של קלט ופלט שנצרכים על ידי פונקציות של AI גנרטיבי.פונקציות ה-AI הגנרטיבי של BigQuery משתמשות במודלים גדולים של שפה (LLM) כדי לבצע ניתוח מתקדם בשאילתות SQL. החיוב על השימוש ב-LLM מתבסס בדרך כלל על מספר הטוקנים שעברו עיבוד, ולכן BigQuery מספק מכסות טוקנים כדי לעזור לכם לנהל ולשלוט בעלויות שקשורות לשימוש בפונקציות האלה.
מכסת הטוקנים חלה על פונקציות BigQuery SQL שמיועדות למשימות של הסקת מסקנות מ-AI גנרטיבי שמשתמשות במודלים של Gemini LLM, כמו הפונקציות AI.CLASSIFY ו-AI.GENERATE_TEXT. המכסות של הטוקנים לא חלות על פונקציות של הטמעה וחיפוש סמנטי, כמו AI.EMBED, שיש להן מבני חיוב שונים.
פרטי המכסה
ב-BigQuery מוגדרות מכסות יומיות על סמך השימוש באסימונים של מודלים גדולים של שפה (LLM). השימוש בטוקנים קשור ישירות לחיוב שלכם ב-Vertex AI על פונקציות AI גנרטיבי ב-BigQuery שמשתמשות במודלים של Gemini. המכסות האלה נמדדות ברמה הגלובלית בכל האזורים.
מכסות הטוקנים האלה קובעות את מספר הטוקנים של הקלט והפלט שעוברים עיבוד על ידי המודלים הגדולים של שפה (LLM) עבור פונקציות של AI גנרטיבי:
- טוקנים של קלט: טוקנים שנשלחים למודל לעיבוד. המידע הזה כולל טוקנים בטקסט ההנחיה וכל נתון אחר שסופק למודל כקלט.
- טוקנים של פלט: טוקנים שהמודל יצר בתשובה שלו. הנתונים האלה כוללים אסימונים בטקסט שנוצר (אסימונים פוטנציאליים) ואסימונים שנוצרו במהלך שלבי נימוק פנימיים (אסימוני מחשבה).
| שם המכסה | מדד | היקף | ערך ברירת המחדל |
|---|---|---|---|
GenAiInputTokensPerDay |
טוקנים של קלט שנעשה בהם שימוש על ידי מודל שפה גדול (LLM) | לכל פרויקט ביום | 200,000,000,000 |
GenAiInputTokensPerUserPerDay |
טוקנים של קלט שנעשה בהם שימוש על ידי מודל שפה גדול (LLM) | לכל משתמש ביום | 40,000,000,000 |
GenAiOutputTokensPerDay |
טוקנים של פלט ושל מחשבה שנעשה בהם שימוש על ידי מודל ה-LLM | לכל פרויקט ביום | 20,000,000,000 |
GenAiOutputTokensPerUserPerDay |
טוקנים של פלט ושל מחשבה שנעשה בהם שימוש על ידי מודל ה-LLM | לכל משתמש ביום | 4,000,000,000 |
המיכסות האלה נמדדות במרווחים של מיליוני אסימונים. אפשר להגדיר מגבלות מדויקות, אבל יכול להיות שהערכים שקטנים מכמה מיליוני טוקנים לא ישוקפו בצורה מדויקת לחלוטין בגלל האופי של דיווח הטוקנים והצבירה שלהם.
טוקנים שמאוחסנים במטמון לא נכללים במכסות.
ניהול מכסות
יכול להיות שתרצו להציג או לשנות את ערכי המכסות של הטוקנים, בהתאם לשימוש בפועל במשאבים. אתם יכולים להשתמש במסוף Cloud de Confiance כדי לבצע את המשימות הבאות:
במסוף Cloud de Confiance , פותחים את הדף IAM & Admin > Quotas & System Limits.
מסננים את המכסות על ידי הזנת
Service: BigQuery API.מחפשים מכסה ספציפית ברשימת המכסות (לדוגמה, מחפשים
GenAiInputTokensPerDay).לוחצים על Edit.
מזינים ערך חדש כדי להגדיל או להקטין את המכסה בחלונית שינויים במכסה.
- אם עומסי העבודה שלכם דורשים קיבולת גדולה יותר מהמגבלה שמוגדרת כברירת מחדל, אתם יכולים לשלוח בקשה להגדלת המכסה.
- אם אתם רוצים להגביל את השימוש כדי למנוע חריגה מהתקציב, אתם יכולים ליצור ביטול של מכסה כדי להגביל את השימוש.
לוחצים על Submit request.
התנהגות אכיפת המכסות
מערכת BigQuery עוקבת אחרי צריכת הטוקנים בכמה שלבים של ביצוע השאילתה:
- בדיקה לפני ההרצה: מערכת BigQuery בודקת את מכסת הטוקנים הזמינה לפני הרצת שאילתה שמכילה פונקציות של AI גנרטיבי. אם המכסה הרלוונטי (למשל, טוקנים של קלט יומי בפרויקט) כבר מוצה, השאילתה נדחית עם שגיאת
QuotaExceeded. - במהלך ההרצה: אם שאילתה פועלת וצורכת טוקנים כך שהיא ממצה את כל המכסות שהוגדרו (קלט או פלט, לכל פרויקט או לכל משתמש), קריאות חדשות ל-LLM בתוך השאילתה נדחות.
- אם יש שורות נוספות שתלויות בקריאות ל-LLM, תופיע שגיאה של חריגה מהמכסה.
- התוצאה של השאילתה תלויה בארגומנט
max_error_ratioאם משתמשים בו בפונקציות כמוAI.IF. אם יחס השגיאות נשאר בגבול המותר, יכול להיות שיוחזרו תוצאות חלקיות. אחרת, כל השאילתה תיכשל. - שאילתות עוקבות שמנסות להשתמש בפונקציות של AI גנרטיבי ייכשלו עם שגיאה
QuotaExceededעד לאיפוס המכסה היומית.
שיקולים חשובים
- מכסות גלובליות: המכסות המוגדרות הן גלובליות. השימוש בטוקנים מצטבר בכל האזורים שבהם הפרויקט פועל, וכך מתקבל מנגנון מאוחד לבקרת עלויות. כך נמנעים חיובים לא צפויים על שימוש באזורים שונים.
- תפוקה שהוקצתה: אם אתם משתמשים במודלים של Gemini Enterprise Agent Platform עם תפוקה שהוקצתה, החיוב לא מבוסס על שימוש בטוקנים. כדי למנוע חסימה מיותרת של השאילתות, כדאי להגדיר את מכסות הטוקנים של BigQuery לערך גבוה.