הגבלת קצב (Rate Limit)
הגדרה
הגבלת קצב (Rate Limit) היא תקרה על מספר הבקשות שמותר לשלוח לשירות AI בפרק זמן נתון, כדי למנוע עומס.
הגבלת קצב (Rate Limit) היא תקרה על מספר הבקשות שמותר לשלוח לשירות AI בפרק זמן נתון — למשל, "עד 15 בקשות בדקה" — שנועדה למנוע עומס על השרתים ושימוש לרעה.
מבחינה טכנית, שירותים מיישמים הגבלת-קצב באחד מכמה אלגוריתמים סטנדרטיים: "דלי-טוקנים" (token bucket) ו"דלי-דולף" (leaky bucket), חלון-קבוע (fixed window), או חלון-נגלל (sliding window) — כל אחד מאזן אחרת בין דיוק להוצאות-חישוב. אלגוריתם "דלי-הטוקנים", למשל, מאפשר גם "התפרצויות" קצרות (bursts) מעבר לקצב הממוצע כל עוד המשתמש לא חרג מהמכסה המצטברת — גמישות שחסרה באלגוריתם "החלון-הקבוע" הפשוט יותר. כשבקשה חורגת מהמכסה, השרת מחזיר בדרך כלל קוד-שגיאה HTTP 429 ("יותר מדי בקשות"), ולעיתים מציין גם כעבור כמה זמן אפשר לנסות שוב. בשירותי מודלי-שפה נהוג להגביל לא רק לפי מספר-בקשות אלא גם לפי כמות-טוקנים לדקה (TPM) — כי בקשה בודדת עם הקשר ארוך מאוד יכולה להעמיס על השרת הרבה יותר מבקשה קצרה, גם אם שתיהן נחשבות "בקשה אחת".
הגבלות קצב מגנות גם על ספק השירות — למשל מפני מתקפות-מניעת-שירות (DoS), שבהן מכונה בודדת "זומבי" עלולה לשגר יותר מ-20 בקשות-GET בשנייה, קצב שרחוק מאוד מדפוס-שימוש אנושי לגיטימי — וגם על משתמשים אחרים, בכך שמבטיחות חלוקה הוגנת יחסית של המשאב המשותף. מנגד, הן עלולות ליצור חוויית-משתמש מתסכלת למי שנתקל בהן בעיצומה של עבודה.
שירותים רבים מגדירים הגבלות קצב שונות לפי רמת המנוי: משתמש חינמי מקבל הגבלה נמוכה יותר ממשתמש בתשלום, וארגונים גדולים לעיתים מקבלים הגבלות מותאמות אישית דרך הסכם עסקי ייעודי. בשירותי-ענן גדולים ההגבלות מיושמות בכמה שכבות במקביל — התקני-חומרה ברמת-הרשת (בשכבות 4-5 של מודל ה-OSI, Open Systems Interconnection), שרתי-האפליקציה עצמם (לרוב באמצעות מסדי-נתונים-בזיכרון כמו Redis למעקב אחר סשנים), ואפילו ברמת-שכבת-הניהול הווירטואלית של מרכז-הנתונים.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות