תמחור לפי אצווה (Batch API Pricing)

עולם המוצר והעסקים

הגדרה

תמחור לפי אצווה הוא הנחה קבועה שספקי מודלי-שפה מעניקים על עיבוד א-סינכרוני שאינו דורש תשובה מיידית, בתמורה להסכמה להמתין עד 24 שעות לתוצאה.

מה זה תמחור לפי אצווה

תמחור לפי אצווה (Batch API Pricing) הוא הנחה קבועה שספקי מודלי-שפה מעניקים על עיבוד א-סינכרוני שאינו דורש תשובה מיידית, בתמורה להסכמה להמתין עד 24 שעות לתוצאה. במקום לשלוח בקשה בודדת ולחכות לתשובה בזמן-אמת, הלקוח שולח קובץ שלם של בקשות-מרובות בבת-אחת, והספק מעבד אותן ברקע — בזמן שמתאים לו, לא בזמן שמתאים ללקוח — ומחזיר את כל התוצאות יחד כשהעיבוד מסתיים.

אותה הנחה אצל שלושת הספקים הגדולים

שלושת ספקי מודלי-השפה המובילים מציעים בדיוק אותה מסגרת-הנחה. ה-Batch API של OpenAI מפורסם כ"50% הנחה בהשוואה למחיר ה-API הסינכרוני הרגיל". ה-Message Batches API של Anthropic מוגדר בתיעוד הרשמי כמעניק "50% הנחה על כל השימוש, בהשוואה למחירי ה-API הסטנדרטיים". וה-Batch API של Google, בתמחור ה-Gemini שלה, מפורסם באותו אופן כ"הפחתת-מחיר של 50%". שלושת הספקים הגיעו לאותו מספר בדיוק — 50% — בלי תיאום גלוי ביניהם.

איך זה עובד בפועל

אצל OpenAI, אצווה מושלמת בתוך 24 שעות, ולעיתים קרובות מהר יותר. אצל Anthropic ניתן לעבד עד 100,000 בקשות-הודעה בתוך אותו חלון-24-שעות. במקום שיחה בודדת עם המודל, מדובר בקובץ שלם של בקשות שממתין בתור, מעובד כשיש קיבולת פנויה, ומוחזר ללקוח בבת-אחת כשהעבודה כולה הושלמה — לא בקצב-שיחה, אלא בקצב-קובץ.

למה ספקים מוכנים לוותר על מחצית המחיר

ההיגיון הכלכלי מבחינת הספק פשוט: בקשה שאינה דורשת תשובה מיידית אפשר לתזמן לרגעים שבהם יש קיבולת-מעבד-גרפי פנויה, ולא להתחרות על אותם משאבים עם בקשות-זמן-אמת שדורשות עדיפות. כך הספק ממלא קיבולת שהייתה נשארת מנוצלת-חלקית, בלי לפגוע באיכות-השירות למשתמשים שכן זקוקים לתשובה מיידית — ומעביר חלק מהחיסכון הזה ללקוח בדמות ההנחה.

מתי זה באמת שווה את ההמתנה

עיבוד-באצווה מתאים לעבודות שמטבען אינן אינטראקטיביות: הערכה של איכות-מודל על מבחן גדול, העשרת-מסמכים בכמות, חישוב-הטמעות (embeddings) לספריית-תוכן שלמה, סיווג-בכמות של רשומות, או השלמת-פערים בנתונים ישנים (backfill). בכל המקרים האלה אין משתמש שמחכה מול המסך לתשובה — יש תהליך שרץ ברקע ומקבל תוצאה תוך יום, במקום תוך שניות, במחצית המחיר.

ההבדל מהנחת-אצווה בתמחור-לפי-טוקן

תמחור-לפי-אצווה הוא מכפיל-מחיר קבוע שמתווסף על גבי מחיר-הבסיס של המודל — לא מודל-תמחור עצמאי בפני עצמו. מודל שעולה, למשל, שני דולר למיליון טוקני-קלט במסלול הרגיל יעלה כדולר אחד באותו מדד כשהוא נשלח דרך אצווה; ההנחה חלה גם על טוקני-קלט וגם על טוקני-פלט. במילים אחרות, זו הנחה שמצטרפת על-גבי תמחור-לפי-טוקן, לא תחליף לו — עסק שבוחר להשתמש באצווה עדיין צריך לדעת קודם את מחיר-הטוקן הבסיסי של המודל שבו הוא משתמש.

שאלות נפוצות ❓

כמה חוסך עיבוד-באצווה?

50%, בכל אחד משלושת ספקי מודלי-השפה המובילים — OpenAI, Anthropic ו-Google — לפי הפרסום הרשמי של כל אחד מהם. ההנחה חלה גם על טוקני-קלט וגם על טוקני-פלט.

כמה זמן לוקח לקבל תוצאה מבקשת-אצווה?

עד 24 שעות, ולעיתים קרובות מהר יותר, לפי OpenAI. אצל Anthropic ניתן לעבד עד 100,000 בקשות-הודעה בתוך אותו חלון-24-שעות.

למה בכלל ספק מוכן לוותר על מחצית המחיר?

כי בקשה שאינה דורשת תשובה מיידית אפשר לתזמן לרגעים שבהם יש קיבולת-מעבד-גרפי פנויה, ולא להתחרות על אותם משאבים עם בקשות-זמן-אמת. הספק ממלא קיבולת שהייתה נשארת מנוצלת-חלקית, ומעביר חלק מהחיסכון ללקוח.

לאיזה סוג עבודה זה מתאים?

לעבודות שאינן אינטראקטיביות: הערכת-איכות-מודל, העשרת-מסמכים בכמות, חישוב-הטמעות (embeddings), סיווג-בכמות, או השלמת-פערים בנתונים ישנים — כל מקרה שבו אין משתמש שמחכה מול המסך לתשובה.

האם הנחת-האצווה מחליפה את תמחור-לפי-טוקן?

לא. היא מכפיל-מחיר קבוע שמתווסף על גבי מחיר-הבסיס לפי-טוקן, לא תחליף לו. עסק שבוחר להשתמש באצווה עדיין צריך לדעת קודם את מחיר-הטוקן הבסיסי של המודל שבו הוא משתמש.