תמחור-לפי-טוקן (Token Pricing)
הגדרה
תמחור-לפי-טוקן הוא מודל-חיוב נפוץ לשירותי מודלי-שפה, שבו העלות נקבעת לפי כמות הטוקנים שנשלחו ונוצרו — לא לפי מנוי קבוע או מספר-בקשות בלבד.
מה זה תמחור-לפי-טוקן
תמחור-לפי-טוקן הוא מודל-חיוב נפוץ לשירותי מודלי-שפה, שבו העלות נקבעת לפי כמות הטוקנים שנשלחו ונוצרו — לא לפי מנוי קבוע או מספר-בקשות בלבד. כל בקשה למודל שפה נמדדת בטוקני-קלט (מה שנשלח) וטוקני-פלט (מה שנוצר), ולכל סוג יש לרוב מחיר שונה, כשטוקני-פלט יקרים משמעותית יותר לרוב, כי הם דורשים חישוב-ייצור בפועל, טוקן-אחר-טוקן, ולא רק קריאה חד-פעמית של קלט קיים.
פערי-המחיר בין המודלים
התמחור בפועל אצל ספקים מובילים ממחיש את ההיקף: אצל OpenAI, גישה למודל GPT-4o בשכבת השירות הרגילה עולה כ-2.50 דולר למיליון טוקני-קלט ו-10 דולר למיליון טוקני-פלט, בעוד מודל-ההיסק O1 יקר בהרבה — כ-15 דולר קלט ו-60 דולר פלט למיליון טוקנים; מודלים קלים וזולים יותר, כמו GPT-5.6-Luna, מתומחרים סביב 0.20 דולר קלט ו-1.20 דולר פלט בלבד למיליון טוקנים — פער של עשרות מונים בין המודל הזול ליקר, עבור אותה כמות-טוקנים בדיוק.
הנחות: אצווה, פריוריטי ומחיר-אזורי
מעבר למחיר-הבסיס לפי-מודל, שני הספקים הגדולים מפעילים כמה מכפילי-מחיר קבועים שחלים על כל בקשה. עיבוד באצווה (Batch, כשהתשובה לא נדרשת מיידית) מוזל ב-50% אצל OpenAI ואצל Anthropic כאחד, גם בקלט וגם בפלט. בכיוון ההפוך, מצב-פריוריטי למענה מהיר יותר מהרגיל — "Fast mode" בשתי הפלטפורמות — יקר פי-2 בקירוב מהמחיר הרגיל. ועיבוד באזור-גיאוגרפי מובטח, לצורך עמידה בדרישות-רגולציה על מיקום-הנתונים, מוסיף תוספת קבועה: כ-10% אצל OpenAI (עבור מודלים שיצאו מ-5 במרץ 2026 ואילך), ומכפיל של פי-1.1 אצל Anthropic על כל קטגוריות-המחיר — קלט, פלט וגם קריאה מהמטמון.
כלכלת המטמון: למה קאשינג הוא גם הוצאה
טוקני-קלט "שמורים במטמון" (cached) — הקשר שכבר נשלח בעבר באותה שיחה — מתומחרים בהנחה תלולה כשקוראים אותם שוב: לפי Anthropic, קריאה-ממטמון עולה כ-10% מהמחיר הרגיל במרבית המודלים, ורק כ-2.5% ממנו בדור העדכני ביותר; OpenAI מדווחת על הנחה של 90% על קלט-ממוטמן, נתון עקבי עם המספרים של Anthropic. אבל הכתיבה הראשונה למטמון אינה זולה — היא יקרה יותר מהמחיר הרגיל, לא פחות: כתיבה לחלון-מטמון של חמש דקות עולה פי-1.25 מהקלט הרגיל, וכתיבה לחלון של שעה עולה פי-2. המשמעות המעשית: מטמון מחזיר את עצמו כבר בקריאה הראשונה בחלון הקצר, ורק מהקריאה השנייה בחלון הארוך — אבל הקשר שנשמר במטמון ונקרא פעם אחת בלבד יקר יותר, לא זול יותר, מאשר לא לשמור אותו כלל.
מה עוד נכנס לחשבון
מעבר לטוקני-השיחה עצמם, גם הגדרת-כלים (tools) לשימוש-בכלים מוסיפה עלות קבועה לכל בקשה — אצל Anthropic, בין כמה מאות לכמה מאות-בודדות של טוקנים נוספים לכל בקשה, רק בגלל שהכלי הוגדר, גם אם המודל בפועל לא קרא לו. ופעולות שאינן טוקנים כלל מתומחרות בנפרד: חיפוש-אינטרנט מובנה, למשל, עולה אצל Anthropic 10 דולר לכל 1,000 חיפושים, בנוסף למחיר-הטוקנים של תוצאות-החיפוש עצמן שנכנסות להקשר.
איך זה משנה החלטות מוצר
שיחה ארוכה עם הרבה הקשר עולה יותר משיחה קצרה, גם אם שתיהן "בקשה אחת" — עובדה שיוצרת תמריץ כלכלי אמיתי לניהול-הקשר יעיל (לא לגרור היסטוריית-שיחה מיותרת) ולבחירת מודל בגודל-מתאים למשימה, כי לא תמיד המודל החזק ביותר משתלם לכל שימוש. הפערים העצומים בין תמחור-המודלים השונים הפכו את בחירת-המודל להחלטה כלכלית ממש, לא רק החלטה טכנית של "מה הכי חכם", מפני שאפליקציה שמריצה מיליוני בקשות ביום יכולה לחסוך סכומים משמעותיים רק בבחירת מודל מתאים למשימה. תמחור-לפי-טוקן שונה גם מבחינה מבנית ממודל-המנוי הקבוע המוכר יותר מעולם התוכנה: הוא הופך את ה-AI להוצאה משתנה שקשה יותר לחזות מראש בתקציב, אבל גם מתגמל שימוש-חכם ומעניש בזבזנות — בניגוד למנוי קבוע, שבו העלות זהה בין אם המשתמש ניצל אותו במלואו ובין אם בקושי נגע בו.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| אצווה (Batch) | קריאה מהמטמון | פריוריטי (Fast Mode) | אזורי-ייעודי | |
|---|---|---|---|---|
| מה קורה למחיר | מוזל בכ-50% | מוזל בכ-90%, ועד כ-97.5% במודלים החדשים ביותר | יקר פי-2 בקירוב | יקר ב-10% בקירוב |
| מתי זה חל | כשהתשובה לא נדרשת מיידית | כשאותו הקשר נשלח שוב אחרי שנשמר במטמון | כשנדרשת תשובה מהירה יותר מהרגיל | כשנדרשת ערובה שההסקה תתבצע באזור גיאוגרפי מסוים |
| מי מציע את זה | OpenAI ו-Anthropic כאחד | OpenAI ו-Anthropic כאחד | OpenAI ו-Anthropic כאחד | OpenAI ו-Anthropic כאחד |
שאלות נפוצות ❓
למה טוקני-פלט יקרים יותר מטוקני-קלט?
כי הם דורשים חישוב-ייצור בפועל, טוקן-אחר-טוקן, ולא רק קריאה חד-פעמית של קלט קיים. אצל רוב הספקים המחיר לטוקן-פלט גבוה פי-כמה מהמחיר לטוקן-קלט באותו מודל.
כמה חוסך עיבוד-באצווה, וכמה חוסכת שמירה-במטמון?
עיבוד באצווה (Batch) מוזל ב-50% אצל OpenAI ואצל Anthropic. קריאה חוזרת מהמטמון עולה כ-10% מהמחיר הרגיל במרבית המודלים, ואף רק כ-2.5% ממנו בדור העדכני ביותר של Anthropic. שתי ההנחות ניתנות לשילוב זו עם זו.
האם שמירה-במטמון תמיד חוסכת כסף?
לא. הכתיבה הראשונה למטמון יקרה יותר מהמחיר הרגיל — פי-1.25 לחלון של חמש דקות, פי-2 לחלון של שעה — ורק קריאות חוזרות מהוזלות. הקשר שנקרא פעם אחת בלבד יקר יותר במטמון מאשר בלעדיו.
מה זה "מצב פריוריטי" ולמה הוא יקר יותר?
מצב שמעניק מענה מהיר יותר מהרגיל תמורת מחיר גבוה פי-2 בקירוב מהמחיר הסטנדרטי, זמין אצל OpenAI ואצל Anthropic. עיבוד באזור-גיאוגרפי מובטח, לצורכי-רגולציה, מוסיף תוספת נפרדת של כ-10%.
למה בחירת-מודל הפכה להחלטה כלכלית ולא רק טכנית?
כי הפערים בין מודלים מגיעים לעשרות מונים עבור אותה כמות-טוקנים. אפליקציה שמריצה מיליוני בקשות ביום חוסכת סכומים משמעותיים רק על ידי בחירת מודל בגודל-מתאים למשימה, במקום הרצת כל בקשה על המודל החזק ביותר הקיים.