מה מודדת כלכלת-יחידה של AI
כלכלת-יחידה של AI (AI Unit Economics) היא מדד תפעולי: כמה עולה בפועל, בדולרים, לבצע פעולת-AI בודדת — שיחת-צ'אט אחת, משימת-סוכן אחת, מסמך אחד שעובד. זה שונה מהותית ממדד פיננסי כמו רווח גולמי של מוצרי AI, שמבטא אחוז מההכנסה שנשאר אחרי העלות: כלכלת-יחידה עוסקת בעלות-בפועל-לפעולה, לא באחוז-רווח על שורת-ההכנסה הכוללת. שני המדדים קשורים — עלות-יחידה גבוהה מדי היא סיבה ישירה לרווח-גולמי נמוך — אבל הם נמדדים ונענים בשאלות שונות.
הפער בין בוט חד-שלבי לסוכן מרובה-שלבים
לפי CloudZero, הפער בין תרחישים יכול להיות עצום: בוט חד-שלבי שרץ על מודל זול כמו GPT-4o mini עולה בסביבות 0.0002 דולר לשיחה בודדת; סוכן-תמיכה תלת-שלבי שרץ על מודל חזק יותר כמו Claude Sonnet 4.6 עולה כבר בסביבות 0.03 דולר לשיחה; וזרימת-עבודה שש-שלבית עם קריאה-לכלים על אותו סוג מודל יכולה להגיע ל-0.15 דולר ומעלה. אותה "שיחה אחת" יכולה לעלות פי מאות, תלוי במספר-הקריאות-למודל שהתהליך מבצע בפועל.
כשההנחות נשברות: הכפלה במספר הקריאות
CloudZero מתארת מקרה שממחיש למה כלכלת-יחידה קשה לחזות מראש: צוות שהשיק בוט-תמיכה על GPT-4o ציפה להוצאה חודשית של 800 דולר, אבל החשבון הראשון הגיע ל-4,200 דולר — כי הסוכן ביצע בממוצע 11 קריאות-למודל לכל שיחה, במקום 3 קריאות שהצוות הניח מראש. הפער נובע מהתנהגות-בפועל של הסוכן — קריאה-לכלי, אימות-תוצאה, תיקון-עצמי — ולא ממחיר-הטוקן עצמו. Cockroach Labs מוסיפה תיאור דומה מזווית אחרת: זרימת-עבודה סוכנית שקוראת לכלים חיצוניים, מאמתת פלט ומתקנת את עצמה יכולה להפעיל בין 10 ל-20 קריאות-מודל עבור משימה בודדת שהמשתמש יזם — כפולה של הקריאה היחידה שמודל-מחיר-פשוט מניח.
אותו בוט, מודל אחר — עלות שונה פי עשרות
בחירת-המודל לבדה יכולה לשנות את עלות-היחידה בסדרי-גודל: לפי אותו מקור, בוט-תמיכה שרץ על gpt-4o-mini עולה כ-36 דולר לחודש, בעוד אותו בוט על Claude Sonnet 4 עולה כ-1,260 דולר לחודש — הפרש שהמקור עצמו מכנה "פי-35". סוכן-קוד שרץ על Claude Opus 4 יכול להגיע ל-9,000 דולר לחודש בהיקף-קריאות אופייני לסוכן.
למה זה מדד תפעולי ולא פיננסי
ההבדל בין כלכלת-יחידה לרווח-גולמי אינו רק סמנטי: רווח-גולמי הוא מדד-פיננסי שמסכם את כל ההכנסה מול כל עלות-ההפעלה, ומתאים לדוח-רווח-והפסד. כלכלת-יחידה היא מדד-תפעולי שמאפשר לצוות-מוצר לבדוק החלטה בודדת — לבחור מודל אחר, לצמצם מספר-קריאות, להוסיף מטמון — ולראות מיד את ההשפעה בדולרים על פעולה בודדת, בלי לחכות לדוח-הכנסות רבעוני.
איך זה משפיע על תמחור ותכנון
מכיוון שעלות-היחידה יכולה לקפוץ כשהתנהגות-הסוכן משתנה, צוותי-מוצר משתמשים בכלים כמו ניתוב-מודלים (שליחת שאילתות קלות למודל זול) ותמחור-לפי-טוקן (שכבות-הנחה על אצווה ומטמון) כדי לשלוט בעלות-היחידה לפני שהיא מתגלגלת להפסד בקנה-מידה. חברות שמתמחרות מוצר AI צריכות לדעת את עלות-היחידה שלהן לפני קביעת מחיר-מכירה, אחרת המחיר עלול להיות נמוך מהעלות בפועל.