דלג לתוכן

עלות אימון של מודל שפה (LLM Training Cost)

נתוני AI

הגדרה

אימון GPT-2 ב-2019 עלה כ-50 אלף דולר; אימון GPT-4 ב-2023 עלה יותר ממאה מיליון דולר לפי סם אלטמן — פי אלפיים בארבע שנים.

עלות חד-פעמית שקונה שימוש חוזר לנצח

עלות האימון היא הוצאה חד-פעמית: משלמים אותה פעם אחת כדי לייצר את המודל, ואז אפשר להריץ אותו שוב ושוב. היא הסיבה המרכזית לכך שרק מספר קטן של חברות בעולם מפתחות מודלים חזיתיים.

קצב העלייה בדולרים: מ-⁦GPT-2⁩ ל-⁦GPT-4⁩

קצב העלייה חד. אימון ⁦GPT-2⁩, שיצא בפברואר 2019, הוערך בכ-50 אלף דולר. אימון ⁦GPT-3⁩, שיצא במאי 2020, הוערך בחישוב שנעשה באותה שנה בכ-4.6 מיליון דולר — אך זו הערכה תיאורטית של חברת Lambda Labs לעלות אימון על מעבד גרפי בודד, אימון שהיה נמשך 355 שנים, ולא הסכום שהחברה שילמה בפועל. מודל Megatron-Turing NLG משנת 2021 הוערך בכ-11 מיליון, ו-PaLM של גוגל מאפריל 2022 בכ-8 מיליון. את עלות האימון של ⁦GPT-4⁩, שיצא במרץ 2023, OpenAI לא פרסמה; סם אלטמן אמר שהיא עלתה על 100 מיליון דולר.

מדד יציב יותר: פטה-פלופ-יום

מדד יציב יותר מדולרים הוא כמות החישוב, שנמדדת ביחידה שנקראת פטה-פלופ-יום. כאן אין הערכות אלא נתונים מדווחים: ⁦GPT-1⁩ דרש פטה-פלופ-יום אחד ב-2018, ⁦GPT-3⁩ דרש 3,640 ב-2020, ו-Llama 3.1 של Meta דרש 440 אלף ביולי 2024 — פי מאה ועשרים מ-⁦GPT-3⁩ בארבע שנים.

הקצב הנמדד לאורך זמן: פי 3.5 בשנה

מכון המחקר Epoch AI עוקב באופן שיטתי אחרי המגמה הזו, ומעדכן אותה באופן שוטף. לפי הלוח-הבקרה שלו, בעדכון מפברואר 2026, עלות האימון של מודלי-שפה חזיתיים גדלה בקצב של פי 3.5 בשנה מאז 2020, וכמות-החישוב הנדרשת לאימון גדלה בקצב של פי 5 בשנה — כך שמאז 2020 כמות החישוב של חמשת המודלים המובילים גדלה פי כעשרת-אלפים.

במקביל, היעילות האלגוריתמית משתפרת — אותה רמת-ביצועים ניתנת להשגה עם כפי 3 פחות חישוב מדי שנה, הודות לשיפורים בשיטות-האימון עצמן. אבל היעילות הזו לא מצליחה לבלום את העלייה בעלות: קצב-הגידול בכמות-החישוב הגולמית פשוט מהיר יותר מקצב-השיפור באלגוריתמים.

עלויות כאלה דורשות תשתית שקשה לדמיין: מרכז-נתונים טיפוסי של AI בהספק של 1 ג'יגה-ואט עולה, לפי Epoch AI, כ-38 מיליארד דולר בהוצאה הונית ראשונית בלבד — וזה לפני עלות-החשמל השוטפת. לא במקרה מעבדות ה-AI החזיתיות גייסו יחד יותר מ-370 מיליארד דולר, לפי אותו מקור.

מהאקדמיה לתעשייה

העלות הזו היא הסיבה המרכזית לכך שבניית מודלים חזיתיים עברה כמעט כולה מהאקדמיה לתעשייה: לפי דוח מדד ה-AI של סטנפורד ממהדורת 2025, כמעט 90 אחוזים מהמודלים הבולטים שיצאו ב-2024 הגיעו מחברות מסחריות, לעומת כ-60 אחוזים ב-2023. מעבדה אוניברסיטאית פשוט אינה יכולה לממן סכומים כאלה.

מספרים בלתי-רשמיים לעומת חישוב מדווח

ראוי לזכור שכל מספרי הדולרים כאן הם הערכות של גורמים חיצוניים או אמירות של מנהלים, ולא דיווח כספי מבוקר. עלות האימון של מודלים מסחריים כמעט אינה מתפרסמת רשמית, ולכן הפער בין ההערכות השונות לאותו מודל עשוי להיות גדול. כמות החישוב, לעומת זאת, מדווחת לעיתים קרובות יותר והיא הבסיס האמין יותר להשוואה — וגם עליה, כפי שמראה המעקב השיטתי של Epoch AI, אפשר לבסס מגמה ארוכת-טווח ולא רק נקודות בודדות.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

משאבי אימון ועלות מוערכת של מודלים נבחרים (נכון לנתונים שפורסמו עד 2024)
שוחררחישוב (פטה-פלופ-ימים)עלות מוערכת
GPT-1יוני 20181לא פורסמה
GPT-2פברואר 201928כ-50 אלף דולר
GPT-3מאי 20203,640כ-4.6 מיליון דולר (הערכה תיאורטית, 2020)
Megatron-Turing NLG2021לא פורסםכ-11 מיליון דולר
PaLMאפריל 202229,250כ-8 מיליון דולר
GPT-4מרץ 2023לא פורסםיותר מ-100 מיליון דולר (סם אלטמן)
Llama 3.1יולי 2024440,000לא פורסמה

שאלות נפוצות ❓

למה עלות האימון של ⁦GPT-4⁩ לא פורסמה רשמית?

OpenAI בחרה לא לפרסם את המספר. כל מה שידוע הוא אמירה של סם אלטמן, מנכ"ל החברה, שהעלות עלתה על 100 מיליון דולר — לא דיווח כספי מבוקר.

באיזה קצב גדלה עלות האימון של מודלי-שפה חזיתיים?

לפי מעקב שיטתי של Epoch AI, שעודכן בפברואר 2026, העלות גדלה בקצב של פי 3.5 בשנה מאז 2020, וכמות-החישוב הנדרשת גדלה בקצב של פי 5 בשנה — עלייה מצטברת של כעשרת-אלפים מאז 2020 בחמשת המודלים המובילים.

האם היעילות האלגוריתמית מצליחה לבלום את העלייה בעלות?

רק בחלקה. אותה רמת-ביצועים ניתן להשיג עם כפי 3 פחות חישוב מדי שנה בזכות שיפורים אלגוריתמיים, אבל קצב-הגידול בכמות-החישוב הגולמית שמשקיעים המודלים החזיתיים מהיר עוד יותר — כך שהעלות הכוללת ממשיכה לעלות.

למה כמעט כל המודלים המובילים היום מגיעים מחברות מסחריות ולא מאוניברסיטאות?

בגלל העלות. לפי דוח מדד ה-AI של סטנפורד, כמעט 90 אחוזים מהמודלים הבולטים שיצאו ב-2024 הגיעו מחברות מסחריות, לעומת כ-60 אחוזים ב-2023 — מעבדות אקדמיות פשוט לא יכולות לממן מרכזי-נתונים בעלות של עשרות מיליארדי דולרים.

מה ההבדל בין מדידת עלות בדולרים למדידה בפטה-פלופ-ימים?

דולרים הם הערכה עקיפה שתלויה במחירי-חומרה ובמי שמעריך אותה, ולרוב אינה מתפרסמת רשמית. פטה-פלופ-ימים מודדים כמות-חישוב בפועל, ולרוב כן מדווחים בפרסומי המודלים — ולכן מהווים בסיס-השוואה אמין יותר לאורך זמן.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו