קצב הגידול במספר הפרמטרים (Parameter Growth)
הגדרה
מספר הפרמטרים במודלים גדל מ-117 מיליון ב-GPT-1 בשנת 2018 ל-175 מיליארד ב-GPT-3 בשנת 2020 — ועד לטריליונים במודלים פתוחים ב-2026.
מ-117 מיליון ל-175 מיליארד: פי אלף וחצי בשנתיים
פרמטרים הם הערכים הפנימיים שמודל לומד באימון, ומספרם הוא הנתון המצוטט ביותר על גודלו. קצב הגידול בו הוא אחד המספרים החדים בתחום: GPT-1, שיצא ביוני 2018, החזיק 117 מיליון פרמטרים. GPT-3, כעבור פחות משנתיים במאי 2020, החזיק 175 מיליארד — פי אלף וחצי. כל המספרים בערך הזה נבדקו מול המקורות בספטמבר 2026.
המלכודת הראשונה: פרמטרים כוללים מול פרמטרים פעילים
שתי הסתייגויות הופכות השוואה גולמית של המספר למטעה. הראשונה היא שיטת תמהיל המומחים, שנפוצה מאז 2024: מודל Kimi K3 של Moonshot AI, שיצא ב-16 ביולי 2026, מחזיק 2.8 טריליון פרמטרים אך מפעיל רק כ-104 מיליארד מהם בכל חיזוי בודד. המנגנון עצמו פשוט להסבר — לפי התיעוד של Moonshot, המודל בנוי מ-896 יחידות-מומחה, ולכל קלט נבחרות 16 מהן בלבד. השוואת המספר הכולל שלו למודל שמפעיל את כל הפרמטרים בכל פעם משווה שני דברים שונים. הפער אינו יוצא-דופן: DeepSeek-V3 מחזיק 671 מיליארד פרמטרים ומפעיל 37 מיליארד בלבד לכל טוקן.
המלכודת השנייה: כמות פרמטרים אינה איכות
השנייה היא שכמות אינה הכול. Chinchilla של Google DeepMind, שיצא במרץ 2022 עם 70 מיליארד פרמטרים בלבד, אומן על 1.4 טריליון טוקנים — כמעט פי שניים מ-768 המיליארד שעליהם אומן PaLM, שיצא חודש אחריו עם פי שבעה ושבע-עשיריות יותר פרמטרים. מודל קטן בהרבה שראה יותר נתונים יכול להשיג יותר ממודל גדול שראה פחות, וזו הסיבה שמספר הפרמטרים לבדו אינו מדד לביצועים.
כמה זה בעצם: 350 ג׳יגה-בייט
כדי להפוך את המספרים למוחשיים: 175 מיליארד פרמטרים בדיוק של 16 סיביות תופסים כ-350 ג׳יגה-בייט אחסון, כלומר GPT-3 עצמו הוא קובץ גדול מכל דיסק במחשב ביתי טיפוסי של אותה תקופה. בצד הפתוח, DeepSeek-V3 שיצא בדצמבר 2024 החזיק 671 מיליארד פרמטרים ואומן על 14.8 טריליון טוקנים, ופורסם ברישיון MIT — מודל בסדר גודל חזיתי שכל אחד יכול להוריד.
המספר שהפסיק להתפרסם
מאז 2023 הנתון פשוט חדל להתפרסם עבור מודלים סגורים: OpenAI לא פרסמה את גודלו של GPT-4 — ויקיפדיה מציינת שהחברה לא חשפה פרטים טכניים ובהם גודלו המדויק של המודל — וגם גוגל אינה מפרסמת את גודל הגרסאות הגדולות של Gemini. הרשימות הכמותיות הזמינות היום מכסות בעיקר מודלים בעלי משקלים פתוחים, וזו סיבה טובה לזהירות בכל השוואה בין מודל פתוח למודל סגור: מספר שמופיע לצד מודל מסחרי הוא לרוב הערכה עיתונאית ולא הצהרה של היצרנית. ההיעדרות הזו היא עצמה עובדה על התחום, לא חור בתיעוד.
מה כן נשאר מדיד
התוצאה המעשית: נכון לספטמבר 2026, המספר הגבוה ביותר שפורסם רשמית הוא 2.8 הטריליון של Kimi K3 — ודווקא מודל בעל משקלים פתוחים. אין מספר מקביל מאושר לאף מודל סגור מוביל, ולכן אי-אפשר לומר היום בביטחון מי מחזיק את המודל הגדול בעולם. שני מדדים אחרים כן נשארו מדידים והחליפו את ספירת הפרמטרים כאמת-מידה לגודל: כמות החישוב שהושקעה באימון, ועלות האימון בדולרים. לשניהם יש באתר ערך משלהם.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| שוחרר | פרמטרים | |
|---|---|---|
| GPT-1 | יוני 2018 | 117 מיליון |
| BERT | אוקטובר 2018 | 340 מיליון |
| GPT-2 | פברואר 2019 | 1.5 מיליארד |
| GPT-3 | מאי 2020 | 175 מיליארד |
| PaLM | אפריל 2022 | 540 מיליארד |
| GPT-4 | מרץ 2023 | לא פורסם |
| Llama 3.1 | יולי 2024 | 405 מיליארד |
| Kimi K3 | יולי 2026 | 2.8 טריליון (כ-104 מיליארד פעילים) |
שאלות נפוצות ❓
מהו מספר הפרמטרים ולמה מצטטים אותו כל-כך הרבה?
פרמטרים הם הערכים הפנימיים שמודל לומד באימון, ומספרם הוא הדרך הפשוטה ביותר לתאר את גודלו במספר אחד. GPT-1 החזיק 117 מיליון ב-2018, GPT-3 החזיק 175 מיליארד ב-2020 — פי אלף וחצי בפחות משנתיים.
מה ההבדל בין פרמטרים כוללים לפרמטרים פעילים?
במודלים בשיטת תמהיל המומחים רק חלק קטן מהפרמטרים פועל בכל חיזוי. Kimi K3 מחזיק 2.8 טריליון פרמטרים ומפעיל כ-104 מיליארד מהם; DeepSeek-V3 מחזיק 671 מיליארד ומפעיל 37 מיליארד. השוואת מספר כולל של מודל אחד למספר של מודל שמפעיל הכול היא השוואה שגויה.
האם מודל עם יותר פרמטרים תמיד טוב יותר?
לא. Chinchilla של Google DeepMind, עם 70 מיליארד פרמטרים בלבד, אומן על 1.4 טריליון טוקנים — כמעט פי שניים מכמות הנתונים של PaLM, שיצא חודש אחריו עם פי שבעה ושבע-עשיריות יותר פרמטרים. כמות הנתונים ואופן האימון משפיעים לא פחות מהגודל.
למה אין מספר פרמטרים עדכני למודלים של OpenAI וגוגל?
כי מאז 2023 הם פשוט אינם מתפרסמים. OpenAI לא חשפה את גודלו של GPT-4, וגוגל אינה מפרסמת את גודל הגרסאות הגדולות של Gemini. כל מספר שמופיע לצד מודל סגור הוא בדרך-כלל הערכה חיצונית, לא הצהרה של היצרנית.
מה המספר הגבוה ביותר שפורסם רשמית נכון להיום?
2.8 טריליון פרמטרים, ב-Kimi K3 של Moonshot AI מיולי 2026 — מודל בעל משקלים פתוחים. מכיוון שספקי המודלים הסגורים אינם מפרסמים את המספר, אי-אפשר לדעת אם קיים מודל גדול ממנו.