מגמת המודלים הקטנים (Small Language Models)

מגמות ועדכונים

הגדרה

מגמה תעשייתית שבה כמה מחברות-ה-AI המרכזיות שחררו, כמעט-בו-זמנית וב-2024, משפחות של מודלי-שפה קטנים בני מיליארד עד כ-15 מיליארד פרמטרים שרצים ישירות על טלפון או מחשב במקום על שרת-ענן — כתגובה מתועדת לעלות, פרטיות, זמן-תגובה ויכולת-עבודה-בלי-רשת.

מ'תמיד גדול יותר' ל'בדיוק בגודל הנכון'

עד 2023 מירוץ-הבינה-המלאכותית נמדד כמעט אך ורק בגודל: GPT-3 של OpenAI יצא ב-2020 עם 175 מיליארד פרמטרים, וכל דור חדש היה גדול מקודמו. מ-2023 ואילך נפתח מסלול מקביל: לא עוד מודל אחד ענק שרץ בענן, אלא משפחה שלמה של מודלים קטנים בהרבה — בטווח של כמיליארד עד כ-15 מיליארד פרמטרים — קטנים מספיק כדי לרוץ ישירות על הטלפון או המחשב הנייד של המשתמש, בלי לשלוח את הבקשה לשרת. מה שהופך את זה למגמה תעשייתית ולא לניסוי בודד של חברה אחת הוא התזמון: תוך פחות משמונה חודשים, Google, Microsoft, Apple, Meta ו-Mistral AI שחררו כל אחת משפחת-מודלים קטנים משלה, וכל אחת ניסחה עבורה נימוק דומה למדי — יכולת חזקה במשקל קל.

השחקנים: חמש חברות, חמש משפחות-מודלים

Microsoft פתחה את הסדרה עם Phi: הדוח הטכני של Microsoft Research, שפורסם ב-23 באפריל 2024, מתאר את Phi-3-mini כמודל בן 3.8 מיליארד פרמטרים 'קטן מספיק כדי לפעול על טלפון'. Google הכריזה על Gemma ב-21 בפברואר 2024 — משפחת מודלים במשקלים-פתוחים בגדלים 2B ו-7B, שלדברי גוגל 'מסוגלים לרוץ ישירות על מחשב נייד או שולחני' של מפתח. Meta הציגה ב-25 בספטמבר 2024 את Llama 3.2 בגרסאות 1B ו-3B, המיועדות לרוץ על 'מכשירי-קצה ומכשירים ניידים נבחרים'. Mistral AI, סטארט-אפ צרפתי, השיקה ב-16 באוקטובר 2024 את Ministral 3B ו-Ministral 8B, שלדברי החברה נועדו לענות על ביקוש-לקוחות ל'הסקה מקומית ופרטית-מטבעה'. ו-Apple, שהצטרפה כבר ב-10 ביוני 2024, בנתה מודל-יסוד-על-המכשיר בגודל של כ-3 מיליארד פרמטרים, הרץ על ה-Neural Engine של האייפון.

ארבע סיבות מתועדות: עלות, פרטיות, זמן-תגובה ועבודה-בלי-רשת

כל חברה מנמקת את המודל הקטן שלה במונחים דומים למדי. Mistral כתבה ש'לקוחות ושותפים מבקשים באופן גובר הסקה מקומית ופרטית-מטבעה' עבור יישומים כמו תרגום-על-המכשיר ו'עוזרים חכמים ללא-אינטרנט'. Meta תיארה את היתרון כ'יישומי-סוכן על-המכשיר עם פרטיות חזקה — כשהמידע לעולם לא יוצא מהמכשיר'. Apple פרסמה מספרים קונקרטיים: זמן-עד-לטוקן-הראשון של כ-0.6 מילישנייה לטוקן-קלט, וקצב-ייצור של כ-30 טוקנים בשנייה על iPhone 15 Pro — כלומר תגובה מיידית בלי השהיית-רשת. לצד זה, חברת-הייעוץ Gartner פרסמה ב-9 באפריל 2025 תחזית שלפיה עד 2027 ארגונים ישתמשו במודלים קטנים וממוקדי-משימה פי שלושה יותר ממודלי-שפה כלליים-גדולים, ולדברי סומיט אגרוואל, סגן-נשיא ואנליסט בגרטנר, 'מגוון המשימות בתהליכי-העבודה העסקיים והצורך בדיוק גבוה יותר מניעים את המעבר למודלים מותאמים'. חשוב להדגיש: זו תחזית של חברת-אנליסטים, לא מדידה של מה שכבר קרה.

איך דוחסים מודל בלי להפוך אותו לטיפש

שתי טכניקות עיקריות חוזרות בכל המשפחות. הראשונה היא גיזום-מבני (structured pruning) ו'זיקוק-ידע' (knowledge distillation): Meta מתארת איך בנתה את Llama 3.2 1B ו-3B מתוך Llama 3.1 8B — 'הסרה שיטתית של חלקים ברשת', ולאחר מכן שילוב 'לוגיטים ממודלי 8B ו-70B גדולים יותר כיעדים ברמת-הטוקן' בשלב האימון המקדים, כך שהמודל הקטן 'לומד' מהתפוקה של מודל גדול ממנו. הטכניקה השנייה היא איכות-הנתונים במקום כמותם: הדוח הטכני של Phi-3 קובע במפורש ש'החידוש טמון כולו במערך-האימון שלנו — גרסה מורחבת של זה ששימש ל-phi-2, המורכב מנתוני-רשת מסוננים-בקפדנות ומנתונים סינתטיים', ושהמודל אומן על 3.3 טריליון טוקנים בגישה הזו. זהו קשר ישיר למגמה נפרדת ומתועדת בפני עצמה — הסתמכות גוברת של מעבדות-AI על נתונים סינתטיים לאימון, ולא רק על טקסט אנושי.

לא תחליף לענן — שכבה נוספת

המודל הקטן אינו מבטל את השרת הגדול, אלא נוסף לו. הדפוס שמתגבש בתעשייה הוא היברידי: משימה קצרה ושכיחה — סיכום, סיווג, ניתוב שאלה — נענית מיידית על-המכשיר; רק כשמשימה דורשת יכולת-הנמקה עמוקה יותר, היא מועברת למודל ענן גדול. זה שונה מהמושג הכללי 'AI על-המכשיר', שמתאר טכניקה בודדת ואת ההיסטוריה שלה, ומהמושג 'עיבוד היברידי בין מכשיר לענן', שמתמקד בארכיטקטורה הטכנית שדוחפת Qualcomm — כאן מדובר בתופעה החוצה תחרות-שוק: חמש חברות מתחרות עכשיו לא רק על מי יבנה את המודל הגדול ביותר, אלא גם על מי יבנה את המודל הקטן הטוב ביותר לאותו מקטע-שוק.

מה עדיין לא ברור

שני סייגים חשובים. ראשית, השוואות-הביצועים שכל חברה מפרסמת הן בדרך-כלל הערכות-עצמיות: Apple, למשל, מדווחת שהמודל שלה 'עדיף או שווה' למודלים דומים בגודלם של Mistral, בלי בדיקה עצמאית חיצונית שפורסמה יחד עם ההכרזה. שנית, תחזית Gartner ל-2027 היא הערכת-אנליסטים ולא נתון-מדוד — היא עשויה להתממש, להתעכב או לא להתממש כלל, בדיוק כמו תחזיות-שוק אחרות בתחום. מה שכן ניתן לקבוע כעובדה מתועדת: בפרק-זמן של כשמונה חודשים בלבד, בין פברואר לאוקטובר 2024, חמש מהחברות המרכזיות בתעשייה שחררו כל אחת משפחת-מודלים קטנה משלה — וזו העדות המוצקה ביותר לכך שמדובר בתזוזה תעשייתית-רחבה, לא במהלך שיווקי של חברה בודדת.

ארבע משפחות מודלים קטנים שיצאו תוך פחות משמונה חודשים
Phi (Microsoft)Gemma (Google)Llama 3.2 (Meta)Ministral (Mistral AI)
תאריך ההשקה23.4.202421.2.202425.9.202416.10.2024
הגודל הקטן ביותר במשפחה3.8 מיליארד פרמטרים2 מיליארד פרמטרים1 מיליארד פרמטרים3 מיליארד פרמטרים
יעד-הריצה שהחברה הדגישהטלפון ניידמחשב נייד/שולחנימכשירי-קצה וניידיםרובוטיקה ועוזרים ללא-רשת

שאלות נפוצות ❓

מה זה בדיוק 'מודל-שפה קטן', ולמה זו נחשבת מגמה ולא מוצר של חברה אחת?

מודל-שפה קטן הוא גרסה בת מיליארד עד כ-15 מיליארד פרמטרים של מודל-שפה, קטנה מספיק כדי לרוץ ישירות על טלפון או מחשב בלי שרת-ענן. זו מגמה ולא מוצר בודד כי בפחות משמונה חודשים — פברואר עד אוקטובר 2024 — חמש חברות (Google, Microsoft, Apple, Meta ו-Mistral AI) שחררו כל אחת משפחת-מודלים קטנים משלה, כל אחת בנימוק דומה.

אילו חברות משתתפות במגמה, ומתי כל אחת נכנסה?

Google עם Gemma ב-21 בפברואר 2024, Microsoft עם Phi-3-mini ב-23 באפריל 2024, Apple עם מודל-על-המכשיר ב-10 ביוני 2024, Meta עם Llama 3.2 (1B/3B) ב-25 בספטמבר 2024, ו-Mistral AI עם Ministral 3B/8B ב-16 באוקטובר 2024.

למה בכלל לבנות מודל קטן אם מודל גדול חכם יותר?

ארבע סיבות מתועדות בהצהרות החברות עצמן: עלות-הרצה נמוכה יותר, פרטיות — המידע לא יוצא מהמכשיר, לפי Meta ו-Mistral — זמן-תגובה מיידי בלי השהיית-רשת (Apple מדווחת על כ-0.6 מילישנייה לטוקן), ויכולת לעבוד בלי חיבור לאינטרנט.

איך בונים מודל קטן שעדיין מספיק יכולתי?

שתי טכניקות עיקריות: גיזום וזיקוק-ידע ממודל גדול יותר, כפי שעשתה Meta כשבנתה את Llama 3.2 מתוך Llama 3.1, ואימון על נתוני-אימון איכותיים-במיוחד, כולל נתונים סינתטיים — הגישה שבה נקטה Microsoft ב-Phi-3.

האם המודל הקטן מחליף את הענן לגמרי?

לא. הדפוס הרווח הוא היברידי: המודל הקטן מטפל במשימות קצרות ושכיחות ישירות על המכשיר, ורק כשנדרשת יכולת-הנמקה עמוקה יותר הבקשה עוברת למודל ענן גדול.