מ'תמיד גדול יותר' ל'בדיוק בגודל הנכון'
עד 2023 מירוץ-הבינה-המלאכותית נמדד כמעט אך ורק בגודל: GPT-3 של OpenAI יצא ב-2020 עם 175 מיליארד פרמטרים, וכל דור חדש היה גדול מקודמו. מ-2023 ואילך נפתח מסלול מקביל: לא עוד מודל אחד ענק שרץ בענן, אלא משפחה שלמה של מודלים קטנים בהרבה — בטווח של כמיליארד עד כ-15 מיליארד פרמטרים — קטנים מספיק כדי לרוץ ישירות על הטלפון או המחשב הנייד של המשתמש, בלי לשלוח את הבקשה לשרת. מה שהופך את זה למגמה תעשייתית ולא לניסוי בודד של חברה אחת הוא התזמון: תוך פחות משמונה חודשים, Google, Microsoft, Apple, Meta ו-Mistral AI שחררו כל אחת משפחת-מודלים קטנים משלה, וכל אחת ניסחה עבורה נימוק דומה למדי — יכולת חזקה במשקל קל.
השחקנים: חמש חברות, חמש משפחות-מודלים
Microsoft פתחה את הסדרה עם Phi: הדוח הטכני של Microsoft Research, שפורסם ב-23 באפריל 2024, מתאר את Phi-3-mini כמודל בן 3.8 מיליארד פרמטרים 'קטן מספיק כדי לפעול על טלפון'. Google הכריזה על Gemma ב-21 בפברואר 2024 — משפחת מודלים במשקלים-פתוחים בגדלים 2B ו-7B, שלדברי גוגל 'מסוגלים לרוץ ישירות על מחשב נייד או שולחני' של מפתח. Meta הציגה ב-25 בספטמבר 2024 את Llama 3.2 בגרסאות 1B ו-3B, המיועדות לרוץ על 'מכשירי-קצה ומכשירים ניידים נבחרים'. Mistral AI, סטארט-אפ צרפתי, השיקה ב-16 באוקטובר 2024 את Ministral 3B ו-Ministral 8B, שלדברי החברה נועדו לענות על ביקוש-לקוחות ל'הסקה מקומית ופרטית-מטבעה'. ו-Apple, שהצטרפה כבר ב-10 ביוני 2024, בנתה מודל-יסוד-על-המכשיר בגודל של כ-3 מיליארד פרמטרים, הרץ על ה-Neural Engine של האייפון.
ארבע סיבות מתועדות: עלות, פרטיות, זמן-תגובה ועבודה-בלי-רשת
כל חברה מנמקת את המודל הקטן שלה במונחים דומים למדי. Mistral כתבה ש'לקוחות ושותפים מבקשים באופן גובר הסקה מקומית ופרטית-מטבעה' עבור יישומים כמו תרגום-על-המכשיר ו'עוזרים חכמים ללא-אינטרנט'. Meta תיארה את היתרון כ'יישומי-סוכן על-המכשיר עם פרטיות חזקה — כשהמידע לעולם לא יוצא מהמכשיר'. Apple פרסמה מספרים קונקרטיים: זמן-עד-לטוקן-הראשון של כ-0.6 מילישנייה לטוקן-קלט, וקצב-ייצור של כ-30 טוקנים בשנייה על iPhone 15 Pro — כלומר תגובה מיידית בלי השהיית-רשת. לצד זה, חברת-הייעוץ Gartner פרסמה ב-9 באפריל 2025 תחזית שלפיה עד 2027 ארגונים ישתמשו במודלים קטנים וממוקדי-משימה פי שלושה יותר ממודלי-שפה כלליים-גדולים, ולדברי סומיט אגרוואל, סגן-נשיא ואנליסט בגרטנר, 'מגוון המשימות בתהליכי-העבודה העסקיים והצורך בדיוק גבוה יותר מניעים את המעבר למודלים מותאמים'. חשוב להדגיש: זו תחזית של חברת-אנליסטים, לא מדידה של מה שכבר קרה.
איך דוחסים מודל בלי להפוך אותו לטיפש
שתי טכניקות עיקריות חוזרות בכל המשפחות. הראשונה היא גיזום-מבני (structured pruning) ו'זיקוק-ידע' (knowledge distillation): Meta מתארת איך בנתה את Llama 3.2 1B ו-3B מתוך Llama 3.1 8B — 'הסרה שיטתית של חלקים ברשת', ולאחר מכן שילוב 'לוגיטים ממודלי 8B ו-70B גדולים יותר כיעדים ברמת-הטוקן' בשלב האימון המקדים, כך שהמודל הקטן 'לומד' מהתפוקה של מודל גדול ממנו. הטכניקה השנייה היא איכות-הנתונים במקום כמותם: הדוח הטכני של Phi-3 קובע במפורש ש'החידוש טמון כולו במערך-האימון שלנו — גרסה מורחבת של זה ששימש ל-phi-2, המורכב מנתוני-רשת מסוננים-בקפדנות ומנתונים סינתטיים', ושהמודל אומן על 3.3 טריליון טוקנים בגישה הזו. זהו קשר ישיר למגמה נפרדת ומתועדת בפני עצמה — הסתמכות גוברת של מעבדות-AI על נתונים סינתטיים לאימון, ולא רק על טקסט אנושי.
לא תחליף לענן — שכבה נוספת
המודל הקטן אינו מבטל את השרת הגדול, אלא נוסף לו. הדפוס שמתגבש בתעשייה הוא היברידי: משימה קצרה ושכיחה — סיכום, סיווג, ניתוב שאלה — נענית מיידית על-המכשיר; רק כשמשימה דורשת יכולת-הנמקה עמוקה יותר, היא מועברת למודל ענן גדול. זה שונה מהמושג הכללי 'AI על-המכשיר', שמתאר טכניקה בודדת ואת ההיסטוריה שלה, ומהמושג 'עיבוד היברידי בין מכשיר לענן', שמתמקד בארכיטקטורה הטכנית שדוחפת Qualcomm — כאן מדובר בתופעה החוצה תחרות-שוק: חמש חברות מתחרות עכשיו לא רק על מי יבנה את המודל הגדול ביותר, אלא גם על מי יבנה את המודל הקטן הטוב ביותר לאותו מקטע-שוק.
מה עדיין לא ברור
שני סייגים חשובים. ראשית, השוואות-הביצועים שכל חברה מפרסמת הן בדרך-כלל הערכות-עצמיות: Apple, למשל, מדווחת שהמודל שלה 'עדיף או שווה' למודלים דומים בגודלם של Mistral, בלי בדיקה עצמאית חיצונית שפורסמה יחד עם ההכרזה. שנית, תחזית Gartner ל-2027 היא הערכת-אנליסטים ולא נתון-מדוד — היא עשויה להתממש, להתעכב או לא להתממש כלל, בדיוק כמו תחזיות-שוק אחרות בתחום. מה שכן ניתן לקבוע כעובדה מתועדת: בפרק-זמן של כשמונה חודשים בלבד, בין פברואר לאוקטובר 2024, חמש מהחברות המרכזיות בתעשייה שחררו כל אחת משפחת-מודלים קטנה משלה — וזו העדות המוצקה ביותר לכך שמדובר בתזוזה תעשייתית-רחבה, לא במהלך שיווקי של חברה בודדת.