Mixtral — מודל-שפה עם 46.7 מיליארד פרמטרים, רק 12.9 פעילים

מודלים ושפה

הגדרה

Mixtral 8x7B הוא מודל-שפה בעל-משקלים-פתוחים של Mistral AI מדצמבר 2023, שהיה הדוגמה המסחרית הבולטת הראשונה לארכיטקטורת תמהיל-מומחים בקנה-מידה גדול, תחת רישיון פתוח לחלוטין.

מה זה Mixtral, ומי יצר אותו

Mistral AI היא חברת-AI צרפתית שנוסדה באפריל 2023 בפריז, בידי שלושה חוקרים-לשעבר של Meta ו-Google DeepMind. אחרי שהשיקה בספטמבר 2023 את המודל הצפוף הראשון שלה, Mistral 7B, פרסמה החברה ב-8 בדצמבר 2023 את משקלי Mixtral 8x7B — בסגנון-ההשקה השקט האופייני לה, קישור-טורנט בלי כל הודעה רשמית מקדימה — ורק שלושה ימים אחר-כך, ב-11 בדצמבר, פרסמה פוסט-בלוג רשמי עם מפרט מלא ותוצאות-מבחנים.

איך עובד תמהיל-מומחים בפועל: 46.7 מיליארד פרמטרים, רק 12.9 פעילים

Mixtral בנוי באותה ארכיטקטורה בסיסית כמו Mistral 7B, אבל בכל שכבה יש 8 "מומחים" (Experts) — תת-רשתות נפרדות — ורשת-ניתוב (Router) שבוחרת לכל טוקן בנפרד רק 2 מתוך 8 המומחים לעיבוד. כתוצאה מכך יש למודל 46.7 מיליארד פרמטרים בסך-הכול, אך רק כ-12.9 מיליארד מהם "פעילים" בפועל בכל מעבר-חישוב בודד — כלומר עלות-החישוב בפועל קרובה בהרבה למודל-צפוף בגודל 13 מיליארד מאשר למודל צפוף בגודל 47 מיליארד, בעוד היכולת נשענת על מאגר-הידע הגדול הרבה יותר.

ביצועים: תואם או עולה על GPT-3.5 ו-Llama 2 70B

לפי הדוח הרשמי של Mistral AI, המודל הבסיסי תואם או עולה על Llama 2 70B וגם על GPT-3.5 ברוב המבחנים הסטנדרטיים, עם מהירות-הסקה מהירה פי-6 בערך הודות למספר הפרמטרים הפעילים הנמוך יחסית. הגרסה המכווננת-להוראות, Mixtral 8x7B Instruct, קיבלה ציון 8.30 במבחן MT-Bench — לפי Mistral, ביצועים שהשתוו לאלה של GPT-3.5 Turbo, ועלו על Claude 2.1, Gemini Pro ו-Llama 2 70B בגרסת-הצ'אט שלו, במבחני-הערכה אנושיים.

רישיון Apache 2.0 מלא וחלון-הקשר

בניגוד לרישיון המוגבל-בתנאים של Llama, Mixtral 8x7B שוחרר תחת רישיון Apache 2.0 המלא — ללא כל הגבלת-שימוש מסחרי או סף-משתמשים — הן בגרסת הבסיס והן בגרסה המכווננת-להוראות. המודל תומך בחלון-הקשר של 32,000 טוקנים ומראה יכולת רב-לשונית טובה באנגלית, צרפתית, איטלקית, גרמנית וספרדית, לצד יכולת חזקה יחסית ביצירת קוד-תוכנה.

Mixtral 8x22B: הגרסה הגדולה יותר

ב-17 באפריל 2024 הוסיפה Mistral AI את Mixtral 8x22B — גרסה גדולה משמעותית, עם 8 מומחים בני 22 מיליארד פרמטרים כל אחד (141 מיליארד פרמטרים בסך-הכול, מתוכם כ-39 מיליארד פעילים בכל טוקן), חלון-הקשר של 64,000 טוקנים, ותמיכה בקריאה-לפונקציות (Function Calling). גם הגרסה הזו שוחררה תחת אותו רישיון Apache 2.0 פתוח לחלוטין.

ההשפעה על שאר התעשייה

Mixtral נחשב באופן נרחב לדוגמה הראשונה שהוכיחה, בקנה-מידה מסחרי ובגישה פתוחה-לחלוטין, שארכיטקטורת תמהיל-מומחים יכולה להתחרות במודלים צפופים גדולים בהרבה תוך חיסכון ניכר בעלות-ההסקה. הגישה הזו אומצה מאוחר יותר גם על ידי Meta, שהציגה ב-2025 את דור Llama 4 כדגמי תמהיל-מומחים ראשונים שלה — מגמה שהחלה, למעשה, אצל Mistral.

שאלות נפוצות ❓

מה זה בעצם ה"8x7B" בשם Mixtral?

זה לא 8 מודלים נפרדים של 7 מיליארד פרמטרים שרצים יחד — זה תיאור פשטני-משהו לארכיטקטורת תמהיל-מומחים, שבה חלקים מסוימים (כמו תשומת-הלב) משותפים בין ה-8 "מומחים", ולכן הגודל הכולל האמיתי הוא 46.7 מיליארד פרמטרים, לא 56.

למה תמהיל-מומחים חסכוני יותר מלהריץ מודל-צפוף באותו גודל?

כי לכל טוקן מופעלים בפועל רק כ-12.9 מיליארד פרמטרים מתוך ה-46.7 מיליארד — הרשת בוחרת רק 2 מתוך 8 המומחים בכל שכבה, כך שעלות-החישוב קרובה למודל-צפוף בגודל 13 מיליארד ולא ל-47 מיליארד.

מה ההבדל ברישיון בין Mixtral ל-Llama?

Mixtral שוחרר תחת Apache 2.0 המלא, בלי שום הגבלת-שימוש; רישיון Llama כולל הגבלה על ארגונים עם יותר מ-700 מיליון משתמשים פעילים, שלפי ה-Open Source Initiative אינה עומדת בהגדרת קוד-פתוח.

האם ל-Mixtral יש המשך?

כן — ב-17 באפריל 2024 שחררה Mistral AI גם את Mixtral 8x22B, גרסה גדולה יותר (141 מיליארד פרמטרים כוללים, כ-39 מיליארד פעילים) תחת אותו רישיון פתוח.