תמהיל מומחים (Mixture of Experts)
הגדרה
תמהיל מומחים הוא ארכיטקטורת-מודל שבה רק חלק קטן מרשת ענקית "מופעל" לכל קלט נתון — מאפשרת מודלים גדולים מאוד בלי לשלם את מלוא עלות-החישוב על כל טוקן.
במקום רשת אחת ענקית שכל חלק בה פעיל תמיד, תמהיל מומחים (MoE — Mixture of Experts) מחלק את הרשת לתת-רשתות מומחות רבות, ו"נתב" קטן בוחר, לכל טוקן, רק כמה מומחים רלוונטיים להפעיל — השאר נשארים כבויים לאותו טוקן.
הרעיון הוצג כבר ב-2017, אך רק בשנים האחרונות הפך פרקטי בקנה-מידה של מודלי-שפה-ענקיים. חברות כמו Mistral AI ו-DeepSeek פרסמו מודלים בולטים בעלי-משקלים-פתוחים המבוססים על ארכיטקטורת MoE.
דוגמאות מוחשיות ממחישות את קנה-המידה: Mixtral 8x7B של Mistral AI (סוף 2023) מכיל כ-46.7 מיליארד פרמטרים בסך-הכול, מפוזרים בין 8 מומחים, אך מפעיל רק חלק קטן מהם בכל טוקן. DeepSeek-V3 (סוף 2024) הלך רחוק יותר: 671 מיליארד פרמטרים בסך-הכול, אך רק כ-37 מיליארד מהם פעילים בכל טוקן נתון — פחות מ-6% מהמודל כולו. גם Llama 4 של Meta (אפריל 2025) אימץ את הגישה: גרסת Maverick שלו מכילה 400 מיליארד פרמטרים בסך-הכול, אך רק 17 מיליארד פעילים בכל טוקן — עדות לכך שהארכיטקטורה הפכה מנישתית לסטנדרט-תעשייה נפוץ בתוך כמה שנים בודדות.
כך אפשר לבנות מודל עם מאות מיליארדי פרמטרים "על הנייר", אך לשלם בפועל בחישוב רק על החלק הקטן שבאמת פעיל בכל רגע — יעילות שהופכת מודלים ענקיים למעשיים לאימון ולהרצה, ומסבירה מדוע נכון ל-2026 חלק ניכר ממודלי-הדגל המובילים משתמשים בגרסה כלשהי של הארכיטקטורה הזו.
חשוב להבחין: למרות שרק חלק מהמומחים "פעיל" חישובית בכל טוקן, כל המומחים עדיין צריכים להיות שמורים בזיכרון בו-זמנית — כך שמודל MoE חוסך בעיקר בזמן-חישוב, ולא בהכרח בדרישות-הזיכרון הכוללות. זו נקודה שמפתיעה לעיתים מי שמניח ש"רק חלק מהמודל פעיל" אומר גם "רק חלק מהמודל תופס מקום" — בפועל, מודל MoE גדול עדיין דורש חומרה עם זיכרון נדיב, גם אם עלות-החישוב בפועל נמוכה יותר.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות