רב-מודלי (Multimodal)
הגדרה
רב-מודלי (Multimodal) מתאר מודל AI שיכול לקבל ולייצר יותר מסוג תוכן אחד בו-זמנית — למשל גם טקסט, גם תמונות, גם קול.
💡 דוגמה
מצלמים את המקרר ושואלים "מה אפשר לבשל מזה?". המודל מבין גם את התמונה וגם את השאלה, ועונה.
רב-מודלי (Multimodal) מתאר מודל AI שיכול לקבל ו/או לייצר יותר מסוג-תוכן אחד בו-זמנית — למשל גם טקסט, גם תמונות, וגם קול — לא רק צ'אט טקסטואלי בלבד. הרעיון של למידה רב-מודלית הוצע כבר ב-2011, בתחילת עידן הלמידה-העמוקה, אבל נותר שולי עד שנים רבות אחר-כך.
מודלים מוקדמים שחיברו טקסט ותמונה (כמו CLIP של OpenAI, מ-2021) עדיין הפרידו בין הבנת-תמונה להבנת-טקסט; מודלים רב-מודליים מלאים ממזגים את שני הערוצים לתוך אותה רשת אחת. מודל כזה יכול, למשל, לקבל תמונה ולתאר במילים מה מוצג בה, לענות על שאלות לגבי תוכן חזותי, או לשלב הבנת-קול עם הבנת-טקסט באותה שיחה.
מבחינה טכנית, האתגר המרכזי הוא ליישר (Align) ייצוגים ממקורות שונים לגמרי — פיקסלים של תמונה וגלי-קול של דיבור נראים ונשמעים אחרת לגמרי ממילים כתובות — לתוך אותו "מרחב-משמעות" משותף שהמודל יכול לעבד יחד. שיטות כמו קשב-צולב (Cross-Attention), שמאפשרות לחלק אחד של הרשת "להביט" במידע שמגיע מערוץ-קלט אחר, הן אחד הפתרונות הנפוצים למיזוג הזה.
מודלים רב-מודליים "גדולים" הפכו לנפוצים במיוחד רק החל מ-2023 — לפני כן, מודל-דגל שמטפל בטקסט, תמונה וקול יחד באותה רשת נחשב יוצא-דופן. דוגמה בולטת: GPT-4o של OpenAI (מ-2024, כש"o" מסמל Omni) יודע לעבד וליצור טקסט, אודיו ותמונות באותה שיחה חיה אחת, בלי להעביר את המשימה בין מודלים נפרדים.
מודלי הדגל המובילים כיום (Claude, ChatGPT, Gemini) הם כולם רב-מודליים במידה כלשהי — יכולת שהייתה נדירה ומוגבלת עד לפני שנים ספורות, כשכל מודל התמחה בסוג-תוכן אחד בלבד. נכון ל-2026, יכולת רב-מודלית — כולל הבנת וידאו חי, לא רק תמונות סטטיות — הפכה לציפיית-בסיס במודלי-הדגל, לא תוספת מיוחדת, ומודלים חדשים נמדדים גם על יכולתם "לראות" ולתאר סרטון שלם ולא רק תמונה בודדת.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות