רב-מודלי (Multimodal)

מודלים ושפה

רב-מודלי (Multimodal) מתאר מודל AI שיכול לקבל ו/או לייצר יותר מסוג-תוכן אחד בו-זמנית — למשל גם טקסט, גם תמונות, וגם קול — לא רק צ'אט טקסטואלי בלבד.

מודל רב-מודלי יכול, למשל, לקבל תמונה ולתאר במילים מה מוצג בה, לענות על שאלות לגבי תוכן חזותי, או לשלב הבנת-קול עם הבנת-טקסט באותה שיחה — יכולות שדורשות מיזוג של ראייה ממוחשבת ועיבוד שפה טבעית לתוך אותה ארכיטקטורה.

מודלי הדגל המובילים כיום (Claude, GPT, Gemini) הם כולם רב-מודליים במידה כלשהי — יכולת שהייתה נדירה ומוגבלת עד לפני שנים ספורות, כשכל מודל התמחה בסוג-תוכן אחד בלבד.