מה זה VLM, ולמה זה לא סתם "רב-מודלי"
מודל ראייה-שפה (Vision-Language Model, VLM) הוא מודל AI שיודע לפרש יחד תמונות וטקסט — לקבל תמונה ולתאר במילים מה מוצג בה, לענות על שאלה לגבי תוכן חזותי, או לדרג עד כמה תיאור-טקסט מתאים לתמונה נתונה. זהו מקרה פרטי וספציפי של המושג הרחב יותר "רב-מודלי" (Multimodal) מהערך הנפרד באתר: רב-מודלי מתאר כל מודל שמעבד יותר מסוג-תוכן אחד — טקסט, תמונה, קול, וידאו, בכל צירוף אפשרי, כולל שילוב של כולם יחד כמו ב-GPT-4o — ואילו VLM הוא ספציפית הצירוף של תמונה וטקסט. הצירוף הזה היה הראשון שהבשיל לכדי מרכיב-בנייה עצמאי עם שם משלו, ולכן יש לו ערך נפרד: כל VLM הוא רב-מודלי, אך לא כל מודל רב-מודלי הוא VLM — עוזר קולי שמשלב טקסט וקול, למשל, הוא רב-מודלי בלי להיות VLM, ומודל רב-מודלי-לגמרי שמעבד גם וידאו חי הוא רחב יותר מ-VLM טהור.
מ-CLIP (2021) עד היום: קו-זמן קצר
לפני 2018 מודלים שקישרו בין תמונה לטקסט נשענו על תיאורי-מאפיינים ידניים ותבניות-משפט קבועות, בעיקר למשימת תיאור-תמונה (Image Captioning); המעבר לארכיטקטורת הטרנספורמר, סביב 2018, פתח את הדרך למודלים גמישים יותר שלומדים ייצוג משותף ולא רק מתאימים תבנית לתמונה. נקודת-המפנה הייתה CLIP, שפרסמה OpenAI ב-2021: מודל-יסוד (Foundation Model) שאומן בגישה ניגודית (Contrastive) על 400 מיליון זוגות תמונה-טקסט, והוכיח יכולת-העברה ללא-דוגמאות (Zero-Shot) חזקה למגוון רחב של משימות ראייה בלי אימון ייעודי לכל אחת מהן — כלומר, מודל שיכול לסווג תמונות לקטגוריות שמעולם לא ראה בשמן המפורש, רק על סמך תיאור מילולי שלהן. בעקבותיו הגיעו Flamingo של Google DeepMind ו-LLaVA הפתוח, שניהם ב-2022–2023, ואז GPT-4V — הגרסה עם ראייה של GPT-4, ששחררה OpenAI ב-25 בספטמבר 2023 והביאה VLM לשימוש מסחרי בקנה-מידה גדול לראשונה.
איך זה בנוי מבפנים
רוב מודלי-הראייה-שפה מורכבים משלושה חלקים: מקודד-ראייה (Vision Encoder) שהופך פיקסלים לייצוג-מספרי, לרוב מבוסס על CLIP עצמו או על מקודד דומה לו; גוף מודל-שפה שמעבד ומייצר טקסט; ושכבת-גישור שמיישרת בין שני הייצוגים לתוך אותו מרחב-משמעות משותף — לעיתים באמצעות קשב-צולב (Cross-Attention), אותה שיטה שהערך על רב-מודלי מתאר כפתרון-מיזוג נפוץ, ולעיתים בפשטות רבה יותר, על-ידי "הזרקת" ייצוג-התמונה כאילו היה עוד רצף-טוקנים לתוך אותה שכבת-קשב שהמודל כבר משתמש בה לטקסט. ההבדל המעשי מהמושג הרחב הוא שב-VLM שני הערוצים הם תמיד תמונה וטקסט בלבד — לא קול, לא וידאו — מה שמאפשר להתמחות בפתרון-מיזוג אחד ספציפי במקום בפתרון כללי לכל שילוב אפשרי.
לא כל VLM יוצר טקסט
נקודה שמבדילה VLM מהגדרת ה"רב-מודלי" באתר עוד יותר: ההגדרה של רב-מודלי מדברת על מודל שמקבל ו/או מייצר יותר מסוג-תוכן אחד — כלומר, לרוב, מודל יוצר-תוכן שמנהל שיחה. אבל חלק ניכר ממודלי-הראייה-שפה, ובראשם CLIP עצמו, אינם מודלים יוצרי-טקסט כלל: הם מודלי-דירוג, שמחזירים ציון-התאמה בין תמונה לטקסט נתון בלבד, ומשמשים לחיפוש-תמונות, סיווג ללא-דוגמאות וסינון-תוכן — לא לשיחה עם משתמש. התווית "VLM" חלה גם על מודלים כאלה וגם על מודלים יוצרי-טקסט כמו LLaVA ו-GPT-4V, כל עוד שני הערוצים הם תמונה וטקסט; הערך "רב-מודלי" באתר אכן מונה את CLIP עצמו בין המודלים הרב-מודליים המוקדמים, אבל רוב הדוגמאות שם — GPT-4o, Gemini — הן מודלים יוצרי-תוכן; אצל VLM, לעומת זאת, מודלי-הדירוג הם חלק מרכזי ומובהק מהקטגוריה מראשיתה.
מה עדיין קשה ל-VLM
לפי כרטיס-המערכת הרשמי של GPT-4V, שפרסמה OpenAI עם השחרור ב-25 בספטמבר 2023, גם במודל מסחרי מוביל נותרו פערים ברורים: המודל אינו מחזיר תיבות-תיחום (Bounding Boxes) מדויקות למיקום אובייקטים בתמונה, ועלול להיות לא-אמין ולא-מדויק בפרשנות חזותית באופן כללי. OpenAI גם בחרה במפורש לגרום למודל לסרב לזהות אנשים בתמונה — לא מגבלה טכנית אלא החלטת-מדיניות מכוונת, שתועדה באותו כרטיס-מערכת יחד עם המגבלות הטכניות, לפני ההשקה הרחבה למשתמשים.
מעבר לתיאור: הרכיב שמניע רובוטים
התפקיד של VLM לא מסתכם בתיאור תמונות. הערך על מודלי ראייה-שפה-פעולה (VLA) באתר מתאר כיצד רובוטיקה בונה במפורש מעל מודל-ראייה-שפה מאומן-מראש — כך, למשל, מודל π0 של Physical Intelligence "בנוי מעל מודל ראייה-שפה מאומן-מראש כדי לרשת ממנו ידע סמנטי בקנה-מידה אינטרנטי" לפני שהוא מתורגם לפקודות-תנועה, ומאמר RT-2 המקורי הראה שהעברת-הידע הזו משפרת ביצועים בתרחישים שהרובוט מעולם לא ראה. במילים אחרות, VLM הוא המרכיב ש"רואה ומבין", ו-VLA מוסיף לו את שכבת ה"פועל בעולם" — שני מושגים נפרדים, עם שני ערכים נפרדים באתר, לא אותו דבר בשם אחר.