BERT — מודל-הבנה של גוגל, שולב במנוע-החיפוש שלה ב-2019

מודלים ושפה

הגדרה

BERT הוא מודל שפה של גוגל מ-2018, המבוסס על קידוד (Encoder) בלבד מתוך ארכיטקטורת הטרנספורמר, והיה הראשון שקרא טקסט משני הכיוונים בו-זמנית — פריצת-דרך ששינתה את תחום עיבוד השפה הטבעית.

מה זה BERT, ומי יצר אותו

BERT (ראשי-תיבות של Bidirectional Encoder Representations from Transformers) הוא מודל שפה שפיתחו חוקרי גוגל — ג'ייקוב דבלין, מינג-וויי צ'אנג, קנטון לי וכריסטינה טוטנובה — ופרסמו במאמר-arXiv באוקטובר 2018, עם שחרור-קוד פתוח בנובמבר אותה שנה. המודל התבסס על ארכיטקטורת הטרנספורמר שהוצגה שנה קודם לכן, אך השתמש רק בחלק ה"קודן" (Encoder) שלה — החלק שתפקידו "להבין" טקסט קיים, לא לייצר טקסט חדש מאפס. הבחירה הזו הפכה את BERT למודל מצוין במשימות-הבנה (סיווג, מענה-על-שאלות, זיהוי-ישויות) אך לא מתאים ליצירת טקסט ארוך וחופשי — בניגוד למשפחת GPT המקבילה של OpenAI, שהתבססה על חצי המפענח (Decoder) של אותה ארכיטקטורה בדיוק, ונבנתה מלכתחילה סביב יצירת-טקסט.

החידוש המרכזי: קריאה דו-כיוונית באמצעות "מיסוך מילים"

עד BERT, רוב מודלי-השפה קראו טקסט בכיוון אחד בלבד — משמאל-לימין או להפך — ולכן כל מילה הובנה רק מתוך המילים שקדמו לה (או שבאו אחריה), לא משתיהן יחד. BERT פתר את זה בעזרת משימת-אימון שנקראת "מודל-שפה-ממוסך" (Masked Language Model): כ-15% מהמילים בכל משפט-אימון מוסתרות באקראי, והמודל מתבקש לנחש אותן מתוך כל שאר המשפט — גם המילים שלפניהן וגם אלה שאחריהן. משימת-אימון משלימה שנייה, "חיזוי-המשפט-הבא" (Next Sentence Prediction), אימנה את המודל להבין את הקשר בין שני משפטים סמוכים. שילוב שתי המשימות, על מאגר-טקסט של ספרים וערכי-ויקיפדיה באנגלית, יצר ייצוג-שפה עמוק בהרבה ממה שהיה אפשרי קודם.

שני גדלים, ותוצאות-שיא על 11 מבחני-הבנה

גוגל פרסמה שתי גרסאות: BERT-Base (110 מיליון פרמטרים, 12 שכבות-קידוד) ו-BERT-Large (340 מיליון פרמטרים, 24 שכבות). בפרסום המקורי השיגו שני המודלים תוצאות-שיא על 11 מבחני-הבנת-שפה שונים בבת-אחת — כולל שיפור של 7.7 נקודות באחוזים במבחן GLUE הכולל, ותוצאה של 93.2 (מדד F1) במבחן השאלות-והתשובות SQuAD v1.1, שעברה לראשונה את רמת-הביצוע האנושית באותו מבחן. ההישג הזה, ובעיקר יכולתו של BERT להתאים את עצמו (Fine-tuning) למשימה חדשה עם שכבה קטנה נוספת בלבד ומעט דוגמאות-אימון, הפך אותו כמעט מיד לכלי-עבודה סטנדרטי במעבדות NLP ברחבי העולם.

מ-arXiv לחיפוש: BERT בתוך גוגל סרץ׳

כשנה אחרי הפרסום, באוקטובר 2019, הודיעה גוגל שהיא משלבת גרסה של BERT ישירות בתוך מנוע-החיפוש שלה, כדי להבין טוב יותר שאילתות-חיפוש ארוכות ושיחתיות — בעיקר כאלה שבהן מילות-יחס קטנות ("ל-", "בשביל", "בלי") משנות את המשמעות כולה. גוגל תיארה זאת כעדכון המשמעותי ביותר למנוע-החיפוש שלה מזה חמש שנים, שמשפר את ההבנה של כ-1 מכל 10 שאילתות באנגלית בארצות-הברית.

המשפחה שנולדה מ-BERT: RoBERTa, ALBERT ו-DistilBERT

הצלחת BERT הולידה גל שלם של גרסאות-המשך שניסו לשפר היבט אחד או אחר שלו: RoBERTa (מבית Facebook/Meta) הראתה שאימון על יותר נתונים ולזמן ארוך יותר, בלי שינוי ארכיטקטוני, משפר תוצאות משמעותית; ALBERT (גוגל) שיתפה פרמטרים בין שכבות כדי לצמצם דרמטית את גודל המודל בלי לפגוע ביכולת; DistilBERT (Hugging Face) "זיקק" את הידע של BERT למודל קטן וקל בהרבה, לשימוש במכשירים עם משאבים מוגבלים. במשך כשנתיים-שלוש, גרסה כלשהי של BERT הייתה נקודת-ההתחלה הסטנדרטית כמעט לכל פרויקט NLP מבוסס-Fine-tuning.

מעמדו של BERT היום, לצד עידן המודלים היוצרים

מאז 2020, עם עלייתם של מודלי-שפה יוצרי-טקסט ענקיים כמו GPT-3 ו-ChatGPT, מרכז-הכובד של התחום עבר ממודלים "מבינים" כמו BERT למודלים "יוצרים". עם זאת BERT וצאצאיו לא נעלמו: הם ממשיכים לשמש כרכיב-הבנה יעיל וזול-יחסית להפעלה בתוך מערכות רבות — למשל ליצירת הטמעות-וקטוריות (Embeddings) לחיפוש סמנטי, לסינון-תוכן, או לסיווג-טקסט מהיר — משימות שבהן אין צורך ביצירת-טקסט חופשית, אלא בהבנה מדויקת ומהירה של טקסט קיים.

שאלות נפוצות ❓

מה ההבדל בין BERT למשפחת GPT?

BERT משתמש רק בחצי הקודן (Encoder) של ארכיטקטורת הטרנספורמר ומתמחה בהבנת טקסט קיים, ואילו GPT משתמש בחצי המפענח (Decoder) ומתמחה ביצירת טקסט חדש — שני ענפים שונים שנבעו מאותה ארכיטקטורה.

האם BERT יכול לכתוב טקסט כמו ChatGPT?

לא בצורה טבעית — BERT נבנה כדי להבין ולסווג טקסט קיים, לא לייצר רצף-מילים חדש מאפס, ולכן אינו מתאים למשימות כתיבה חופשית.

מה זה "מודל-שפה-ממוסך" שעליו BERT מתאמן?

שיטת-אימון שבה מסתירים כ-15% מהמילים במשפט והמודל מנחש אותן מתוך המילים שלפניהן ואחריהן גם-יחד — זה מה שמאפשר לו "להבין" הקשר דו-כיווני, לא רק חד-כיווני.

האם BERT עדיין רלוונטי היום?

כן, גם אם פחות בכותרות: הוא וצאצאיו (כמו DistilBERT) עדיין משמשים ברכיבי-הבנה בתוך מערכות רבות, כמו חיפוש סמנטי וסיווג-טקסט, גם כשמודלים יוצרי-טקסט תופסים את תשומת-הלב הציבורית.