מה זה BERT, ומי יצר אותו
BERT (ראשי-תיבות של Bidirectional Encoder Representations from Transformers) הוא מודל שפה שפיתחו חוקרי גוגל — ג'ייקוב דבלין, מינג-וויי צ'אנג, קנטון לי וכריסטינה טוטנובה — ופרסמו במאמר-arXiv באוקטובר 2018, עם שחרור-קוד פתוח בנובמבר אותה שנה. המודל התבסס על ארכיטקטורת הטרנספורמר שהוצגה שנה קודם לכן, אך השתמש רק בחלק ה"קודן" (Encoder) שלה — החלק שתפקידו "להבין" טקסט קיים, לא לייצר טקסט חדש מאפס. הבחירה הזו הפכה את BERT למודל מצוין במשימות-הבנה (סיווג, מענה-על-שאלות, זיהוי-ישויות) אך לא מתאים ליצירת טקסט ארוך וחופשי — בניגוד למשפחת GPT המקבילה של OpenAI, שהתבססה על חצי המפענח (Decoder) של אותה ארכיטקטורה בדיוק, ונבנתה מלכתחילה סביב יצירת-טקסט.
החידוש המרכזי: קריאה דו-כיוונית באמצעות "מיסוך מילים"
עד BERT, רוב מודלי-השפה קראו טקסט בכיוון אחד בלבד — משמאל-לימין או להפך — ולכן כל מילה הובנה רק מתוך המילים שקדמו לה (או שבאו אחריה), לא משתיהן יחד. BERT פתר את זה בעזרת משימת-אימון שנקראת "מודל-שפה-ממוסך" (Masked Language Model): כ-15% מהמילים בכל משפט-אימון מוסתרות באקראי, והמודל מתבקש לנחש אותן מתוך כל שאר המשפט — גם המילים שלפניהן וגם אלה שאחריהן. משימת-אימון משלימה שנייה, "חיזוי-המשפט-הבא" (Next Sentence Prediction), אימנה את המודל להבין את הקשר בין שני משפטים סמוכים. שילוב שתי המשימות, על מאגר-טקסט של ספרים וערכי-ויקיפדיה באנגלית, יצר ייצוג-שפה עמוק בהרבה ממה שהיה אפשרי קודם.
שני גדלים, ותוצאות-שיא על 11 מבחני-הבנה
גוגל פרסמה שתי גרסאות: BERT-Base (110 מיליון פרמטרים, 12 שכבות-קידוד) ו-BERT-Large (340 מיליון פרמטרים, 24 שכבות). בפרסום המקורי השיגו שני המודלים תוצאות-שיא על 11 מבחני-הבנת-שפה שונים בבת-אחת — כולל שיפור של 7.7 נקודות באחוזים במבחן GLUE הכולל, ותוצאה של 93.2 (מדד F1) במבחן השאלות-והתשובות SQuAD v1.1, שעברה לראשונה את רמת-הביצוע האנושית באותו מבחן. ההישג הזה, ובעיקר יכולתו של BERT להתאים את עצמו (Fine-tuning) למשימה חדשה עם שכבה קטנה נוספת בלבד ומעט דוגמאות-אימון, הפך אותו כמעט מיד לכלי-עבודה סטנדרטי במעבדות NLP ברחבי העולם.
מ-arXiv לחיפוש: BERT בתוך גוגל סרץ׳
כשנה אחרי הפרסום, באוקטובר 2019, הודיעה גוגל שהיא משלבת גרסה של BERT ישירות בתוך מנוע-החיפוש שלה, כדי להבין טוב יותר שאילתות-חיפוש ארוכות ושיחתיות — בעיקר כאלה שבהן מילות-יחס קטנות ("ל-", "בשביל", "בלי") משנות את המשמעות כולה. גוגל תיארה זאת כעדכון המשמעותי ביותר למנוע-החיפוש שלה מזה חמש שנים, שמשפר את ההבנה של כ-1 מכל 10 שאילתות באנגלית בארצות-הברית.
המשפחה שנולדה מ-BERT: RoBERTa, ALBERT ו-DistilBERT
הצלחת BERT הולידה גל שלם של גרסאות-המשך שניסו לשפר היבט אחד או אחר שלו: RoBERTa (מבית Facebook/Meta) הראתה שאימון על יותר נתונים ולזמן ארוך יותר, בלי שינוי ארכיטקטוני, משפר תוצאות משמעותית; ALBERT (גוגל) שיתפה פרמטרים בין שכבות כדי לצמצם דרמטית את גודל המודל בלי לפגוע ביכולת; DistilBERT (Hugging Face) "זיקק" את הידע של BERT למודל קטן וקל בהרבה, לשימוש במכשירים עם משאבים מוגבלים. במשך כשנתיים-שלוש, גרסה כלשהי של BERT הייתה נקודת-ההתחלה הסטנדרטית כמעט לכל פרויקט NLP מבוסס-Fine-tuning.
מעמדו של BERT היום, לצד עידן המודלים היוצרים
מאז 2020, עם עלייתם של מודלי-שפה יוצרי-טקסט ענקיים כמו GPT-3 ו-ChatGPT, מרכז-הכובד של התחום עבר ממודלים "מבינים" כמו BERT למודלים "יוצרים". עם זאת BERT וצאצאיו לא נעלמו: הם ממשיכים לשמש כרכיב-הבנה יעיל וזול-יחסית להפעלה בתוך מערכות רבות — למשל ליצירת הטמעות-וקטוריות (Embeddings) לחיפוש סמנטי, לסינון-תוכן, או לסיווג-טקסט מהיר — משימות שבהן אין צורך ביצירת-טקסט חופשית, אלא בהבנה מדויקת ומהירה של טקסט קיים.