מה זה PaLM, ומתי גוגל הציגה אותו
PaLM (ראשי-תיבות של Pathways Language Model) הוא מודל-שפה צפוף (Dense) — כלומר כל הפרמטרים שלו פעילים בכל טוקן, בניגוד לארכיטקטורת תמהיל-מומחים — בעל 540 מיליארד פרמטרים, שגוגל תיארה במאמר-arXiv שהתפרסם באפריל 2022. האימון בוצע באמצעות מערכת חדשה בשם Pathways על-פני 6,144 שבבי TPU v4 בו-זמנית — תצורת-האימון הגדולה ביותר שגוגל השתמשה בה עד אז — על מאגר-טקסט של כ-780 מיליארד טוקנים.
תוצאות-שיא ו"קפיצות" ביכולת עם הגדלת קנה-המידה
לפי המאמר, PaLM עלה על מודלים מובילים אחרים באותה תקופה — כולל GPT-3, Chinchilla, Gopher, LaMDA ו-Megatron-Turing NLG — ב-28 מתוך 29 משימות-הערכה, ואף עבר את הביצוע האנושי הממוצע במבחן BIG-bench. חוקרי גוגל הדגישו תופעה שכינו "שיפור בלתי-רציף": במשימות-הנמקה מסוימות, היכולת לא עלתה בהדרגה עם גודל-המודל אלא קפצה בחדות רק בקנה-המידה הגדול ביותר — תופעה שנקשרה מאוחר יותר ליכולת "שרשרת-מחשבה" (Chain-of-Thought), פתרון בעיות בשלבים.
הענף הרפואי: פריצת-הדרך של Flan-PaLM ועידון-הבטיחות של Med-PaLM
בדצמבר 2022 פרסמו חוקרי גוגל את המאמר "Large Language Models Encode Clinical Knowledge", שהציג את MultiMedQA — מסגרת-הערכה חדשה המשלבת שישה מבחני-שאלות-ותשובות רפואיים קיימים — ואת Flan-PaLM, הגרסה המכווננת-להוראות (Instruction-Tuned) של PaLM. Flan-PaLM השיג 67.6% דיוק במבחן MedQA (שאלות בסגנון מבחן-הרישוי הרפואי האמריקאי, USMLE), החוצה בכך את סף ה-60% המקובל כאומדן לציון-מעבר — שיא חדש לתקופתו. אלא שהערכה אנושית של תשובותיו החופשיות של Flan-PaLM חשפה פערי-בטיחות: רק 61.9% מהן נמצאו תואמות את הקונצנזוס המדעי, ו-29.7% דורגו כעלולות להוביל לנזק. כדי לסגור את הפער הזה פיתחו החוקרים את Med-PaLM — גרסה נוספת המבוססת על Flan-PaLM, מכווננת בשיטה חדשה שכינו "כוונון-הנחיה" (Instruction Prompt Tuning). התוצאה: 92.6% מתשובות Med-PaLM נמצאו תואמות את הקונצנזוס המדעי (קרוב לרמת-הרופאים, 92.9%), ורק 5.9% דורגו כעלולות להוביל לנזק (לעומת 5.7% אצל רופאים). המאמר פורסם מאוחר יותר בכתב-העת Nature ביולי 2023.
Med-PaLM 2: מדיוק-חלקי לרמת-מומחה
גרסת-ההמשך, Med-PaLM 2, מבוססת על PaLM 2 ותוארה במאמר "Towards Expert-Level Medical Question Answering with Large Language Models" ממאי 2023. היא שיפרה את הדיוק במבחן MedQA ל-86.5% — לפי המאמר, ההישג הראשון של מודל-שפה שהגיע לרמת-ביצוע המושווית למומחים אנושיים על אותו מבחן בדיוק, הודות בין השאר לשיטות-כוונון-נוספות כמו "זיקוק-קונצנזוס" בין כמה תשובות של המודל.
PaLM 2 והדרך אל Bard
Bard, הצ'אטבוט שעליו הכריזה גוגל ב-6 בפברואר 2023, הופעל בתחילה על גרסה קלה של LaMDA. ב-31 במרץ 2023 שדרגה גוגל את Bard למודל PaLM, ובכנס I/O ב-10 במאי 2023 הציגה את PaLM 2 — הדור הבא, שתמך ביותר מ-100 שפות ותוכנן להפעיל למעלה מ-25 מוצרים שונים של גוגל, כולל Bard במלואו מאותו רגע.
הדרך אל Gemini: סיום עידן PaLM
בדצמבר 2023 הציגה גוגל את משפחת Gemini, ובפברואר 2024 שינתה את שם המוצר עצמו מ-Bard ל-Gemini. מאז, סדרת Gemini היא מודל-הדגל של גוגל, ו-PaLM ו-PaLM 2 הפכו לדור-הביניים ההיסטורי בין LaMDA לבין העידן הרב-מודלי הנוכחי — לא נטושים לגמרי (Med-PaLM 2, למשל, המשיך לשמש במחקר רפואי), אך אינם עוד בחזית הפיתוח הפעיל של גוגל.