PaLM — מודל-שפה של גוגל שאומן על 6,144 שבבי TPU בו-זמנית

מודלים ושפה

הגדרה

PaLM הוא מודל-שפה צפוף בעל 540 מיליארד פרמטרים שגוגל הציגה ב-2022, ששימש בסיס לצ'אטבוט Bard לפני עידן Gemini וכולל גם ענף רפואי ייעודי בשם Med-PaLM.

מה זה PaLM, ומתי גוגל הציגה אותו

PaLM (ראשי-תיבות של Pathways Language Model) הוא מודל-שפה צפוף (Dense) — כלומר כל הפרמטרים שלו פעילים בכל טוקן, בניגוד לארכיטקטורת תמהיל-מומחים — בעל 540 מיליארד פרמטרים, שגוגל תיארה במאמר-arXiv שהתפרסם באפריל 2022. האימון בוצע באמצעות מערכת חדשה בשם Pathways על-פני 6,144 שבבי TPU v4 בו-זמנית — תצורת-האימון הגדולה ביותר שגוגל השתמשה בה עד אז — על מאגר-טקסט של כ-780 מיליארד טוקנים.

תוצאות-שיא ו"קפיצות" ביכולת עם הגדלת קנה-המידה

לפי המאמר, PaLM עלה על מודלים מובילים אחרים באותה תקופה — כולל GPT-3, Chinchilla, Gopher, LaMDA ו-Megatron-Turing NLG — ב-28 מתוך 29 משימות-הערכה, ואף עבר את הביצוע האנושי הממוצע במבחן BIG-bench. חוקרי גוגל הדגישו תופעה שכינו "שיפור בלתי-רציף": במשימות-הנמקה מסוימות, היכולת לא עלתה בהדרגה עם גודל-המודל אלא קפצה בחדות רק בקנה-המידה הגדול ביותר — תופעה שנקשרה מאוחר יותר ליכולת "שרשרת-מחשבה" (Chain-of-Thought), פתרון בעיות בשלבים.

הענף הרפואי: פריצת-הדרך של Flan-PaLM ועידון-הבטיחות של Med-PaLM

בדצמבר 2022 פרסמו חוקרי גוגל את המאמר "Large Language Models Encode Clinical Knowledge", שהציג את MultiMedQA — מסגרת-הערכה חדשה המשלבת שישה מבחני-שאלות-ותשובות רפואיים קיימים — ואת Flan-PaLM, הגרסה המכווננת-להוראות (Instruction-Tuned) של PaLM. Flan-PaLM השיג 67.6% דיוק במבחן MedQA (שאלות בסגנון מבחן-הרישוי הרפואי האמריקאי, USMLE), החוצה בכך את סף ה-60% המקובל כאומדן לציון-מעבר — שיא חדש לתקופתו. אלא שהערכה אנושית של תשובותיו החופשיות של Flan-PaLM חשפה פערי-בטיחות: רק 61.9% מהן נמצאו תואמות את הקונצנזוס המדעי, ו-29.7% דורגו כעלולות להוביל לנזק. כדי לסגור את הפער הזה פיתחו החוקרים את Med-PaLM — גרסה נוספת המבוססת על Flan-PaLM, מכווננת בשיטה חדשה שכינו "כוונון-הנחיה" (Instruction Prompt Tuning). התוצאה: 92.6% מתשובות Med-PaLM נמצאו תואמות את הקונצנזוס המדעי (קרוב לרמת-הרופאים, 92.9%), ורק 5.9% דורגו כעלולות להוביל לנזק (לעומת 5.7% אצל רופאים). המאמר פורסם מאוחר יותר בכתב-העת Nature ביולי 2023.

Med-PaLM 2: מדיוק-חלקי לרמת-מומחה

גרסת-ההמשך, Med-PaLM 2, מבוססת על PaLM 2 ותוארה במאמר "Towards Expert-Level Medical Question Answering with Large Language Models" ממאי 2023. היא שיפרה את הדיוק במבחן MedQA ל-86.5% — לפי המאמר, ההישג הראשון של מודל-שפה שהגיע לרמת-ביצוע המושווית למומחים אנושיים על אותו מבחן בדיוק, הודות בין השאר לשיטות-כוונון-נוספות כמו "זיקוק-קונצנזוס" בין כמה תשובות של המודל.

PaLM 2 והדרך אל Bard

Bard, הצ'אטבוט שעליו הכריזה גוגל ב-6 בפברואר 2023, הופעל בתחילה על גרסה קלה של LaMDA. ב-31 במרץ 2023 שדרגה גוגל את Bard למודל PaLM, ובכנס I/O ב-10 במאי 2023 הציגה את PaLM 2 — הדור הבא, שתמך ביותר מ-100 שפות ותוכנן להפעיל למעלה מ-25 מוצרים שונים של גוגל, כולל Bard במלואו מאותו רגע.

הדרך אל Gemini: סיום עידן PaLM

בדצמבר 2023 הציגה גוגל את משפחת Gemini, ובפברואר 2024 שינתה את שם המוצר עצמו מ-Bard ל-Gemini. מאז, סדרת Gemini היא מודל-הדגל של גוגל, ו-PaLM ו-PaLM 2 הפכו לדור-הביניים ההיסטורי בין LaMDA לבין העידן הרב-מודלי הנוכחי — לא נטושים לגמרי (Med-PaLM 2, למשל, המשיך לשמש במחקר רפואי), אך אינם עוד בחזית הפיתוח הפעיל של גוגל.

שאלות נפוצות ❓

מה ההבדל בין PaLM ל-LaMDA?

LaMDA תוכנן ייעודית לשיחה פתוחה. PaLM הוא מודל-יסוד כללי בהרבה, בקנה-מידה גדול משמעותית (540 מיליארד פרמטרים), ששימש בפועל את Bard רק אחרי LaMDA — שני דורות עוקבים באותה שרשרת פיתוח של גוגל.

מה זה Med-PaLM, ולמה ההישג שלו נחשב פריצת-דרך?

Med-PaLM היא גרסה רפואית של PaLM, המבוססת על Flan-PaLM — הגרסה שהייתה הראשונה שדווח שהגיעה לציון-מעבר (67.6%, מעל סף ה-60%) במבחן MedQA בסגנון מבחן-הרישוי הרפואי האמריקאי (USMLE). ההישג הייחודי של Med-PaLM עצמו הוא לא הדיוק אלא הבטיחות: 92.6% מתשובותיו נמצאו תואמות את הקונצנזוס המדעי (לעומת 61.9% ב-Flan-PaLM), ורק 5.9% דורגו כעלולות להזיק (לעומת 29.7%).

האם PaLM עדיין בשימוש היום?

לא כמודל-הדגל — הוחלף על ידי משפחת Gemini עד תחילת 2024. גרסאות ובני-משפחה שלו (כמו Med-PaLM 2) המשיכו לשמש במחקר גם אחרי המעבר.

מה ההבדל בין ארכיטקטורה "צפופה" כמו PaLM לתמהיל-מומחים כמו Mixtral?

ב-PaLM כל 540 מיליארד הפרמטרים פעילים בכל טוקן שמעובד. במודל תמהיל-מומחים, לעומת זאת, רק חלק קטן מהפרמטרים הכוללים מופעל בכל טוקן — כך שהוא יכול להיות גדול יותר בלי לשלם את מלוא עלות-החישוב על כל מילה.