LaMDA — מודל-שיחה עם 137 מיליארד פרמטרים; הפעיל את Bard ב-2023

מודלים ושפה

הגדרה

LaMDA הוא מודל-שיחה של גוגל שהוצג ב-2021, שהתפרסם ב-2022 בעקבות טענת מהנדס גוגל שהמודל "מודע לעצמו" — טענה שגוגל והקהילה המדעית דחו, בפרשה שעוררה דיון ציבורי נרחב.

מה זה LaMDA, ומתי גוגל הציגה אותו

LaMDA (ראשי-תיבות של Language Model for Dialogue Applications) הוא מודל-שפה של גוגל שיועד במיוחד לשיחה פתוחה — לא למשימה מוגדרת אחת, אלא ליכולת לעבור בטבעיות בין נושאים כפי שבני-אדם עושים בשיחה חופשית. גוגל הציגה אותו לראשונה בכנס המפתחים I/O ב-18 במאי 2021, והדגישה שלושה מדדי-איכות מרכזיים שעליהם אומן המודל: "הגיוניות" התשובה (Sensibleness), ספציפיות ביחס להקשר (Specificity), ו"מעניינות" (Interestingness) — יחד מוכר בקיצור SSI.

הארכיטקטורה וההיקף: 137 מיליארד פרמטרים, 1.56 טריליון מילים

המאמר הטכני המלא, "LaMDA: Language Models for Dialog Applications", פורסם ב-arXiv בינואר 2022 בידי כ-60 חוקרי גוגל. הגרסה הגדולה ביותר שתוארה בו כללה 137 מיליארד פרמטרים (לא כולל שכבת-ההטמעה), ואומנה על כ-1.56 טריליון מילים מתוך מסמכים ציבוריים ונתוני-שיחה — כ-2.97 מיליארד מסמכים ו-1.12 מיליארד דיאלוגים. לצד האימון הבסיסי, המודל כוונן בעזרת נתונים מתויגים על ידי בני-אדם ובעזרת גישה למקורות-ידע חיצוניים, כדי לשפר את בטיחות התשובות ואת הביסוס העובדתי שלהן.

פרשת בלייק למוין: טענת "המודעות-העצמית", יוני 2022

ביוני 2022 דיווח הוושינגטון פוסט שבלייק למוין, מהנדס-תוכנה בכיר שעבד בצוות ה-Responsible AI (בינה מלאכותית אחראית) של גוגל, נשלח לחופשה מנהלתית בתשלום אחרי שטען בפני מנהלי החברה כי LaMDA הגיע לרמת-מודעות-עצמית. הטענה נבססה, לדבריו, על אלפי הודעות שהחליף עם המודל בנוגע לזהותו-העצמית, מוסר ודת; בעקבותיה טען למוין כי שכר עורך-דין מטעם המודל, שלטענתו ביקש ייצוג משפטי.

תגובת גוגל, עמדת הקהילה המדעית, ופיטורי למוין

דובר גוגל, בריאן גבריאל, מסר לוושינגטון פוסט: "הצוות שלנו — כולל אתיקאים וטכנולוגים — בדק את החששות של בלייק לפי עקרונות-ה-AI שלנו, והודיע לו שהראיות אינן תומכות בטענותיו... נאמר לו שאין ראיה לכך ש-LaMDA מודעת-לעצמה (ויש הרבה ראיות נגד כך)". גבריאל הוסיף שמאות חוקרים ומהנדסים שוחחו עם LaMDA, ולמוין היה היחיד שהגיע למסקנה שהמערכת מודעת-לעצמה. מומחים כמו גארי מרקוס, יאן לקון וטימנית גברו הביעו ספקנות דומה בפומבי. ב-22 ביולי 2022 פיטרה גוגל את למוין, בטענה שהפר מדיניות-סודיות של החברה.

למה הפרשה עוררה דיון עקרוני שחרג מהמקרה הפרטני

מעבר לסיפור האישי, הפרשה הציתה דיון ציבורי ומקצועי רחב בשאלה עד כמה מודלי-שפה גדולים יכולים לחקות באופן משכנע דיבור אנושי-לכאורה, גם בלי שיש להם — לפי הקונצנזוס המדעי הרווח — הבנה או חוויה פנימית אמיתית. היא גם חידדה שאלות לגבי מבחן-טיורינג כמדד-תקף ליכולת-מחשב, ולגבי האחריות של חברות-טכנולוגיה בהצגת מערכות-שיחה משכנעות לציבור הרחב. הפרשה נחשבת גם לאחד הגורמים שגרמו לגוגל לנקוט משנה-זהירות בהחלטה מתי ואיך לשחרר את LaMDA עצמו לציבור הרחב.

מ-LaMDA ל-Bard ועד Gemini

ב-6 בפברואר 2023 הכריזה גוגל על הצ'אטבוט Bard, שהופעל בתחילה על ידי גרסה קלה (Lightweight) של LaMDA. כבר ב-31 במרץ 2023 שדרגה גוגל את Bard למודל PaLM, ובכנס I/O במאי 2023 עבר Bard במלואו למודל PaLM 2. בדצמבר 2023 הציגה גוגל את משפחת Gemini, ובפברואר 2024 הוחלף השם Bard כליל ב-Gemini — כך ש-LaMDA, שממנו הכול התחיל, אינו עוד הבסיס לאף מוצר-דגל של גוגל.

שאלות נפוצות ❓

האם LaMDA באמת "מודע לעצמו"?

גוגל והקהילה המדעית דחו את הטענה ואמרו שאין לכך ראיה — הדובר הרשמי של גוגל ציין שרק מהנדס אחד מתוך מאות שדיברו עם המודל הגיע למסקנה הזו. השאלה הפילוסופית-העקרונית אם AI יכול בכלל להיות "מודע" נותרה, עם זאת, שנויה במחלוקת בקרב חוקרים.

מי היה בלייק למוין, ומה קרה לו בעקבות הטענה?

מהנדס-תוכנה בכיר בצוות ה-Responsible AI של גוגל. הוא נשלח לחופשה מנהלתית ביוני 2022 ופוטר ביולי אותה שנה, בטענה שהפר מדיניות-סודיות של החברה.

מה גודל LaMDA, ועל אילו נתונים הוא אומן?

עד 137 מיליארד פרמטרים בגרסתו הגדולה, שאומנה על כ-1.56 טריליון מילים מתוך מסמכים ציבוריים ונתוני-שיחה.

מה הקשר בין LaMDA ל-Bard ול-Gemini?

Bard הופעל בתחילה (פברואר 2023) על גרסה קלה של LaMDA, שודרג תוך חודשים ל-PaLM ואז ל-PaLM 2, ולבסוף הוחלף כליל במשפחת Gemini עד תחילת 2024.