BLOOM
הגדרה
BLOOM הוא מודל שפה פתוח של 176 מיליארד פרמטרים, שפותח בשיתוף פעולה של יותר מאלף חוקרים במיזם BigScience בתיאום Hugging Face, שוחרר ביולי 2022 ויודע לכתוב ב-46 שפות.
💡 דוגמה
חוקרת באוניברסיטת בן-גוריון רוצה לבדוק איך מודל שפה מטפל בערבית.
עם BLOOM היא יכולה להוריד את המודל עצמו, לבדוק על אילו מקורות הוא אומן ולהריץ ניסויים, ולא רק לשלוח שאלות לשירות סגור.
מה זה BLOOM
BLOOM הוא מודל שפה גדול שהושק רשמית ב-12 ביולי 2022. השם הוא ראשי תיבות של BigScience Large Open-science Open-access Multilingual Language Model, כלומר מודל שפה גדול, רב-לשוני, שנבנה במדע פתוח ובגישה פתוחה. יש לו 176 מיליארד פרמטרים, ולפי MIT Technology Review הוא היה גדול מ-GPT-3 של OpenAI, שיש לו 175 מיליארד.
מה שמייחד את BLOOM הוא לא הגודל אלא הדרך שבה נבנה. בשנת 2022 המודלים הגדולים, כמו GPT-3 ו-LaMDA של גוגל, היו בידי חברות ענק, שלא פרסמו את המודלים ואת הקוד שלהן. BLOOM נבנה בידי יותר מאלף חוקרים מיותר מ-70 מדינות ומיותר מ-250 מוסדות, לפי הודעת ההשקה, ומטרתו המוצהרת הייתה לתת לחוקרים מודל אמיתי שאפשר להוריד, להריץ ולחקור "עד הפעולות הפנימיות העמוקות ביותר". BLOOM אומן להמשיך טקסט מתוך פתיח, וגרסה שכווננה במיוחד למילוי הוראות, BLOOMZ, פורסמה מאוחר יותר.
BigScience: סדנת מחקר פתוחה
BLOOM הוא התוצר המרכזי של BigScience, סדנת מחקר בינלאומית שנמשכה כשנה. כרטיס המודל מתארך אותה ממאי 2021 עד מאי 2022. לפי MIT Technology Review, את המיזם תיאמה Hugging Face, במימון של ממשלת צרפת. לפי הודעת ההשקה, האימון הסופי רץ מ-11 במרץ עד 6 ביולי 2022, במחשב-העל הציבורי Jean Zay ליד פריז, בזכות מענק מחשוב בשווי מוערך של 3 מיליון אירו מגופי המחקר הצרפתיים CNRS ו-GENCI. לפי כרטיס המודל, הוא אומן על 384 מעבדים גרפיים מדגם A100, והעלות נאמדה במקבילה של 2 עד 5 מיליון דולר במחשוב ענן, כולל ניסויים מקדימים.
השקיפות כללה גם את השאלה הסביבתית. מאמר מ-2022 העריך שהאימון הסופי של BLOOM פלט כ-24.7 טונות של פחמן דו-חמצני במונחים מקבילים, אם סופרים רק את החשמל שצרכה החומרה בזמן האימון, ו-50.5 טונות כשמוסיפים גם את החלק של ייצור הציוד ואת צריכת החשמל במצב סרק שיוחסו לאימון הזה. כרטיס המודל מציין שמחשב-העל פועל בעיקר באנרגיה גרעינית, ושהחום שלו משמש לחימום מעונות בקמפוס.
46 שפות, ובלי עברית
BLOOM אומן על ROOTS, מאגר של 1.6 טרה-בייט טקסט שהמיזם הרכיב במיוחד, ב-46 שפות טבעיות ו-13 שפות תכנות. לפי MIT Technology Review, קצת יותר מ-30% מהנתונים היו באנגלית, ובין השפות היו שפות רבות מדרום אסיה, כמו הינדית, בנגלית ואורדו, ומאפריקה, כמו סווהילית, יורובה ואיגבו. כדי להשיג טקסטים בשפות שכמעט אינן מיוצגות ברשת, ארגנה Hugging Face סדנאות עם חוקרי AI אפריקאים, שחיפשו מקורות כמו מסמכים של רשויות מקומיות ואוניברסיטאות. לטענת המיזם בהודעת ההשקה, כמעט לכל השפות שלו, כמו ספרדית, צרפתית וערבית, BLOOM היה מודל השפה הראשון עם יותר מ-100 מיליארד פרמטרים.
לקורא הישראלי יש כאן פרט חשוב: עברית אינה ברשימת השפות של BLOOM, כפי שהיא מופיעה בכרטיס המודל, אבל ערבית כן. כרטיס המודל מוסיף אזהרה כללית: המודל מייצר תוכן שנראה עובדתי אבל עלול להיות שגוי, והוא לא נועד להחלטות קריטיות. לפי המאמר הטכני, ביצועיו טובים יותר אחרי כוונון נוסף על משימות מנוסחות כהוראות.
רישיון RAIL: פתוח, אבל עם תנאים
המשקלים של BLOOM שוחררו ברישיון שהמיזם עצמו ניסח, BigScience RAIL, ראשי תיבות של Responsible AI License, רישיון לשימוש אחראי בבינה מלאכותית. לפי כותבי הרישיון, הוא מוסיף לשימוש במודל תנאים התנהגותיים: כל אחד יכול להוריד את המודל ולבנות עליו, גם לשימוש מסחרי, אבל הוא מתחייב לא להשתמש בו לשימושים מסוימים. כרטיס המודל מונה, בין היתר, הפקת ספאם, דיסאינפורמציה, הטרדה, התחזות ומעקב בלי הסכמה, ומגדיר שימוש בתחומים כמו ביו-רפואה, פוליטיקה, משפט ופיננסים, או לדירוג אנשים בתעסוקה, בחינוך ובאשראי, כמחוץ לייעוד המודל.
לפי MIT Technology Review, הרישיון נועד להרתיע משימוש בתחומים רגישים כמו אכיפת חוק ובריאות. דניש קונטרקטור, חוקר שהשתתף בניסוח הרישיון, תיאר אותו כניסוי בוויסות עצמי של מודלי שפה עד שהחוק ישיג את הטכנולוגיה. כתב העת הוסיף שבסופו של דבר, שום דבר לא מונע ממישהו לעשות שימוש לרעה ב-BLOOM. ההשוואה לזמנו חדה: OPT-175B של Meta, ששוחרר במאי 2022, היה זמין רק לפי בקשה וברישיון למחקר בלבד. לפי הבלוג של Hugging Face מאוגוסט 2022, רישיון BLOOM RAIL היה הראשון מסוגו, וממנו צמחו רישיונות OpenRAIL, ובהם הרישיון של Stable Diffusion. עליהם יש ערך נפרד.
המשפחה: גרסאות קטנות, BLOOMZ ו-Petals
לצד הדגם הגדול פרסם המיזם ב-Hugging Face גרסאות קטנות יותר, מ-560 מיליון ועד 7.1 מיליארד פרמטרים. לפי הודעת ההשקה, לראשונה פורסמו גם נקודות הביניים מהאימון ומצבי האופטימייזר, "ברוח של שיתוף פעולה ושיפור מתמשך".
במאמר מנובמבר 2022 הציגו חוקרי המיזם את BLOOMZ, גרסה של BLOOM שכווננה למלא הוראות על אוסף משימות בשם xP3, ב-46 שפות. החוקרים מצאו שכוונון על משימות באנגלית משפר את ביצועי המודל גם בשפות אחרות שהופיעו רק בנתוני האימון הראשוניים, ואפילו בשפות שלא נכללו במכוון בנתוני האימון, אף שבדיקה מצאה במאגר כמויות קטנות שלהן שנכנסו בלי כוונה.
כדי להריץ את הדגם הגדול צריך חומרה כבדה: לפי כרטיס המודל, קובצי המשקלים בפורמט BF16 תופסים 329 ג'יגה-בייט. פרויקט בשם Petals הציע פתרון: הרצה משותפת, שבה כמה משתתפים מחברים יחד את המשאבים של המחשבים שלהם. לפי מאמר הפרויקט, כך אפשר היה להריץ את BLOOM-176B על כרטיסים גרפיים ביתיים, בקצב של כצעד אחד בשנייה.
מה נשאר מ-BLOOM
כבר בהשקה היו מי שהזהירו מציפיות גבוהות מדי. פרסי ליאנג מאוניברסיטת סטנפורד שיבח את הקהילה שנבנתה סביבו, אבל אמר ל-MIT Technology Review ש-"OpenAI, גוגל ומיקרוסופט עדיין דוהרות קדימה". טבן לה-סקאו מ-Hugging Face, שהיה מראשי האימון, ניסח את הציפייה בצניעות: "מודל שפה גדול חדש אחד לא ישנה את מהלך ההיסטוריה", אבל מודל פתוח טוב שאפשר באמת לחקור, לדבריו, משפיע לטווח ארוך.
BLOOM הגיע עם חבילה שלמה של פתיחות: כרטיסי תיעוד לכל אחד ממקורות הנתונים, כרטיס מודל מפורט, הערכה של טביעת הרגל הפחמנית, ורישיון שמגביל שימושים מזיקים. מיזמים מאוחרים יותר, כמו אפרטוס השווייצרי, מציגים גם הם פתיחות של נתוני האימון ושל התהליך. נכון ל-4 באוקטובר 2026, המשקלים של BLOOM עדיין זמינים להורדה ב-Hugging Face.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| BLOOM (יולי 2022) | OPT-175B (מאי 2022) | GPT-3 | |
|---|---|---|---|
| מפתח | מיזם BigScience, בתיאום Hugging Face | חברת Meta | חברת OpenAI |
| גודל | 176 מיליארד פרמטרים | 175 מיליארד פרמטרים | 175 מיליארד פרמטרים |
| מה פורסם | המשקלים, הקוד ונקודות ביניים מהאימון | הקוד ויומן האימון; המשקלים לפי בקשה | לא המשקלים ולא הקוד |
| תנאי שימוש | רישיון RAIL: שימוש, גם מסחרי, בכפוף לתנאיו ולרשימת שימושים אסורים | רישיון למחקר בלבד | אין רישיון למשקלים, כי לא פורסמו |
שאלות נפוצות ❓
האם BLOOM יודע עברית?
עברית אינה אחת מ-46 השפות שבהן אומן, לפי כרטיס המודל. ערבית, צרפתית, ספרדית, סינית ושפות הודיות ואפריקאיות רבות כן נכללו.
האם BLOOM הוא קוד פתוח?
המשקלים שוחררו ברישיון RAIL, שמתיר שימוש, גם מסחרי, בכפוף לתנאיו. הרישיון אוסר, בין היתר, יצירה או הפצה של מידע שקרי במטרה לפגוע באחרים, והתחזות. לכן הוא נחשב מודל בגישה פתוחה עם הגבלות שימוש, ולא קוד פתוח במובן המקובל.
מה ההבדל בין BLOOM ל-BLOOMZ?
BLOOM הוא מודל בסיס שממשיך טקסט. BLOOMZ, שתואר במאמר מנובמבר 2022, הוא BLOOM שכוונן על אוסף משימות בשם xP3 כדי למלא הוראות, וכך הוא מתאים יותר לבקשות בשפה טבעית.
אפשר עדיין להשתמש בו?
כן. נכון לאוקטובר 2026 המשקלים זמינים ב-Hugging Face. אבל צריך לזכור שהוא מודל מ-2022, בלי עברית, וחלון ההקשר שבו אומן הוא 2,048 טוקנים בלבד.