GPT-4 — המודל ש-OpenAI הפסיקה לפרסם את מספר הפרמטרים שלו

מודלים ושפה

הגדרה

GPT-4 הוא מודל-השפה הרב-מודלי של OpenAI ממרץ 2023, הראשון במשפחת GPT שקיבל גם קלט של תמונות, והציג קפיצת-יכולת חדה במיוחד במבחני-הנמקה ומקצועות אקדמיים.

מה זה GPT-4, ומתי הוא יצא

GPT-4 הוא מודל-השפה הרביעי בדור-העיקרי של משפחת GPT מבית OpenAI, ששוחרר ב-14 במרץ 2023 יחד עם דוח-טכני מפורט ("GPT-4 Technical Report") שפורסם למחרת ב-arXiv. הוא היה הראשון במשפחה שתואר כ"רב-מודלי" (Multimodal): הוא יכול לקבל קלט של תמונות לצד טקסט (למשל, לתאר תרשים או לענות על שאלה לגבי צילום), אם כי הפלט שלו נשאר טקסט בלבד. הגישה אליו ניתנה תחילה למנויי ChatGPT Plus בתשלום, עם רשימת-המתנה לגישת-API.

קפיצת-יכולת חדה במבחנים אקדמיים ומקצועיים

OpenAI הדגישה במיוחד את הביצועים של GPT-4 במבחנים סטנדרטיים שנועדו במקור לבני-אדם: הוא עבר בהצלחה מבחן-לשכת-עורכי-הדין האמריקאי (Bar Exam) בציון המשקף בקירוב את האחוזון ה-90 מבין הנבחנים — לעומת GPT-3.5 שדורג בעבר בעשירונים התחתונים באותו מבחן בדיוק. שיפורים דומים נמדדו במבחני SAT, GRE, וכמה תחומי-בגרות מקצועיים, לצד שיפור משמעותי ביכולת הנמקה רב-שלבית ופתרון בעיות מורכבות יחסית לגרסאות הקודמות של GPT.

מדיניות-סודיות חדשה: בלי גודל, בלי ארכיטקטורה

בניגוד לכל דגמי-GPT הקודמים, שבהם OpenAI פרסמה במפורש את מספר הפרמטרים והפרטים הטכניים, בדוח-הטכני של GPT-4 נמנעה החברה מפורשות מגילוי גודל המודל, הארכיטקטורה המדויקת, כמות-הנתונים או החומרה ששימשה לאימון — שינוי-מדיניות מוצהר, שהצדיקוהו בשילוב של שיקולי-תחרות ובטיחות. הערכות בלתי-רשמיות בתקשורת דיברו על כך שהמודל עשוי להכיל כטריליון פרמטרים, ולעלות למעלה מ-100 מיליון דולר לאמן — אך OpenAI מעולם לא אישרה מספרים אלו רשמית.

שיטת "קנה-מידה צפוי": לחזות ביצועים לפני שמאמנים ענק

אחת התרומות הטכניות הבולטות שכן פורסמו בדוח היא שיטה ל"קנה-מידה צפוי" (Predictable Scaling): OpenAI פיתחה תשתית שמאפשרת לחזות במדויק יחסית את ביצועי-הגמר של מודל ענק, על סמך תוצאות של הרצות-ניסוי קטנות בהרבה — עד פי-1,000 פחות חישוב מזה שנדרש לאימון GPT-4 המלא. היכולת הזו איפשרה ל-OpenAI לקבל החלטות-תכנון משמעותיות על המודל הגדול עוד לפני שהושקעו בו משאבי-החישוב האדירים הנדרשים לאימונו בפועל.

בדיקת-בטיחות של כחצי שנה, לפני שהמודל יצא לציבור

לפי OpenAI, אימון-הבסיס (Pretraining) של GPT-4 הסתיים כבר באוגוסט 2022 — כשבעה חודשים לפני ההשקה בפועל. הפער הזה שימש לתהליך-בדיקה נרחב: מומחים חיצוניים התבקשו לנסות "לשבור" את המודל (Red Teaming) ולאתר דרכים להוציא ממנו תוכן מזיק, ו-OpenAI השתמשה במשוב האנושי הזה כדי לכוון (Fine-tune) את התנהגותו לפני השחרור — תהליך ארוך יותר משמעותית מכל דגם קודם שלה.

חלון-הקשר, וההמשך: GPT-4 Turbo ו-GPT-4o

בגרסתו המקורית, GPT-4 תמך בחלון-הקשר של 8,192 טוקנים, עם גרסת-API מיוחדת שתמכה עד 32,768 טוקנים. בנובמבר 2023 הציגה OpenAI את GPT-4 Turbo — גרסה משופרת וזולה יותר, עם חלון-הקשר מורחב ל-128,000 טוקנים, ובמאי 2024 הגיע GPT-4o, שהחליף אותו כדגם-הדגל החדש של החברה.

שאלות נפוצות ❓

מה זה "רב-מודלי" ב-GPT-4?

היכולת לקבל קלט מסוגים שונים — במקרה של GPT-4, טקסט ותמונות יחד — ולא רק טקסט, כמו בגרסאות הקודמות של GPT. הפלט של GPT-4 עצמו נשאר טקסט בלבד.

כמה פרמטרים יש ל-GPT-4?

OpenAI מעולם לא פרסמה מספר רשמי — שינוי-מדיניות מוצהר לעומת דגמי-GPT הקודמים. הערכות בלתי-רשמיות בתקשורת דיברו על כטריליון פרמטרים, אך אלה לא אושרו על ידי החברה.

מה ההבדל בין GPT-4 ל-GPT-4o?

GPT-4o (מאי 2024) הוא הדגם שהחליף את GPT-4 כדגל-החברה — הוא מעבד ומייצר טקסט, קול ותמונה בתוך רשת-עצבית אחת, במקום צירוף כמה מודלים נפרדים, ומגיב מהר בהרבה בשיחה קולית.

למה לקח ל-OpenAI חצי שנה לשחרר את GPT-4 אחרי שהאימון הסתיים?

כדי לבצע תהליך-בדיקת-בטיחות נרחב: מומחים חיצוניים ניסו "לשבור" את המודל ולאתר בו סיכונים, ו-OpenAI השתמשה במשוב הזה לכוון את התנהגותו לפני שהעמידה אותו לרשות הציבור.