דלג לתוכן

טרנספורמר מאומן מראש בעל יכולת יצירה (Generative Pre-trained Transformer)

מודלים ושפה

הגדרה

GPT הוא סוג של מודל-שפה גדול: רשת מבוססת טרנספורמר שאומנה מראש על כמויות גדולות של טקסט לא מתויג ומייצרת טקסט חדש. זה גם שם סדרת המודלים של OpenAI שהפכה את הגישה למוכרת.

💡 דוגמה

כשמישהו אומר "שאלתי את ה-GPT", הוא מתכוון בדרך כלל ל-ChatGPT. אבל GPT הוא קודם כול שם של שיטה: מודל שקורא מראש הרבה מאוד טקסט, ורק אחר כך מותאם למשימה.

לכן גם חברות אחרות קראו למודלים שלהן בשמות כמו GPT-J או BloombergGPT.

שלוש אותיות, שלושה רעיונות

GPT הוא ראשי תיבות של Generative Pre-trained Transformer. בוויקיפדיה העברית הוא מתורגם "טרנספורמר מאומן מראש בעל יכולת יצירה", וכל אחת משלוש המילים מתארת רעיון אחר. "יוצר" (Generative) — המודל מייצר תוכן טקסטואלי חדש, בדומה לטקסט שכותב אדם. "מאומן מראש" (Pre-trained) — לפני שהוא מותאם למשימה כלשהי, המודל עובר אימון ארוך על קבוצות גדולות של טקסט לא מתויג, כלומר טקסט שאיש לא סימן בו תשובות נכונות. "טרנספורמר" (Transformer) — זו ארכיטקטורת הרשת שעליה הוא בנוי, שהומצאה ב-2017 בידי עובדים בגוגל.

לפי ויקיפדיה האנגלית, GPT הוא "סוג של מודל-שפה גדול שנמצא בשימוש נרחב בצ'אטבוטים של בינה מלאכותית יוצרת". הערך הזה עוסק במשפחה ובשיטה כולה; לכל דור בסדרה של OpenAI יש ערך משלו, ושם נמצאים הפרטים של כל מודל.

2018: הרעיון של אימון מראש

לפני GPT, מודלי השפה הטובים ביותר נשענו בעיקר על למידה מפוקחת מכמויות גדולות של נתונים שסומנו ידנית. זה היה יקר, איטי, והגביל את השימוש לשפות ולתחומים שיש להם נתונים מתויגים בשפע. ב-11 ביוני 2018 פרסמו חוקרים ב-OpenAI את המאמר "Improving Language Understanding by Generative Pre-Training", שהציג את GPT-1.

השיטה כללה שני שלבים. בשלב הראשון, אימון מראש: המודל למד מתוך BookCorpus, אוסף של כ-7,000 ספרים שלא פורסמו מז'אנרים שונים, בלי שום תיוג. בשלב השני, כוונון עדין: הפרמטרים שנלמדו הותאמו למשימת יעד מסוימת בעזרת כמות קטנה יותר של נתונים מתויגים. GPT-1 עצמו היה קטן במונחי היום — 117 מיליון פרמטרים, במבנה של מפענח טרנספורמר בן 12 שכבות, בלי מקודד. החידוש היה בגישה: מודל אחד שלומד שפה באופן כללי, ואחר כך מותאם בקלות למשימות שונות.

למה זה עבד: מודל אחד להרבה משימות

לפי ויקיפדיה, הגישה של GPT-1 אפשרה להעביר את מה שנלמד באימון מראש למגוון משימות, בלי לבנות ארכיטקטורה מיוחדת לכל משימה. במבחן ההשוואה GLUE הוא הגיע לציון 72.8, לעומת 68.9 של השיא הקודם. זה הרעיון שמאחורי מה שמכונה היום מודל יסוד: מודל שאומן על נתונים רחבים בקנה מידה גדול, כך שאפשר להתאים אותו למגוון רחב של משימות. לפי ויקיפדיה העברית, מודלי הבסיס הבולטים ביותר מסוג GPT הם סדרת GPT-n של OpenAI.

עם הזמן התברר שהשלב השני חשוב לא פחות מהראשון. במחקר InstructGPT ממרץ 2022 כוונן מודל בעזרת דוגמאות שכתבו בני אדם ובעזרת למידת חיזוק מהעדפות אנושיות. התוצאה בולטת: התשובות של InstructGPT בגודל 1.3 מיליארד פרמטרים הועדפו על פני אלה של GPT-3 בגודל 175 מיליארד, "למרות שיש לו פי 100 פחות פרמטרים", כלשון המאמר. הדרך שבה מכווננים מודל אחרי האימון מראש התגלתה כקריטית להפיכתו לעוזר שימושי.

הסדרה של OpenAI, בקצרה

OpenAI פרסמה את מודלי GPT במספור רציף, סדרה שמכונה GPT-n, וכל דור היה בעל יכולות גבוהות מקודמו בזכות גודל ושיפורים באימון. GPT-2 הוצג ב-14 בפברואר 2019, עם 1.5 מיליארד פרמטרים; לפי ויקיפדיה, גם מספר הפרמטרים וגם גודל מאגר הנתונים גדלו בו פי 10. GPT-3 הוצג ב-28 במאי 2020, עם 175 מיליארד פרמטרים. ChatGPT, הצ'אטבוט שהביא את הטכנולוגיה לציבור הרחב, הושק ב-30 בנובמבר 2022, ו-GPT-4 שוחרר ב-14 במרץ 2023 — ולגביו, לפי ויקיפדיה העברית, OpenAI סירבה לפרסם את פרטי הגודל והאימון.

GPT-5 הושק ב-7 באוגוסט 2025 כמערכת שמשלבת מודל מהיר, מודל הנמקה מעמיק יותר ונתב שמחליט בזמן אמת באיזה מהם להשתמש. ב-5 באוגוסט 2025 שחררה OpenAI את gpt-oss — שני מודלים בעלי משקלים פתוחים, gpt-oss-120b ו-gpt-oss-20b, ברישיון Apache 2.0. ההתפתחות של כל דור מתוארת בערך שלו; מה שמשותף לכולם הוא הרעיון שהוצג ב-2018.

GPT כשם כללי, ולא רק של OpenAI

המונח GPT יצא מזמן מגבולות חברה אחת. EleutherAI שחררה סדרה של מודלים בעלי משקלים פתוחים, ובהם GPT-J ב-2021, וחברת סרבראס פרסמה סדרה משלה. חברות בתעשיות שונות פיתחו מודלים ייעודיים בשם הזה, כמו BloombergGPT של בלומברג לתחום הפיננסים ו-EinsteinGPT של Salesforce לניהול קשרי לקוחות. לפי ויקיפדיה העברית, נכון ל-2023 לרוב מודלי-השפה הגדולים יש את המאפיינים של GPT, ולעיתים קוראים לכולם פשוט GPTs.

OpenAI ניסתה לרשום את GPT כסימן מסחרי בארצות הברית, ונכשלה. לפי TechCrunch, משרד הפטנטים והסימנים האמריקאי דחה את הבקשה לראשונה באוקטובר 2023 ובאופן סופי בפברואר 2024, בנימוק שהמונח "תיאורי בלבד": הוא מתאר תכונה טכנית של מודלים ולא מזהה מותג של חברה אחת. המשמעות המעשית היא שמתחרים יכולים להשתמש בשם, וכבר קיימות אפליקציות שאינן קשורות ל-OpenAI ושמן כולל את המילה.

GPTs: כשהמילה הפכה גם לשם של מוצר

יש משמעות שלישית שכדאי להכיר כדי לא להתבלבל. בכנס המפתחים הראשון שלה, ב-6 בנובמבר 2023, הציגה OpenAI את GPTs — גרסאות מותאמות אישית של ChatGPT, שמשתמשים יכולים לבנות בעזרת הנחיות בשפה רגילה, בלי לדעת לתכנת. GPT כזה נבנה בתוך ChatGPT עצמו, בעזרת הנחיות, ולכן הוא שם של מוצר ולא של דור חדש בסדרת המודלים. ב-10 בינואר 2024 נפתחה חנות GPT Store, שבה מנויי התוכניות בתשלום של ChatGPT יכלו למצוא ולשתף GPTs כאלה.

כך יוצא שהמילה GPT משמשת היום בשלוש משמעויות לפחות: שם של שיטה וארכיטקטורה, שם של סדרת מודלים מסוימת של OpenAI, ושם של עוזרים מותאמים אישית בתוך ChatGPT. כשקוראים על "GPT" בחדשות, שווה לבדוק לאיזו מהן הכוונה.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש משמעויות של המילה GPT
שיטה וארכיטקטורהסדרת GPT-n של OpenAIGPTs בתוך ChatGPT
מה זהמודל-שפה מבוסס טרנספורמר שאומן מראש על טקסט לא מתויג ומייצר טקסטהמודלים הממוספרים של OpenAI, מ-GPT-1 ב-2018 ועד היוםגרסאות מותאמות אישית של ChatGPT, שנבנות בהנחיות בלי תכנות
דוגמאותGPT-J של EleutherAI, BloombergGPTGPT-2, GPT-3, GPT-4, GPT-5עוזרים שמשתמשים פרסמו ב-GPT Store
מי רשאי להשתמש בשםכולם — הבקשה לרשום את GPT כסימן מסחרי נדחתהOpenAIמשתמשי ChatGPT שבונים עוזר משלהם

שאלות נפוצות ❓

מה ההבדל בין GPT ל-ChatGPT?

GPT הוא שם של סוג מודל ושל סדרת המודלים של OpenAI. ChatGPT הוא הצ'אטבוט של OpenAI, שהושק ב-30 בנובמבר 2022 ופועל על גבי מודלים מהסדרה הזו.

מה המשמעות של "מאומן מראש"?

לפני שמתאימים את המודל למשימה מסוימת, הוא לומד מכמויות גדולות של טקסט לא מתויג. רק אחר כך מכווננים אותו, למשל כדי שיענה על שאלות או ימלא הוראות.

האם רק OpenAI מייצרת מודלי GPT?

לא. EleutherAI, סרבראס, בלומברג ו-Salesforce הן חלק מהחברות שהשתמשו בשם. משרד הפטנטים האמריקאי קבע ש-GPT הוא מונח תיאורי, ולכן אינו סימן מסחרי של OpenAI.

מה ההבדל בין GPT לבין GPTs?

GPT (ביחיד) הוא סוג המודל. GPTs הוא שם שנתנה OpenAI ב-2023 לגרסאות מותאמות אישית של ChatGPT, שכל משתמש בתוכנית מתאימה יכול לבנות בלי לתכנת.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו