דלג לתוכן

GPT-OSS

מודלים ושפה

הגדרה

GPT-OSS היא משפחת מודלי-ההנמקה של OpenAI במשקלים פתוחים: שני מודלים, gpt-oss-120b ו-gpt-oss-20b, ששוחררו באוגוסט 2025 ברישיון Apache 2.0, ואפשר להוריד אותם ולהריץ אותם על מחשב או שרת משלכם.

💡 דוגמה

סטודיו קטן לפיתוח בפתח תקווה רוצה צ'אטבוט שעונה על מסמכים פנימיים, בלי לשלוח אותם לשרת של חברה אחרת.

הם מורידים את gpt-oss-20b, שלפי OpenAI יכול לרוץ גם במערכת עם 16 ג'יגה-בייט זיכרון, ומריצים אותו על מחשב משלהם.

מה זה GPT-OSS, ובמה הוא שונה מ-ChatGPT

ב-5 באוגוסט 2025 שחררה OpenAI שני מודלי שפה שכל אחד יכול להוריד: gpt-oss-120b הגדול ו-gpt-oss-20b הקטן. OpenAI מגדירה אותם כמודלים במשקלים פתוחים (open-weight): לפי כרטיס המודל, היא פרסמה את המשקלים המאומנים, קוד להרצה, סביבות לכלים ואת הטוקנייזר. כל אלה משוחררים ברישיון Apache 2.0, שמתאים לפי OpenAI גם לשינויים ולשימוש מסחרי, ולצדו יש מדיניות שימוש קצרה. בבלוג של Hugging Face מצוטט ממנה המשפט "בשימוש ב-gpt-oss, אתם מסכימים לציית לכל דין החל".

זה ההבדל המרכזי מהמודלים שמפעילים את ChatGPT, שזמינים דרך האפליקציה וממשק התכנות של OpenAI: את GPT-OSS אפשר להוריד, להריץ על מחשב או שרת משלכם, ולכוונן לצרכים שלכם. לפי OpenAI, אלה מודלי השפה הראשונים שלה במשקלים פתוחים מאז GPT-2. לפני כן היא שחררה באופן פתוח מודלים מסוגים אחרים, כמו Whisper לזיהוי דיבור ו-CLIP לחיבור בין תמונה לטקסט.

מה יש בפנים: תמהיל מומחים וכימות

שני המודלים בנויים בשיטת תמהיל מומחים (Mixture of Experts): בכל שכבה יש הרבה "מומחים", ולכל טוקן, יחידת טקסט שיכולה להיות מילה או חלק ממילה, מופעלים רק כמה מהם. לפי OpenAI, ל-gpt-oss-120b יש 117 מיליארד פרמטרים, 36 שכבות ו-128 מומחים בכל שכבה, אבל בכל צעד פעילים רק 5.1 מיליארד פרמטרים. ל-gpt-oss-20b יש 21 מיליארד פרמטרים, 24 שכבות ו-32 מומחים, ומתוכם פעילים 3.6 מיליארד. בשני המודלים מופעלים 4 מומחים לכל טוקן, וחלון ההקשר מגיע ל-131,072 טוקנים, שבהודעת ההשקה מעוגלים ל-"128k".

כדי שיהיה אפשר להריץ אותם על חומרה סבירה, המשקלים של המומחים נשמרו בפורמט מכווץ בשם MXFP4, שיטה של כימות (Quantization). לפי כרטיס המודל, משקלים אלה הם יותר מ-90% מכלל הפרמטרים. בזכות זה הדגם הגדול נכנס לכרטיס גרפי יחיד עם 80 ג'יגה-בייט זיכרון, והקטן רץ במערכות עם 16 ג'יגה-בייט בלבד.

המודלים אומנו על טקסט בלבד, ברובו באנגלית, עם דגש על מדע, תכנות וידע כללי. הם אינם מבינים תמונות, ותאריך הקיטוע של הידע שלהם הוא יוני 2024. לפי כרטיס המודל, האימון של הדגם הגדול דרש 2.1 מיליון שעות עבודה של מעבדי H100 של NVIDIA.

מודל הנמקה עם שלוש רמות מאמץ

GPT-OSS הוא מודל הנמקה: לפני התשובה הוא כותב לעצמו שרשור מחשבה (Chain of Thought). לפי OpenAI, אחרי האימון הראשוני הוא עבר תהליך דומה לזה של o4-mini, מודל ההנמקה הסגור שלה. אפשר לבחור רמת מאמץ, נמוכה, בינונית או גבוהה, במשפט אחד בהוראות המערכת, למשל "Reasoning: high". לפי כרטיס המודל, מאמץ גבוה יותר מאריך את החשיבה ומשפר את הדיוק ברוב המשימות, אבל גם מאט את התשובה ומייקר אותה.

המודלים אומנו להשתמש בכלים: חיפוש וגלישה ברשת, הרצת קוד Python, ופונקציות שהמפתח מגדיר בעצמו. הם אומנו על פורמט שיחה מיוחד בשם harmony, ולפי OpenAI צריך להשתמש בו, אחרת הם לא יעבדו כראוי. הפורמט מבחין בין סוגי ההודעות, והמודלים אומנו לתת עדיפות להוראות המערכת, אחריהן להוראות המפתח, ורק אחר כך לבקשת המשתמש.

OpenAI בחרה במכוון לא להפעיל פיקוח ישיר על שרשור המחשבה בזמן האימון. לפי מחקר של החברה, מודל שנלחץ להימנע מ"מחשבות רעות" עלול ללמוד להסתיר אותן, ובלי הלחץ הזה קל יותר לזהות התנהגות בעייתית דרך מה שהמודל כותב לעצמו. המחיר הוא ששרשור המחשבה עלול להכיל הזיות ותוכן שאינו עומד בכללי הבטיחות של החברה, ולכן היא ממליצה למפתחים לא להציג אותו ישירות למשתמשים.

כמה הוא טוב, לפי OpenAI ולפי המתחרים

לפי OpenAI, gpt-oss-120b מגיע ל"כמעט שוויון" עם o4-mini במבחני ההנמקה המרכזיים, ו-gpt-oss-20b מגיע לתוצאות דומות לאלה של o3-mini. אלה מדידות של החברה עצמה. כרטיס המודל מפרט גם חולשות: בשני מבחנים של ידע עובדתי בלי גישה לרשת, SimpleQA ו-PersonQA, שני המודלים נופלים מ-o4-mini. ב-SimpleQA, מדד שיעור ההזיות, כלומר החלק של התשובות השגויות, עמד על 0.782 בדגם הגדול ועל 0.914 בדגם הקטן. OpenAI מסבירה שלמודלים קטנים יש פחות ידע על העולם, ושגישה לחיפוש ברשת מצמצמת הזיות.

לקורא בישראל חשוב פרט נוסף. כרטיס המודל בודק ביצועים ב-14 שפות במבחן MMMLU, ועברית אינה אחת מהן. ערבית, סינית, הינדית ושפות נוספות נבדקו, והציונים הנמוכים ביותר היו בסווהילית וביורובה. בכרטיס המודל אין אפוא שום מדידה של איכות GPT-OSS בעברית.

המתחרים לא חיכו. במרץ 2026 דיווח VentureBeat על Qwen3.5-9B של עליבאבא, מודל של 9 מיליארד פרמטרים, שהשיג 81.7 במבחן GPQA Diamond לעומת 80.1 של gpt-oss-120b. גם כאן מדובר בטבלת תוצאות שמקורה בצוות Qwen עצמו. בכיוון ההפוך, צוות GigaChat של סבר הרוסית כתב במרץ 2026 שגילה ש-GPT-OSS-120b הוא "תחליף טוב באופן בלתי צפוי" לשופטים קנייניים בזירות ההשוואה, כלומר למודלים סגורים שמדרגים תשובות של מודלים אחרים.

בטיחות של מודל שאי אפשר להחזיר

כרטיס המודל מודה בבעיה הבסיסית של כל מודל פתוח: אחרי השחרור, תוקף נחוש יכול לכוונן אותו כדי לעקוף את הסירובים שלו, ול-OpenAI אין אפשרות להוסיף הגנות או לבטל את הגישה. לכן, לפני השחרור, OpenAI ניסתה לעשות בעצמה את מה שתוקף היה עושה. היא כיווננה גרסאות של הדגם הגדול על נתונים מתחומי הביולוגיה ואבטחת הסייבר, בלי סירובים, ובדקה עד כמה הן מסוכנות. לפי החברה, גם הגרסאות האלה לא הגיעו לרמת יכולת "גבוהה" לפי מסגרת המוכנות שלה, Preparedness Framework, והשיטה נבדקה בידי שלוש קבוצות מומחים חיצוניות. במקביל לשחרור הכריזה OpenAI על תחרות פתוחה לאיתור בעיות בטיחות חדשות במודלים, עם קופת פרסים של 500 אלף דולר.

ב-29 באוקטובר 2025 הוסיפה OpenAI למשפחה את gpt-oss-safeguard, שני מודלים שכווננו מ-GPT-OSS לסינון תוכן. מסנן רגיל לומד את הכללים בעקיפין, מאלפי דוגמאות מתויגות, וכדי לשנות אותו צריך לאמן אותו מחדש. כאן המפתח כותב מדיניות משלו ומצרף אותה לבקשה, והמודל מחליט אם טקסט מסוים מפר אותה ומסביר למה. OpenAI הביאה שתי דוגמאות: פורום משחקים שרוצה לזהות פוסטים על רמאות, ואתר ביקורות שרוצה לסנן ביקורות שנראות מזויפות. OpenAI עבדה עם ROOST, ארגון לכלי בטיחות פתוחים, על זיהוי הצרכים של מפתחים, בדיקת המודלים וכתיבת התיעוד, והמודלים שוחררו כגרסת מחקר מקדימה. OpenAI עצמה מציינת מגבלה: מסנן ייעודי שאומן על עשרות אלפי דוגמאות מתויגות עדיין יכול להיות מדויק יותר.

איפה הוא רץ, ומה מצבו באוקטובר 2026

OpenAI תכננה את GPT-OSS לרוץ כמעט בכל מקום. לפי ההודעה, עוד לפני ההשקה עבדה החברה עם פלטפורמות כמו Hugging Face, שירותי הענן של מיקרוסופט ואמזון, וכלים להרצה מקומית כמו Ollama, LM Studio ו-llama.cpp, ועם יצרניות שבבים כמו NVIDIA ו-AMD. מיקרוסופט הביאה גרסה מותאמת של הדגם הקטן למחשבי Windows. לפי Hugging Face, הדגם הקטן רץ על כרטיסים גרפיים ביתיים רבים עם 16 ג'יגה-בייט זיכרון. OpenAI ציינה שעבדה עם שותפים כמו AI Sweden, Orange ו-Snowflake על שימושים כמו הרצה בשרתים פנימיים, כדי שהמידע לא יצא מהארגון, וכוונון על נתונים ייעודיים.

OpenAI גם סימנה את הגבול בין המודלים הפתוחים למוצרים שלה. לפי ההודעה, למי שצריך תמיכה רב-מודלית, כלים מובנים ושילוב בפלטפורמה של החברה, המודלים שבממשק התכנות שלה "נשארים האפשרות הטובה ביותר". בבדיקה של עמוד OpenAI ב-Hugging Face ב-4 באוקטובר 2026 מופיעים בו שני דגמי GPT-OSS ושני דגמי safeguard, ולא נמצא בו דור חדש של המשפחה. ההקשר הרחב, של מרוץ בין מודלים פתוחים לסגורים, מתואר בערך נפרד.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שני הדגמים של GPT-OSS
gpt-oss-120bgpt-oss-20b
פרמטרים117 מיליארד, מתוכם 5.1 מיליארד פעילים21 מיליארד, מתוכם 3.6 מיליארד פעילים
שכבות ומומחים36 שכבות, 128 מומחים בכל שכבה24 שכבות, 32 מומחים בכל שכבה
חומרה להרצה, לפי OpenAIכרטיס גרפי יחיד עם 80 ג'יגה-בייטמערכת עם 16 ג'יגה-בייט זיכרון
השוואה במבחנים של OpenAIכמעט שוויון עם o4-mini במבחני ההנמקה המרכזייםתוצאות דומות ל-o3-mini במבחנים נפוצים
חלון הקשר131,072 טוקנים131,072 טוקנים
רישיוןרישיון Apache 2.0 ומדיניות שימושרישיון Apache 2.0 ומדיניות שימוש

שאלות נפוצות ❓

האם GPT-OSS הוא קוד פתוח?

OpenAI מגדירה אותו כמודל במשקלים פתוחים. היא פרסמה ברישיון Apache 2.0 את המשקלים, קוד להרצה, סביבות לכלים והטוקנייזר. ההבדל בין משקלים פתוחים לקוד פתוח מלא מוסבר בערך על משקלים פתוחים.

אפשר להריץ אותו במחשב ביתי?

את gpt-oss-20b כן, במערכת מתאימה: לפי OpenAI הגרסה המכווצת שלו רצה גם עם 16 ג'יגה-בייט זיכרון, ויש לו גרסה מותאמת ל-Windows. את gpt-oss-120b אפשר להריץ על כרטיס גרפי יחיד עם 80 ג'יגה-בייט זיכרון, כמו NVIDIA H100.

מותר להשתמש בו בעסק?

כן. רישיון Apache 2.0 מתיר שימוש מסחרי, שינוי וכוונון. לצדו יש מדיניות שימוש קצרה של OpenAI, שמחייבת לציית לחוק.

האם הוא טוב בעברית?

בכרטיס המודל אין מדידה לעברית: OpenAI בדקה אותו ב-14 שפות, ועברית לא הייתה ביניהן, ונתוני האימון היו ברובם באנגלית. כדאי לבדוק אותו על המשימות שלכם בעברית לפני שמסתמכים עליו.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו