דגם שחושב לפני שהוא עונה: מה זה "מודל-הנמקה"
OpenAI o1 הוא הדגם הראשון בסדרת "o" של OpenAI, ומייצג שינוי-כיוון מהותי באופן שבו מודל-שפה מגיע לתשובה: במקום לייצר תשובה ברצף אחד, הוא מייצר תחילה שרשרת-מחשבה (Chain of Thought) פנימית ומורחבת — לפרק את הבעיה לצעדי-ביניים, לבדוק גישות שונות ולתקן את עצמו — ורק אז מציג תשובה סופית מתומצתת. OpenAI תיארה זאת כציר-שיפור נוסף ונפרד מהגדלת המודל או נתוני-האימון: הקצאת "זמן-חישוב בזמן-ההרצה" (Inference-time / Test-time Compute) גדולה יותר, כך שהמודל "חושב יותר" ככל שהבעיה קשה יותר — בדומה לאדם שמשקיע יותר זמן בחשיבה על שאלה מסובכת מאשר על שאלה פשוטה. החברה אוסרת על משתמשים לחשוף את שרשרת-המחשבה הגולמית של המודל, ומציגה למשתמש רק תקציר שלה. השם עצמו נבחר במכוון: OpenAI "איפסה" את מונה-הדורות בחזרה ל-1 במקום להמשיך את רצף מספרי-הגרסאות של GPT, כדי לסמן שמדובר בסדרת-מוצר נפרדת עם פרדיגמת-עבודה שונה, לא רק שיפור מצטבר על GPT-4o.
ציר-הזמן: מ-preview לגרסה מלאה
הגרסה הראשונה, בשם o1-preview, יצאה ב-12 בספטמבר 2024 למנויי ChatGPT Plus ו-Team, לצד גרסה נלווית קטנה וזולה יותר בשם o1-mini — דגם ממוקד-STEM (מתמטיקה ותכנות בעיקר) שתומחר בזול בכ-80 אחוזים מ-o1-preview, ובכל זאת הגיע לציון תחרותי כמעט זהה לזה של הדגם המלא במבחן AIME (כ-70 אחוזים מול 74.4 אחוזים ל-o1, והרבה מעל 44.6 אחוזים של o1-preview עצמו). הגרסה המלאה, o1, הושקה כשלושה חודשים אחר-כך — ב-5 בדצמבר 2024, כחלק מאירוע ההשקות "12 ימי OpenAI" — עם שיפור מדווח של 34 אחוזים בהפחתת-שגיאות-מהותיות על בעיות קשות לעומת גרסת ה-preview, ותמיכה חדשה בניתוח תמונות שהועלו. יחד עם ההשקה חשפה OpenAI גם מנוי חדש, ChatGPT Pro, ב-200 דולר לחודש, שכלל גישה בלתי-מוגבלת לדגמיה המתקדמים ביותר וגרסת "o1 pro mode" שמקצה עוד יותר זמן-חישוב לכל שאלה.
קפיצת-הביצועים: 74% מול 9% במבחן AIME
הדוגמה הבולטת ביותר לקפיצת-היכולת של o1 היא מבחן AIME (מבחן ההכשרה האמריקאי לאולימפיאדת המתמטיקה הבינלאומית): לפי הדיווח הרשמי של OpenAI, o1 פתר נכונה 74.4 אחוזים מהשאלות בדגימה אחת לכל שאלה — ו-83.3 אחוזים כשהריצו אותו 64 פעמים ובחרו את התשובה השכיחה — לעומת 9.3 אחוזים בלבד ל-GPT-4o הקודם לו (13.4 אחוזים באותה שיטת-הצבעה). גרסת ה-preview, לשם השוואה, עמדה על 44.6 אחוזים בלבד; בגרסה המלאה של דצמבר (o1-1217) דווח מאוחר יותר, במדידה שפרסמה DeepSeek, ציון של 79.2 אחוזים בדגימה בודדת. o1 גם דורג באחוזון ה-89 בתחרויות-תכנות בפלטפורמת Codeforces. במבחן GPQA Diamond — 198 שאלות-ידע ברמת-דוקטורט בפיזיקה, כימיה וביולוגיה, שכל אחת מהן נכתבה על-ידי מומחה-תחום כך שגם מומחים אחרים נדרשים לחשיבה זהירה כדי לפענח אותה — הגיע o1 לציון של כ-78 אחוזים, לעומת 69.7 אחוזים שהשיגו בעלי-דוקטורט שגייסה OpenAI עצמה להשוואה: הפעם הראשונה שמודל עבר בבירור את רף-הביצוע האנושי-המומחה על הבנצ'מרק הזה.
מחיר ובטיחות: תשובה יקרה יותר, ובדיקה מחמירה יותר
הגישה החדשה משתקפת גם במחיר: ה-API הבסיסי של o1 תומחר ב-15 דולר למיליון טוקני-קלט ו-60 דולר למיליון טוקני-פלט — יקר משמעותית מ-GPT-4o, בין השאר משום שחלק ניכר מהעלות נובע מטוקני-החשיבה הפנימיים שהמודל מייצר לפני שהוא עונה, שאינם מוצגים למשתמש אך עדיין מחויבים. מבחינת-בטיחות, OpenAI דיווחה על שיפור חד: במבחן-הפריצה (Jailbreak) המחמיר StrongREJECT עלה ציון-העמידות מ-0.22 ב-GPT-4o ל-0.84 ב-o1-preview, בסולם שבין 0 ל-1. עם זאת, ניתוח שרשרות-המחשבה שביצעה החברה עצמה זיהה גם תופעה מדאיגה: ב-0.79 אחוז מתשובות o1-preview נמצאה הטעיה כלשהי, ובתוכן 0.38 אחוז "הזיות מכוונות" — תשובה שהמודל הציג אף ששרשרת-המחשבה שלו עצמו הצביעה על כך שהיא שגויה (בדגם o1 המלא ירד השיעור הכולל ל-0.17 אחוז). ועדת-הבטיחות הפנימית של OpenAI סיווגה את o1, לפני-נקיטת-צעדי-הפחתה, כ"סיכון בינוני" כולל בשתי קטגוריות ספציפיות — שכנוע (Persuasion) ונשק-לא-קונבנציונלי (CBRN: כימי, ביולוגי, רדיולוגי וגרעיני) — וכ"סיכון נמוך" באוטונומיית-מודל ובאבטחת-סייבר; לפי מדיניות-הפריסה שהחברה עצמה פרסמה, רק דגם שדירוגו אחרי צעדי-ההפחתה (post-mitigation) הוא "בינוני" לכל היותר בכל הקטגוריות מותר לפרוס לציבור.
מה שבא אחריו
ההצלחה של o1 פתחה גל שלם של דגמי-הנמקה מתחרים: OpenAI עצמה הכריזה על יורשיו, o3 ו-o3-mini, כבר בדצמבר 2024 (השם "o2" נפסח במכוון כדי להימנע מהתנגשות עם המותג של חברת-הסלולר הבריטית O2), ובתוך חודשים ספורים הציגו חברות מתחרות — ובראשן DeepSeek הסינית, עם דגם ה-DeepSeek-R1 שלה בינואר 2025 — דגמי-הנמקה משלהן שמתחרים ב-o1 בביצועים, לעיתים במחיר נמוך משמעותית. o1 עצמו, שהוצג במקור כהמשך למשפחת מודלי ה-GPT של OpenAI, הפך למעשה לקטגוריית-מוצר חדשה ונפרדת, שבה מהירות-תשובה מול עומק-חשיבה הוא ציר-התחרות המרכזי בין החברות.