דגם-הנמקה פתוח-משקלים: מה זה DeepSeek-R1
DeepSeek-R1 הוא דגם-ההנמקה (Reasoning Model) של חברת ה-AI הסינית DeepSeek, ששוחרר ב-20 בינואר 2025 — כעשרה ימים אחרי שהחברה השיקה גרסה מוקדמת של אפליקציית-הצ'אט שלה לאייפון ולאנדרואיד ב-10 בינואר, תאריך שמצוטט לעיתים קרובות בטעות כתאריך-שחרור המודל עצמו. בדומה ל-o1 של OpenAI, R1 "חושב" בשרשרת-מחשבה מורחבת — כולל התנהגויות כמו בדיקה-עצמית ותיקון-אסטרטגיה תוך-כדי-פתרון — לפני שהוא מציג תשובה סופית, במקום להשיב ברצף-ייצור-טקסט אחד. בשונה מ-o1, ששוחרר כמוצר סגור-משקלים, DeepSeek פרסמה את R1 תחת רישיון MIT — רישיון-קוד-פתוח מתירני, שמאפשר לכל מי שרוצה להוריד את משקלי-המודל, להריץ אותם באופן עצמאי, ואף לסחור בגרסאות-נגזרות שלהם ללא הגבלה.
איך אומן: למידת-חיזוק בלי תיוג-אדם מסיבי
לפי המאמר הרשמי שפרסמה DeepSeek (ינואר 2025), R1 מבוסס על ארכיטקטורת תערובת-מומחים (Mixture-of-Experts) של כ-671 מיליארד פרמטרים בסך-הכול, שמפעילה כ-37 מיליארד מהם בלבד בכל חישוב בודד. החידוש המרכזי הוא בשיטת-האימון: לפני R1 עצמו פיתחה החברה גרסה ניסיונית בשם DeepSeek-R1-Zero, שאומנה באמצעות למידת-חיזוק (Reinforcement Learning) בלבד, ישירות מעל מודל-הבסיס וללא שום שלב-כוונון-מונחה (Supervised Fine-Tuning) מוקדם — והראתה לראשונה שיכולות-הנמקה מתקדמות יכולות לצמוח מלמידת-חיזוק כשלעצמה. הבעיה: הפלט של R1-Zero סבל מקריאוּת ירודה וערבוב-שפות בתוך אותה שרשרת-מחשבה עצמה. הפתרון ב-R1 המלא: הוספת שלב "התנעה-קרה" (Cold Start) קצר — כוונון ראשוני על כמות מצומצמת של דוגמאות שרשרת-מחשבה איכותיות וקריאות — לפני שלב למידת-החיזוק הגדול, מה שצמצם משמעותית את התלות בכמויות-ענק של דוגמאות-הנמקה מתויגות-אדם. לצד R1 עצמו פרסמה החברה גם שש גרסאות "מזוקקות" קטנות יותר (מ-1.5 עד 70 מיליארד פרמטרים, מבוססות על ארכיטקטורות Qwen ו-Llama קיימות), שמנסות לחקות את דפוסי-ההנמקה של המודל המקורי בעלות-הרצה נמוכה בהרבה.
ביצועים: צמוד ל-o1 במתמטיקה ובתכנות
לפי הדיווח העצמי שפרסמה DeepSeek באותו מאמר, R1 השיג במבחן AIME 2024 ציון של כ-79.8 אחוזים — מעט מעל גרסת o1-1217 של OpenAI, שקיבלה כ-79.2 אחוזים באותו מבחן — ובמבחן MATH-500 הגיע R1 ל-97.3 אחוזים מול 96.4 אחוזים ל-o1-1217. בתחרויות-תכנות בפלטפורמת Codeforces o1-1217 עדיין הוביל בפער קטן (אחוזון 96.6 מול 96.3, ודירוג Elo של 2,061 מול 2,029). המסקנה שהחברה הדגישה: ביצועים ברמה דומה ל-o1 של OpenAI, על אף שהתהליך שהוביל אליהם — לפי הצהרת החברה עצמה — עלה משמעותית פחות.
התיקון החשוב: איזו עלות-אימון שייכת ל-R1, ואיזו לא
הנתון שמצוטט לרוב בהקשר הזה — עלות-אימון של כ-5.58 מיליון דולר — שייך בפועל למודל-האח DeepSeek-V3 (דצמבר 2024), לא ל-R1 עצמו: DeepSeek מעולם לא פרסמה נתון-עלות-אימון נפרד עבור R1. הבלבול הזה נפוץ מאוד בסיקור התקשורתי, אך שני המודלים שונים — V3 הוא מודל-הבסיס הכללי, ו-R1 אומן מעליו בשלב-הנמקה נוסף שעלותו לא פורסמה בנפרד. מבחינת עלות-שימוש בפועל, ה-API הרשמי של R1 מתומחר בין כ-0.14 ל-2.19 דולר למיליון טוקן (בהתאם לסוג-הטוקן ולמצב-מטמון) — זול משמעותית מ-15 ו-60 דולר למיליון טוקני-קלט/פלט של o1 הבסיסי, פער שממחיש את הטיעון המרכזי שהחברה קידמה: אפשר להתחרות בביצועי-חזית בלי לשלם מחיר-חזית.
"רגע-ספוטניק": ההשפעה על שוק ההון
ב-27 בינואר 2025 — כשבוע אחרי שחרור R1 — עקפה האפליקציה הנלווית של DeepSeek את ChatGPT כאפליקציית-החינם המורדת ביותר בחנות-האפליקציות האמריקאית של אפל, וגרמה לטלטלה בשוקי ההון: מניית NVIDIA נסגרה בירידה של כ-17 אחוזים — הפסד-שווי-שוק יומי של קרוב ל-600 מיליארד דולר, הגדול ביותר בתולדות שוק המניות האמריקאי עבור חברה בודדת ביום מסחר אחד. מניות שבבים וספקי-תשתית נוספים — Broadcom, מיקרוסופט, Alphabet, ASML — ירדו אף הן באותו יום, ופרשנים כינו את האירוע "רגע-ספוטניק" עבור תעשיית ה-AI האמריקאית: התגלית שמודל-הנמקה סיני, שפותח כביכול בעלות נמוכה משמעותית, מתחרה בביצועי הדגמים המובילים, עוררה מחדש ויכוח ציבורי רחב על גודל ההשקעה הנדרש כדי להוביל בתחום ה-AI, ותרמה לניסוח מחודש של התחרות הטכנולוגית בין ארה"ב לסין כ"מרוץ-AI" גלובלי. ראשי-חברות אמריקאיות מובילות הגיבו בפומבי: סם אלטמן, מנכ"ל OpenAI המתחרה הישיר, כתב ש-R1 הוא "מודל מרשים, במיוחד ביחס למה שהם מצליחים לספק במחיר הזה" — תגובה שסימנה עד כמה ההשקה שינתה בין-לילה את השיח סביב מי מוביל בתחום ה-AI.