מודל-הנמקה (Reasoning Model)
הגדרה
מודל-הנמקה הוא מודל-שפה שאומן לייצר רצף חשיבה פנימי לפני התשובה — לפרק בעיה לשלבים, לנסות כמה דרכים ולבדוק את עצמו — ולכן מצליח יותר במתמטיקה, בלוגיקה ובתכנות, במחיר של זמן ועלות.
💡 דוגמה
מודל רגיל: עונה מיד, כמו מי שזורק תשובה מהמותן.
מודל-הנמקה: כמו תלמיד במבחן שכותב טיוטה בצד, בודק את עצמו ורק אז כותב תשובה — לוקח יותר זמן ועולה יותר.
מה זה מודל-הנמקה
מודל-הנמקה (Reasoning Model), שנקרא גם "מודל-הנמקה גדול" (Large Reasoning Model), הוא מודל-שפה שאומן במיוחד לפתור משימות שדורשות כמה שלבי חשיבה. לפי ויקיפדיה, מודלים כאלה "נוטים להצליח יותר במשימות של לוגיקה, מתמטיקה ותכנות ממודלי-שפה רגילים", ויכולים "לחזור לשלבים קודמים ולתקן אותם". ההבדל המרכזי: לפני שהמודל כותב את התשובה, הוא מייצר רצף ארוך של טקסט פנימי — מעין טיוטה — שבו הוא מפרק את הבעיה, בוחן כמה דרכים ובודק את עצמו. OpenAI מתארת זאת כך: המודלים משתמשים ב"טוקני הנמקה" כדי "לחשוב", "לפרק את הפרומפט ולשקול כמה גישות לייצור תשובה". מודל רגיל, לעומת זאת, מתחיל לכתוב את התשובה מיד. לכן מודל-הנמקה בולט דווקא במשימות שבהן טעות בשלב מוקדם מקלקלת את כל ההמשך, כמו פתרון תרגיל או כתיבת קוד.
איך מלמדים מודל "לחשוב"
הרעיון נשען על שרשור מחשבה (Chain of Thought) — טכניקה שבה מבקשים ממודל לחשוב צעד אחר צעד. ההבדל הוא שבמודל-הנמקה ההתנהגות הזו לא תלויה בניסוח הבקשה: היא נבנית כבר באימון. לפי ויקיפדיה, משתמשים לשם כך בכוונון על פתרונות כתובים שלב אחר שלב, ובלמידת חיזוק (Reinforcement Learning): המודל מנסה, ומקבל "תגמול" — לפעמים לפי התשובה הסופית בלבד, נכונה או לא, ולפעמים על כל שלב בדרך. DeepSeek הראתה במאמר על R1, שהתפרסם בהמשך בכתב העת Nature, ש"יכולות ההנמקה של מודלי-שפה ניתנות לעידוד באמצעות למידת חיזוק טהורה", בלי מסלולי הנמקה שבני אדם כתבו. לפי המאמר, במהלך האימון צצו מעצמן התנהגויות כמו בדיקה עצמית, אימות והחלפת אסטרטגיה, והדפוסים האלה הועברו גם למודלים קטנים יותר.
ציר הזמן: מ-o1 ועד ההנמקה כברירת מחדל
המודל המסחרי הבולט הראשון מהסוג הזה היה o1 של OpenAI: גרסת תצוגה שלו יצאה בספטמבר 2024, והגרסה המלאה בדצמבר 2024, לצד הכרזה על o3. באותו חודש הציגה גם Alibaba מודלי-הנמקה משלה. בינואר 2025 שחררה DeepSeek את R1, שלפי ויקיפדיה הציג "ביצועים דומים ל-o1, בעלות נמוכה יותר". אחריהם הגיעו מודלים כמו Gemini 2.0 Flash Thinking של Google ו-Claude 3.7 Sonnet של Anthropic, שבו אפשר היה לכוון את כמות טוקני החשיבה. הגל התחרותי הזה מתואר בהרחבה בערך על מירוץ מודלי-ההנמקה. מאז ההנמקה הפכה לחלק רגיל מהמודלים הגדולים: GPT-5, שהושק באוגוסט 2025, כבר כלל נתב שמחליט לבד מתי להפעיל מודל "חושב", ומפתחים רבים כבר לא בוחרים בין "מודל רגיל" ל"מודל-הנמקה", אלא קובעים כמה מאמץ חשיבה להשקיע.
המחיר של חשיבה: זמן, כסף וטוקנים נסתרים
החשיבה עולה. לפי OpenAI, טוקני ההנמקה "אינם גלויים דרך ה-API, אבל הם תופסים מקום בחלון ההקשר של המודל ומחויבים כטוקני פלט" — כלומר, משלמים גם על הטיוטה שלא רואים. גם Anthropic מדווחת למפתחים כמה מטוקני הפלט שחויבו היו הנמקה פנימית. לפי ויקיפדיה, במבחן המתמטיקה AIME מודלי-הנמקה היו יקרים פי 10 עד פי 74 ממקביליהם הרגילים, והפלט הארוך שלהם מאריך את זמן ההמתנה לתשובה. כדי לשלוט בזה מאפשרות החברות לכוון את "מאמץ ההנמקה". OpenAI מציעה רמות מ-none, בלי הנמקה כלל, דרך low ו-medium ועד high, xhigh ו-max. במודלים החדשים של Anthropic המודל עצמו מחליט אם ובכמה לחשוב לפי רמת המאמץ שנבחרה, ובמאמץ נמוך הוא עשוי לדלג על החשיבה לגמרי בשאלות קלות.
האם הם באמת חושבים?
השם "חשיבה" שנוי במחלוקת. ביוני 2025 פרסמו חוקרי Apple את המחקר "אשליית החשיבה" (The Illusion of Thinking), שבחן מודלי-הנמקה בחידות שאפשר לשלוט ברמת הקושי שלהן. הם מצאו שלושה מצבים: בבעיות פשוטות, מודלים רגילים דווקא הצליחו יותר; בבעיות בינוניות, החשיבה הנוספת עזרה; ובבעיות מורכבות, שני סוגי המודלים "קרסו לחלוטין". עוד נמצא שמאמץ ההנמקה גדל עם הקושי עד נקודה מסוימת, ואז "יורד, למרות תקציב טוקנים מספיק", ושהמודלים "לא משתמשים באלגוריתמים מפורשים ומנמקים באופן לא עקבי". המשמעות למשתמש: גם מודל-הנמקה יכול לטעות בביטחון, והעובדה שהוא "חשב" אינה ערובה לכך שהתשובה נכונה. גם בשאלות קשות כדאי לבדוק את התוצאה, במיוחד כשהיא חשובה.
מתי כדאי להשתמש במודל-הנמקה
לא כל שאלה צריכה מודל-הנמקה. התיעוד של OpenAI ממליץ על רמת המאמץ none למשימות שבהן מהירות התגובה קריטית, ועל high ל"הנמקה קשה, ניפוי באגים מורכב, תכנון עמוק ומשימות בעלות ערך גבוה". ממצאי Apple מחזקים את זה מהכיוון השני: בבעיות פשוטות, החשיבה הנוספת לא עזרה. בפועל, לשאלה יומיומית או לניסוח מייל מספיק מצב מהיר, ולבעיה במתמטיקה, בקוד או בתכנון רב-שלבי כדאי לבחור במצב "חשיבה". OpenAI ממליצה גם לתת למודל "את המשימה, את המגבלות ואת פורמט הפלט הרצוי", ולהתייחס לרמת המאמץ "ככפתור כוונון, ולא כדרך העיקרית לשפר איכות". כלומר, ניסוח טוב של הבקשה עדיין חשוב. במוצרים רבים, כמו ChatGPT, הבחירה בין המצבים כבר נעשית אוטומטית.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| מודל רגיל | מודל-הנמקה | |
|---|---|---|
| איך הוא עונה | מתחיל לכתוב את התשובה מיד | מייצר קודם טוקני הנמקה פנימיים, ורק אז תשובה |
| במה הוא חזק | תשובות מהירות; בבעיות פשוטות הצליח יותר במחקר של Apple | לוגיקה, מתמטיקה ותכנות |
| עלות וזמן | נמוכים יותר | טוקני ההנמקה מחויבים כפלט, והפלט הארוך מאריך את ההמתנה |
| דוגמאות | GPT-4o | o1, DeepSeek-R1, GPT-5 במצב חשיבה |
שאלות נפוצות ❓
מה ההבדל בין מודל-הנמקה לשרשור מחשבה?
שרשור מחשבה הוא טכניקה: מבקשים ממודל לחשוב צעד אחר צעד. במודל-הנמקה ההתנהגות הזו נבנית כבר באימון, בעיקר בלמידת חיזוק, ולכן היא קורית גם בלי לבקש.
האם אפשר לראות את ה"חשיבה" של המודל?
בדרך כלל לא במלואה. לפי OpenAI, טוקני ההנמקה אינם גלויים דרך ה-API, ואפשר לקבל במקומם סיכום. גם Anthropic מחזירה למפתחים סיכום של החשיבה.
למה מודל-הנמקה יקר יותר?
כי הוא כותב הרבה טקסט פנימי לפני התשובה, ועל הטקסט הזה משלמים כטוקני פלט. לפי ויקיפדיה, במבחן AIME מודלי-הנמקה היו יקרים פי 10 עד פי 74 ממודלים רגילים.
האם מודל-הנמקה תמיד עדיף?
לא. בבעיות פשוטות הוא איטי ויקר בלי תועלת, ובמחקר של Apple מודלים רגילים אף הצליחו בהן יותר. בבעיות מורכבות מאוד, גם מודלי-הנמקה קרסו.