טמפרטורה (Temperature)
הגדרה
טמפרטורה היא פרמטר שקובע כמה "יצירתי" או "צפוי" יהיה הפלט של מודל שפה — טמפרטורה נמוכה נותנת תשובות עקביות וסבירות, גבוהה נותנת תשובות מגוונות ומפתיעות יותר.
💡 דוגמה
בטמפרטורה נמוכה, "תן שם לבית קפה" יחזיר משהו צפוי כמו "קפה טוב". בטמפרטורה גבוהה יגיעו שמות מפתיעים, ולפעמים גם משונים.

מה זו טמפרטורה, ומאיפה השם
טמפרטורה (Temperature) היא פרמטר-הרצה שקובע כמה "יצירתי" או "צפוי" יהיה הפלט של מודל שפה גדול (LLM) — טמפרטורה נמוכה נותנת תשובות עקביות וסבירות-סטטיסטית-גבוהה, טמפרטורה גבוהה נותנת תשובות מגוונות, מפתיעות, ולעיתים בלתי-צפויות יותר. השם עצמו שאול ממכניקה סטטיסטית בפיזיקה — מדע שמתאר איך חלקיקים מתפזרים בין מצבי-אנרגיה שונים בהתאם לחום — כי המתמטיקה שמשמשת לבחירת הטוקן (Token) הבא במודל שפה דומה מבנית למשוואות שמתארות התפלגות-חלקיקים בטמפרטורות שונות; ההשאלה נועדה למחיש עד כמה "פרוס" או "מרוכז" מתפלגות ההסתברויות בין האפשרויות, לא בגלל קשר ממשי לחום פיזי.
המנגנון הטכני: softmax ומקרי-הקצה
מבחינה טכנית, בכל שלב יצירת-טוקן מחשב מודל השפה התפלגות-הסתברות שלמה על כל הטוקנים באוצר-המילים שלו — לא רק "הבחירה הכי-סבירה", אלא ציון-הסתברות לכל אחת מעשרות-אלפי או מאות-אלפי האפשרויות. הצעד האחרון בתהליך הזה, שנקרא softmax, ממיר את הציונים הגולמיים ("לוגיטים") להתפלגות-הסתברות תקינה שסכומה 1. טמפרטורה נכנסת לתמונה בדיוק בשלב הזה: היא מספר חיובי שמחלק את הלוגיטים לפני חישוב ה-softmax. טמפרטורה נמוכה (קרובה ל-0) "מחדדת" את ההתפלגות — מגדילה את הפער בין האפשרות הכי-סבירה לשאר, כך שהמודל כמעט תמיד יבחר בטוקן בעל-הסבירות-הגבוהה-ביותר. טמפרטורה גבוהה (מעל 1) "משטחת" את ההתפלגות — מקטינה את הפער בין האפשרויות, כך שגם טוקנים פחות-סבירים מקבלים סיכוי משמעותי יותר להיבחר בפועל.
טמפרטורה של אפס בדיוק היא מקרה-קצה מיוחד: היא הופכת את הבחירה לדטרמיניסטית לחלוטין — המודל בוחר תמיד בטוקן בעל-ההסתברות-הגבוהה-ביותר, בלי שום אקראיות, וכתוצאה מכך אותה שאלה בדיוק אמורה לייצר בעקרון את אותה תשובה בדיוק בכל פעם (בפועל, גורמים הנדסיים כמו עיבוד-מקבילי על כמה מעבדי-גרפיקה בו-זמנית עלולים עדיין להכניס שונות זעירה, אבל זו תופעת-לוואי טכנית, לא כוונת-עיצוב). בקצה השני, טמפרטורה גבוהה מאוד (למשל 2 ומעלה, תלוי בהגדרות הספציפיות של כל ספק) עלולה להוביל לפלט כאוטי ולעיתים חסר-קוהרנטיות לגמרי — המודל "בורח" לבחירות אקראיות-כמעט שלא נצמדות עוד לדפוסי-שפה תקינים.
בחירת-טמפרטורה לפי משימה, ולמה גבוה לא אומר "חכם יותר"
בחירת-הטמפרטורה הנכונה תלויה לגמרי במשימה. טמפרטורה נמוכה (0 עד כ-0.3) מתאימה למשימות שדורשות דיוק ועקביות — תשובות עובדתיות, חילוץ-מידע ממסמך, כתיבת-קוד, סיווג-טקסט, או כל מקרה שבו "אין מקום לפרשנות יצירתית" ותשובה אחת נכונה ברורה עדיפה. טמפרטורה בינונית (כ-0.5 עד 0.8) מתאימה לשיחה כללית ולרוב יישומי-הצ'אטבוט, כי היא משמרת קוהרנטיות תוך מתן גיוון מספיק שהתשובות לא יישמעו מכניות ומשוננות-בעל-פה. טמפרטורה גבוהה (מעל 1) מתאימה למשימות יצירתיות במפורש — כתיבת-שירה, סיעור-מוחות רעיוני, יצירת-דוגמאות מגוונות למערך-אימון, או כל מקרה שבו מגוון ואי-צפיות הם היעד עצמו, לא בעיה שצריך לצמצם.
חשוב לתקן אי-הבנה נפוצה: טמפרטורה גבוהה לא הופכת את המודל ל"חכם יותר" או "יצירתי יותר" במובן מהותי-קוגניטיבי — היא רק מגדילה את שיעור-האקראיות בבחירת-הטוקנים. במקרים רבים, טמפרטורה גבוהה מדי פשוט מגדילה את סיכוי-ההזיה (Hallucination) — המודל עלול "לבחור" בטוקן פחות-סביר שמוביל אותו לרצף שגוי-עובדתית, לא רק לרצף יצירתי-מעניין. ההבחנה הזו חשובה במיוחד במשימות שבהן דיוק קריטי: הגדלת-טמפרטורה אינה כלי-שיפור-איכות כללי, אלא כלי-שינוי-פרופיל-הסיכון הספציפי בין עקביות לגיוון.
פרמטרים משלימים: Top-K ו-Top-P
טמפרטורה היא רק אחד מכמה פרמטרים שקובעים איך מודל שפה "דוגם" (Sampling) את הטוקן הבא, ולרוב היא לא נבחרת לבד. שני פרמטרים משלימים נפוצים: "דגימת-Top-K" מגבילה את הבחירה לכמות-קבועה של הטוקנים הכי-סבירים בלבד (למשל, רק בין 40 הטוקנים המובילים) לפני שהטמפרטורה חלה עליהם, וכך מונעת מהמודל לבחור בטוקן קיצוני-בלתי-סביר גם בטמפרטורה גבוהה מאוד. "דגימת-Top-P" (הנקראת גם Nucleus Sampling — "דגימת-גרעין"), שהוצגה במאמר-מחקר משפיע מ-2019, גמישה יותר: היא בוחרת את הקבוצה הקטנה-ביותר של טוקנים שסכום-הסתברותם המצטבר עובר סף מסוים (למשל 0.9), כך שגודל-הקבוצה משתנה דינמית לפי המצב — כשמודל בטוח מאוד בבחירה אחת, הקבוצה קטנה; כשההתלבטות רחבה יותר, הקבוצה גדלה בהתאם. המאמר המקורי הראה שהשיטה הזו פותרת בעיה מוכרת בשיטות-דגימה פשוטות יותר: כשמודל "בטוח" בבחירה, שיטת Top-K הקבועה עדיין עלולה לכלול טוקנים חלשים ומיותרים בקבוצת-המועמדים, בעוד Top-P מצטמצם אוטומטית לקבוצה קטנה-ומדויקת יותר במקרים כאלה. שילוב של הפרמטרים האלה — לרוב טמפרטורה יחד עם Top-P — הוא מה שרוב ה-API-ים המסחריים מציעים כברירת-מחדל, כי הוא נותן שליטה עדינה יותר מכל פרמטר בודד.
טמפרטורה בזמן-הרצה מול כוונון בזמן-אימון, ומודלי-חשיבה
חשוב להבחין בין טמפרטורה שנשלטת בזמן-הרצה (Inference Time) לבין שיטות שמכוונות התנהגות-מודל בזמן-אימון. RLHF (למידת-חיזוק מהעדפות אנושיות) וכוונון עדין (Fine-tuning) משנים את המודל עצמו — את המשקלים הפנימיים שלו — כדי לעצב אילו תשובות הוא "רוצה" לתת מלכתחילה; טמפרטורה, לעומת זאת, לא נוגעת במודל בכלל — היא רק קובעת כמה אקראיות להזריק לתהליך-הבחירה מתוך מה שהמודל כבר "יודע". מודל שעבר כוונון להיות זהיר ומדויק עדיין יכול להישלח בטמפרטורה גבוהה ולייצר פלט מגוון ולא-צפוי, ולהפך — טמפרטורה נמוכה על מודל לא-מכוונן עדיין תשקף את כל ההטיות וההגבלות שהמודל למד באימון, רק בלי אקראיות נוספת.
התפתחות "מודלי-חשיבה" (Reasoning Models) מאז סוף 2024 הוסיפה שכבת-מורכבות לשאלת-הטמפרטורה. מודלים כאלה מבצעים תהליך-חשיבה-פנימי ארוך (Chain-of-Thought פנימי) לפני מתן התשובה הסופית, ורוב הספקים ממליצים על טמפרטורה נמוכה במיוחד עבור שלב-החשיבה עצמו — כדי שהשרשרת-הלוגית לא "תסטה" לכיוונים לא-רלוונטיים באמצע התהליך — גם כשהתשובה הסופית עצמה עשויה להיות מנוסחת בטמפרטורה גבוהה יותר. חלק מהספקים אף מגבילים או מבטלים כליל את שליטת-המשתמש בטמפרטורה עבור מודלי-חשיבה מסוימים, בטענה שהאיזון-הפנימי כבר כוונן בקפידה כחלק מתהליך-האימון של המודל, ושינוי-חיצוני שלו עלול לפגוע ביציבות התהליך.
שחזוריות במחקר, ומי בפועל נוגע בפרמטר
בהערכת-ביצועים ובמחקר-אקדמי, טמפרטורה של אפס (או קרובה-לאפס) היא כמעט-תמיד הבחירה הסטנדרטית — לא כי היא "הכי-טובה" באופן מוחלט, אלא כי היא הכרחית לצורך שחזוריות (Reproducibility) מדעית. מבחני-ידע ומיומנות סטנדרטיים (Benchmarks) שמשווים בין מודלים שונים חייבים לרוץ בתנאים דטרמיניסטיים-ככל-האפשר, אחרת הבדל בציון בין שתי הרצות של אותו מודל בדיוק עלול להיראות כמו הבדל-יכולת אמיתי, כשבפועל הוא רק תוצאה של אקראיות-הדגימה. מסיבה זו, השוואות-מודלים שמתפרסמות בעיתונות הטכנית ומדווחות "ציון X על מבחן Y" כוללות כמעט תמיד הנחת-רקע (לרוב לא-מוצהרת במפורש) שההרצה בוצעה בטמפרטורה אפס או קרובה לה — פרט טכני שמשפיע ישירות על עד כמה אפשר לסמוך על השוואה כזו כשמדובר במשימה שבה נועדים להריץ את המודל בפועל בטמפרטורה גבוהה יותר.
מבחינה מעשית, רוב המשתמשים בממשק-צ'אט צרכני רגיל (כמו ChatGPT או Claude בגרסה הצרכנית) לא נחשפים כלל לבקרת-טמפרטורה — הספק כבר בחר ערך-ברירת-מחדל שנחשב מאוזן לרוב השימושים, לרוב סביב 0.7 עד 1.0. הפרמטר הופך רלוונטי בעיקר למפתחים שעובדים ישירות מול API, ובונים אפליקציה שמריצה את אותה שאילתה שוב ושוב במשימה מוגדרת-היטב — למשל שירות שמחלץ מידע ממסמכים בקנה-מידה גדול, שם עקביות בין הרצה להרצה קריטית יותר מגיוון-סגנוני. במקרים כאלה, בחירת-טמפרטורה נמוכה במיוחד היא בדרך-כלל השיקול ההנדסי הראשון והפשוט-ביותר לשיפור-אמינות, עוד לפני מעבר לפתרונות מורכבים יותר כמו אחזור-מוגבר-בייצור (RAG) או כוונון עדין.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| טמפרטורה 0 | טמפרטורה 0.7 | טמפרטורה 1.5 ומעלה | |
|---|---|---|---|
| עקביות בין הרצות | כמעט-זהה בכל פעם | משתנה במידה מתונה | משתנה מאוד |
| מתאים במיוחד ל | עובדות, קוד, חילוץ-מידע | שיחה כללית, כתיבה עסקית | שירה, סיעור-מוחות, יצירתיות |
| סיכון עיקרי | תשובות משוננות וחוזרות | מאוזן | חוסר-קוהרנטיות, הזיות |
שאלות נפוצות ❓
מה קורה בטמפרטורה 0 בדיוק?
המודל בוחר כמעט-תמיד בטוקן בעל-ההסתברות-הגבוהה-ביותר, כמעט בלי אקראיות — אותה שאלה בדיוק אמורה לתת כמעט תמיד את אותה תשובה.
האם טמפרטורה גבוהה הופכת את המודל "לחכם יותר"?
לא — היא רק מגדילה אקראיות בבחירת-מילים; היא לא משפרת הבנה או ידע, ולעיתים אף מגדילה את הסיכון להזיות.
מה ההבדל בין טמפרטורה ל-Top-P?
שניהם שולטים בדגימת-הטוקן הבא, אך בדרכים שונות — טמפרטורה מעצבת את "חדות" ההתפלגות כולה, ו-Top-P מגביל את קבוצת-המועמדים לפני הבחירה עצמה; ספקים רבים משלבים את שניהם יחד.
איזו טמפרטורה כדאי לבחור עבור צ׳אטבוט שירות-לקוחות?
לרוב נמוכה-בינונית (0 עד 0.5), כי עקביות ודיוק חשובים יותר מגיוון-סגנוני במשימה כזו.