דלג לתוכן

טמפרטורה (Temperature)

מודלים ושפה

הגדרה

טמפרטורה היא פרמטר שקובע כמה "יצירתי" או "צפוי" יהיה הפלט של מודל שפה — טמפרטורה נמוכה נותנת תשובות עקביות וסבירות, גבוהה נותנת תשובות מגוונות ומפתיעות יותר.

💡 דוגמה

בטמפרטורה נמוכה, "תן שם לבית קפה" יחזיר משהו צפוי כמו "קפה טוב". בטמפרטורה גבוהה יגיעו שמות מפתיעים, ולפעמים גם משונים.

מדחום אנכי בשלושה צבעים ולצידו שלוש תיבות. גבוהה (מעל 1): התפלגות משוטחת, גם טוקנים פחות סבירים נבחרים; מתאימה לשירה, סיעור מוחות ודוגמאות מגוונות. בינונית (בערך 0.5 עד 0.8): קוהרנטיות עם גיוון שמונע ניסוח מכני; מתאימה לשיחה כללית ולרוב יישומי הצ'אטבוט. נמוכה (0 עד בערך 0.3): התפלגות מחודדת, כמעט תמיד הטוקן הסביר ביותר; מתאימה לתשובות עובדתיות, חילוץ מידע וקוד. בתחתית: טמפרטורה 0 היא בחירה דטרמיניסטית, גבוהה מדי מגדילה את הסיכוי להזיה, והטמפרטורה מחלקת את ציוני המודל לפני שלב softmax.
שלוש רמות טמפרטורה ומה כל אחת עושה להתפלגות ההסתברויות של הטוקן הבא: נמוכה מחדדת אותה ונותנת פלט עקבי, גבוהה משטחת אותה ונותנת פלט מגוון ומפתיע יותר, ולכן הבחירה תלויה במשימה.תרשים מקורי של Wiki-AI · לחצו על התרשים להגדלה

מה זו טמפרטורה, ומאיפה השם

טמפרטורה (Temperature) היא פרמטר-הרצה שקובע כמה "יצירתי" או "צפוי" יהיה הפלט של מודל שפה גדול (LLM) — טמפרטורה נמוכה נותנת תשובות עקביות וסבירות-סטטיסטית-גבוהה, טמפרטורה גבוהה נותנת תשובות מגוונות, מפתיעות, ולעיתים בלתי-צפויות יותר. השם עצמו שאול ממכניקה סטטיסטית בפיזיקה — מדע שמתאר איך חלקיקים מתפזרים בין מצבי-אנרגיה שונים בהתאם לחום — כי המתמטיקה שמשמשת לבחירת הטוקן (Token) הבא במודל שפה דומה מבנית למשוואות שמתארות התפלגות-חלקיקים בטמפרטורות שונות; ההשאלה נועדה למחיש עד כמה "פרוס" או "מרוכז" מתפלגות ההסתברויות בין האפשרויות, לא בגלל קשר ממשי לחום פיזי.

המנגנון הטכני: softmax ומקרי-הקצה

מבחינה טכנית, בכל שלב יצירת-טוקן מחשב מודל השפה התפלגות-הסתברות שלמה על כל הטוקנים באוצר-המילים שלו — לא רק "הבחירה הכי-סבירה", אלא ציון-הסתברות לכל אחת מעשרות-אלפי או מאות-אלפי האפשרויות. הצעד האחרון בתהליך הזה, שנקרא softmax, ממיר את הציונים הגולמיים ("לוגיטים") להתפלגות-הסתברות תקינה שסכומה 1. טמפרטורה נכנסת לתמונה בדיוק בשלב הזה: היא מספר חיובי שמחלק את הלוגיטים לפני חישוב ה-softmax. טמפרטורה נמוכה (קרובה ל-0) "מחדדת" את ההתפלגות — מגדילה את הפער בין האפשרות הכי-סבירה לשאר, כך שהמודל כמעט תמיד יבחר בטוקן בעל-הסבירות-הגבוהה-ביותר. טמפרטורה גבוהה (מעל 1) "משטחת" את ההתפלגות — מקטינה את הפער בין האפשרויות, כך שגם טוקנים פחות-סבירים מקבלים סיכוי משמעותי יותר להיבחר בפועל.

טמפרטורה של אפס בדיוק היא מקרה-קצה מיוחד: היא הופכת את הבחירה לדטרמיניסטית לחלוטין — המודל בוחר תמיד בטוקן בעל-ההסתברות-הגבוהה-ביותר, בלי שום אקראיות, וכתוצאה מכך אותה שאלה בדיוק אמורה לייצר בעקרון את אותה תשובה בדיוק בכל פעם (בפועל, גורמים הנדסיים כמו עיבוד-מקבילי על כמה מעבדי-גרפיקה בו-זמנית עלולים עדיין להכניס שונות זעירה, אבל זו תופעת-לוואי טכנית, לא כוונת-עיצוב). בקצה השני, טמפרטורה גבוהה מאוד (למשל 2 ומעלה, תלוי בהגדרות הספציפיות של כל ספק) עלולה להוביל לפלט כאוטי ולעיתים חסר-קוהרנטיות לגמרי — המודל "בורח" לבחירות אקראיות-כמעט שלא נצמדות עוד לדפוסי-שפה תקינים.

בחירת-טמפרטורה לפי משימה, ולמה גבוה לא אומר "חכם יותר"

בחירת-הטמפרטורה הנכונה תלויה לגמרי במשימה. טמפרטורה נמוכה (0 עד כ-0.3) מתאימה למשימות שדורשות דיוק ועקביות — תשובות עובדתיות, חילוץ-מידע ממסמך, כתיבת-קוד, סיווג-טקסט, או כל מקרה שבו "אין מקום לפרשנות יצירתית" ותשובה אחת נכונה ברורה עדיפה. טמפרטורה בינונית (כ-0.5 עד 0.8) מתאימה לשיחה כללית ולרוב יישומי-הצ'אטבוט, כי היא משמרת קוהרנטיות תוך מתן גיוון מספיק שהתשובות לא יישמעו מכניות ומשוננות-בעל-פה. טמפרטורה גבוהה (מעל 1) מתאימה למשימות יצירתיות במפורש — כתיבת-שירה, סיעור-מוחות רעיוני, יצירת-דוגמאות מגוונות למערך-אימון, או כל מקרה שבו מגוון ואי-צפיות הם היעד עצמו, לא בעיה שצריך לצמצם.

חשוב לתקן אי-הבנה נפוצה: טמפרטורה גבוהה לא הופכת את המודל ל"חכם יותר" או "יצירתי יותר" במובן מהותי-קוגניטיבי — היא רק מגדילה את שיעור-האקראיות בבחירת-הטוקנים. במקרים רבים, טמפרטורה גבוהה מדי פשוט מגדילה את סיכוי-ההזיה (Hallucination) — המודל עלול "לבחור" בטוקן פחות-סביר שמוביל אותו לרצף שגוי-עובדתית, לא רק לרצף יצירתי-מעניין. ההבחנה הזו חשובה במיוחד במשימות שבהן דיוק קריטי: הגדלת-טמפרטורה אינה כלי-שיפור-איכות כללי, אלא כלי-שינוי-פרופיל-הסיכון הספציפי בין עקביות לגיוון.

פרמטרים משלימים: Top-K ו-Top-P

טמפרטורה היא רק אחד מכמה פרמטרים שקובעים איך מודל שפה "דוגם" (Sampling) את הטוקן הבא, ולרוב היא לא נבחרת לבד. שני פרמטרים משלימים נפוצים: "דגימת-Top-K" מגבילה את הבחירה לכמות-קבועה של הטוקנים הכי-סבירים בלבד (למשל, רק בין 40 הטוקנים המובילים) לפני שהטמפרטורה חלה עליהם, וכך מונעת מהמודל לבחור בטוקן קיצוני-בלתי-סביר גם בטמפרטורה גבוהה מאוד. "דגימת-Top-P" (הנקראת גם Nucleus Sampling — "דגימת-גרעין"), שהוצגה במאמר-מחקר משפיע מ-2019, גמישה יותר: היא בוחרת את הקבוצה הקטנה-ביותר של טוקנים שסכום-הסתברותם המצטבר עובר סף מסוים (למשל 0.9), כך שגודל-הקבוצה משתנה דינמית לפי המצב — כשמודל בטוח מאוד בבחירה אחת, הקבוצה קטנה; כשההתלבטות רחבה יותר, הקבוצה גדלה בהתאם. המאמר המקורי הראה שהשיטה הזו פותרת בעיה מוכרת בשיטות-דגימה פשוטות יותר: כשמודל "בטוח" בבחירה, שיטת Top-K הקבועה עדיין עלולה לכלול טוקנים חלשים ומיותרים בקבוצת-המועמדים, בעוד Top-P מצטמצם אוטומטית לקבוצה קטנה-ומדויקת יותר במקרים כאלה. שילוב של הפרמטרים האלה — לרוב טמפרטורה יחד עם Top-P — הוא מה שרוב ה-API-ים המסחריים מציעים כברירת-מחדל, כי הוא נותן שליטה עדינה יותר מכל פרמטר בודד.

טמפרטורה בזמן-הרצה מול כוונון בזמן-אימון, ומודלי-חשיבה

חשוב להבחין בין טמפרטורה שנשלטת בזמן-הרצה (Inference Time) לבין שיטות שמכוונות התנהגות-מודל בזמן-אימון. RLHF (למידת-חיזוק מהעדפות אנושיות) וכוונון עדין (Fine-tuning) משנים את המודל עצמו — את המשקלים הפנימיים שלו — כדי לעצב אילו תשובות הוא "רוצה" לתת מלכתחילה; טמפרטורה, לעומת זאת, לא נוגעת במודל בכלל — היא רק קובעת כמה אקראיות להזריק לתהליך-הבחירה מתוך מה שהמודל כבר "יודע". מודל שעבר כוונון להיות זהיר ומדויק עדיין יכול להישלח בטמפרטורה גבוהה ולייצר פלט מגוון ולא-צפוי, ולהפך — טמפרטורה נמוכה על מודל לא-מכוונן עדיין תשקף את כל ההטיות וההגבלות שהמודל למד באימון, רק בלי אקראיות נוספת.

התפתחות "מודלי-חשיבה" (Reasoning Models) מאז סוף 2024 הוסיפה שכבת-מורכבות לשאלת-הטמפרטורה. מודלים כאלה מבצעים תהליך-חשיבה-פנימי ארוך (Chain-of-Thought פנימי) לפני מתן התשובה הסופית, ורוב הספקים ממליצים על טמפרטורה נמוכה במיוחד עבור שלב-החשיבה עצמו — כדי שהשרשרת-הלוגית לא "תסטה" לכיוונים לא-רלוונטיים באמצע התהליך — גם כשהתשובה הסופית עצמה עשויה להיות מנוסחת בטמפרטורה גבוהה יותר. חלק מהספקים אף מגבילים או מבטלים כליל את שליטת-המשתמש בטמפרטורה עבור מודלי-חשיבה מסוימים, בטענה שהאיזון-הפנימי כבר כוונן בקפידה כחלק מתהליך-האימון של המודל, ושינוי-חיצוני שלו עלול לפגוע ביציבות התהליך.

שחזוריות במחקר, ומי בפועל נוגע בפרמטר

בהערכת-ביצועים ובמחקר-אקדמי, טמפרטורה של אפס (או קרובה-לאפס) היא כמעט-תמיד הבחירה הסטנדרטית — לא כי היא "הכי-טובה" באופן מוחלט, אלא כי היא הכרחית לצורך שחזוריות (Reproducibility) מדעית. מבחני-ידע ומיומנות סטנדרטיים (Benchmarks) שמשווים בין מודלים שונים חייבים לרוץ בתנאים דטרמיניסטיים-ככל-האפשר, אחרת הבדל בציון בין שתי הרצות של אותו מודל בדיוק עלול להיראות כמו הבדל-יכולת אמיתי, כשבפועל הוא רק תוצאה של אקראיות-הדגימה. מסיבה זו, השוואות-מודלים שמתפרסמות בעיתונות הטכנית ומדווחות "ציון X על מבחן Y" כוללות כמעט תמיד הנחת-רקע (לרוב לא-מוצהרת במפורש) שההרצה בוצעה בטמפרטורה אפס או קרובה לה — פרט טכני שמשפיע ישירות על עד כמה אפשר לסמוך על השוואה כזו כשמדובר במשימה שבה נועדים להריץ את המודל בפועל בטמפרטורה גבוהה יותר.

מבחינה מעשית, רוב המשתמשים בממשק-צ'אט צרכני רגיל (כמו ChatGPT או Claude בגרסה הצרכנית) לא נחשפים כלל לבקרת-טמפרטורה — הספק כבר בחר ערך-ברירת-מחדל שנחשב מאוזן לרוב השימושים, לרוב סביב 0.7 עד 1.0. הפרמטר הופך רלוונטי בעיקר למפתחים שעובדים ישירות מול API, ובונים אפליקציה שמריצה את אותה שאילתה שוב ושוב במשימה מוגדרת-היטב — למשל שירות שמחלץ מידע ממסמכים בקנה-מידה גדול, שם עקביות בין הרצה להרצה קריטית יותר מגיוון-סגנוני. במקרים כאלה, בחירת-טמפרטורה נמוכה במיוחד היא בדרך-כלל השיקול ההנדסי הראשון והפשוט-ביותר לשיפור-אמינות, עוד לפני מעבר לפתרונות מורכבים יותר כמו אחזור-מוגבר-בייצור (RAG) או כוונון עדין.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

השפעת ערך-הטמפרטורה על אופי הפלט
טמפרטורה 0טמפרטורה 0.7טמפרטורה 1.5 ומעלה
עקביות בין הרצותכמעט-זהה בכל פעםמשתנה במידה מתונהמשתנה מאוד
מתאים במיוחד לעובדות, קוד, חילוץ-מידעשיחה כללית, כתיבה עסקיתשירה, סיעור-מוחות, יצירתיות
סיכון עיקריתשובות משוננות וחוזרותמאוזןחוסר-קוהרנטיות, הזיות

שאלות נפוצות ❓

מה קורה בטמפרטורה 0 בדיוק?

המודל בוחר כמעט-תמיד בטוקן בעל-ההסתברות-הגבוהה-ביותר, כמעט בלי אקראיות — אותה שאלה בדיוק אמורה לתת כמעט תמיד את אותה תשובה.

האם טמפרטורה גבוהה הופכת את המודל "לחכם יותר"?

לא — היא רק מגדילה אקראיות בבחירת-מילים; היא לא משפרת הבנה או ידע, ולעיתים אף מגדילה את הסיכון להזיות.

מה ההבדל בין טמפרטורה ל-Top-P?

שניהם שולטים בדגימת-הטוקן הבא, אך בדרכים שונות — טמפרטורה מעצבת את "חדות" ההתפלגות כולה, ו-Top-P מגביל את קבוצת-המועמדים לפני הבחירה עצמה; ספקים רבים משלבים את שניהם יחד.

איזו טמפרטורה כדאי לבחור עבור צ׳אטבוט שירות-לקוחות?

לרוב נמוכה-בינונית (0 עד 0.5), כי עקביות ודיוק חשובים יותר מגיוון-סגנוני במשימה כזו.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו