מודל שפה גדול (LLM)

מודלים ושפה

מודל שפה גדול (LLM — Large Language Model) הוא רשת נוירונים מסוג טרנספורמר שאומנה על כמויות עצומות של טקסט: ספרים, אתרי אינטרנט, פורומים, קוד. משימת האימון עצמה פשוטה להפליא — לחזות את הטוקן הבא ברצף נתון — אבל כשמבצעים אותה על מיליארדי דוגמאות, בקנה מידה של לעיתים מאות מיליארדי פרמטרים, נוצר מודל שיודע הרבה יותר מסתם "לנחש את המילה הבאה".

מהיכולת הבסיסית הזו צומחות יכולות שאף אחד לא תכנת במפורש: כתיבה זורמת, תרגום בין שפות, סיכום מסמכים ארוכים, מענה לשאלות, ואפילו כתיבת קוד תוכנה. התופעה נקראת "יכולות מתפתחות" (emergent abilities) — הן לא היו קיימות במודלים קטנים יותר, והופיעו רק כשגדל מספיק הן היקף הנתונים והן גודל המודל. ChatGPT, Claude ו-Gemini הם כולם ממשקי-שיחה שנבנו סביב מודלים כאלה.

חשוב לזכור את הגבול: המודל לא "מבין" בשום מובן אנושי — הוא מנבא את הרצף הסביר ביותר סטטיסטית, בהתבסס על תבניות שראה באימון. בגלל זה הוא עלול להזות מידע שגוי בביטחון מלא, במיוחד בשאלות על עובדות ספציפיות שלא הופיעו בבירור בחומר האימון — ולכן תמיד כדאי לבדוק עובדות קריטיות במקור עצמאי.