מודלים ושפה
כל מה שקשור למודלי-שפה גדולים (Large Language Models) — הטכנולוגיה שמאחורי ChatGPT וכלים דומים — ולאופן שבו הם מבינים ומייצרים טקסט.
מה תמצאו כאן תשובה עליו
אם כל מה שהוא עושה זה לנחש את המילה הבאה, איך יוצא מזה טקסט שנשמע כאילו הוא מבין אותי?
למה הוא ממציא פרטים בביטחון מלא, ומה אפשר לעשות כדי שיישען על מקור אמיתי?
למה הוא שוכח דברים שאמרתי קודם באותה שיחה, ולמה זה מחמיר ככל שהשיחה מתארכת?
למה אותה בקשה בדיוק מחזירה לי בכל פעם תשובה קצת אחרת?
מתי באמת צריך לאמן מודל משלי, ומתי מספיק לנסח את הבקשה טוב יותר או לצרף לה מסמכים?
מאיפה מתחילים
- מודל שפה גדול (LLM)מודל שפה גדול (LLM) הוא מודל AI שאומן על כמויות ענק של טקסט ולמד לחזות את המילה הבאה ברצף — הבסיס לכלים כמו ChatGPT, Claude ו-Gemini.
- טוקן (Token) אם תקראו רק אחדטוקן (Token) הוא יחידת הטקסט הבסיסית שמודל שפה "רואה" — לרוב חלק ממילה, לא מילה שלמה.
- חלון הקשר (Context Window)חלון הקשר (Context Window) הוא כמות הטקסט שמודל שפה "זוכר" ומביא בחשבון בו-זמנית בשיחה אחת.
עוד על הקטגוריה הזו
הקטגוריה מכסה את הארכיטקטורה שהפכה את המודלים האלה לאפשריים (טרנספורמר ומנגנון תשומת-הלב שלו), את התהליך שהופך טקסט גולמי לקלט שמודל יכול לעבד (טוקניזציה), ואת שלבי האימון שהופכים מודל "גולמי" לעוזר שימושי ובטוח יחסית (כוונון-מונחה, למידת-חיזוק מהעדפות אנושיות ושיטות דומות). כמו כן מכוסים כאן מונחים מעשיים לשימוש יומיומי במודלים — מה זו הנדסת-פרומפט, מה ההבדל בין מודל בסיס למודל מכוון, ואילו פרמטרים משפיעים על הפלט (כמו דגימת Top-k/Top-p). זו אחת הקטגוריות הגדולות והמתפתחות ביותר באתר, כי מודלי-השפה הם הטכנולוגיה שמניעה כיום את מרבית תשומת-הלב הציבורית סביב AI — וגם התחום שבו הטרמינולוגיה משתנה הכי מהר. המונחים כאן נכתבו כך שיישארו רלוונטיים גם למי שרק מתחיל להשתמש בכלים כמו ChatGPT וגם למי שרוצה להבין את המנגנון הטכני שמאחוריהם. שימו לב שהמונחים כאן מתעדכנים באופן שוטף — שיטות אימון וגדלי-מודל שנחשבו חדשניים לפני שנה כבר עשויות להיות סטנדרט מיושן, וזה חלק בלתי-נפרד מקצב ההתפתחות של התחום.
מה לא נמצא כאן
כאן נמצא מה ששייך למודל-השפה עצמו: איך הוא בנוי, איך מאמנים אותו ואיך פונים אליו. מושג למידה כללי, כמו איך מודל לומד מנתונים מלכתחילה, שייך ליסודות בינה מלאכותית; מערכת שבנויה מעל המודל ומבצעת משימות שייכת לכלים וסוכנים; יצירת תמונה, קול או וידאו שייכת לתמונה, קול ווידאו; ומודל בשם מסחרי שייך כאן, והחברה שמאחוריו נמצאת בחברות AI גלובליות.
א
ג
- ג'יני (Genie)⭐ מורחב
- ג'מיני (Gemini)⭐ מורחב
- גיגהצ'אט (GigaChat)⭐ מורחב
- גרוק (Grok)⭐ מורחב
ה
ט
כ
מ
- מבוכיות (Perplexity)
- מודל אוטורגרסיבי (Autoregressive Model)
- מודל יסוד (Foundation Model)
- מודל ראייה-שפה (VLM)⭐ מורחב
- מודל שפה גדול (LLM)⭐ מורחב
- מודל שפה כשופט (LLM-as-a-Judge)⭐ מורחב
- מודל-הנמקה (Reasoning Model)⭐ מורחב
- מטמון KV (KV Cache)⭐ מורחב
- מנגנון קשב (Attention Mechanism)
- מסד נתונים וקטורי (Vector Database)
- מענה על שאלות (Question Answering)⭐ מורחב
- משקלים פתוחים (Open Weights)
פ
ק
ת
אנגלית / ראשי-תיבות
- BERT⭐ מורחבמודל-הבנה של גוגל, שולב במנוע-החיפוש שלה ב-2019
- BLOOM⭐ מורחב
- BPE (קידוד-זוגות-בתים)⭐ מורחב
- Chinchillaמודל-שפה בן 70 מיליארד, הביס את Gopher בן 280 מיליארד
- Claude Fable 5⭐ מורחבמודל-הדגל של Anthropic, בשתי גרסאות-גישה
- CLIP⭐ מורחבמודל לקישור תמונה-טקסט, אומן על 400 מיליון זוגות
- DeepSeek-R1⭐ מורחבפתוח-משקלים תחת MIT; ההשקה שהצניחה את מניית NVIDIA בכ-17%
- DPO (אופטימיזציית העדפה ישירה)
- EvalPlus⭐ מורחבביקורת-מבחנים: 19–29% מציוני HumanEval לא היו אמינים
- Gemini 3.8 Flash⭐ מורחבמודל מהיר של גוגל לסוכנים ולקוד
- Gemini 4 Argon⭐ מורחב
- Gemma⭐ מורחב
- GLM⭐ מורחב
- GPT-2⭐ מורחבמודל-שפה שאומן על 8 מיליון דפים מקישורים ב-Reddit
- GPT-3.5⭐ מורחבמשפחת-מודלים של OpenAI; חינמית ב-ChatGPT עד יולי 2024
- GPT-4⭐ מורחבהמודל ש-OpenAI הפסיקה לפרסם את מספר הפרמטרים שלו
- GPT-4o⭐ מורחבמודל-הדגל הראשון שניתן גם בשכבה החינמית של ChatGPT
- GPT-5⭐ מורחבדור המודלים של OpenAI מאוגוסט 2025, עם נתב שמחליט מתי לחשוב
- GPT-6⭐ מורחבדור המודלים של OpenAI, בשלוש דרגות-יכולת
- GPT-J⭐ מורחבמודל-שפה פתוח בסגנון GPT-3; ענף-הצל GPT-4chan עורר סערה
- GPT-OSS⭐ מורחב
- Granite⭐ מורחב
- Huawei Pangu⭐ מורחב
- InstructGPT⭐ מורחבמודל בן 1.3 מיליארד שהועדף על פני GPT-3 בן ה-175
- Jamba2⭐ מורחב
- Kimi⭐ מורחב
- LaMDA⭐ מורחבמודל-שיחה עם 137 מיליארד פרמטרים; הפעיל את Bard ב-2023
- Llama⭐ מורחבמודלי Meta שאפשר להוריד, אך ה-OSI קבע שאינם קוד-פתוח
- LoRA (התאמה-נמוכת-דרגה)
- Mambaארכיטקטורת-רשת ללא קשב; משולבת ב-Jamba, הסקה מהירה פי-5
- Mixtral⭐ מורחבמודל-שפה עם 46.7 מיליארד פרמטרים, רק 12.9 פעילים
- MMLU-Pro⭐ מורחבאמת-מידה מוקשחת ל-MMLU; 10 אפשרויות-תשובה במקום 4
- Muse Spark⭐ מורחבמודל-ההנמקה הסגור של Meta, שמפעיל את Meta AI
- Nemotron⭐ מורחב
- OpenAI o1⭐ מורחב74.4% ב-AIME מול 9.3% ל-GPT-4o — פתח את עידן דגמי-ההנמקה
- PaLM⭐ מורחבמודל-שפה של גוגל שאומן על 6,144 שבבי TPU בו-זמנית
- Phi⭐ מורחב
- Q²מדד מהאוניברסיטה העברית, שואל שאלות על התשובה ומשווה
- RLHF (למידת-חיזוק מהעדפות אנושיות)⭐ מורחב
- SQuAD⭐ מורחבבנצ'מרק, לא מאגר-אימון — יותר מ-100,000 שאלות על ויקיפדיה
- T5⭐ מורחבמודל גוגל שהוליד את מאגר C4 ושימש גם בתוך Imagen
- Tencent Hy (Hunyuan)⭐ מורחב
- The Pile⭐ מורחבמאגר טקסט פתוח לאימון מודלי שפה, מ-22 מקורות
- word2vec⭐ מורחבשיטת מיקולוב שבה מלך פחות גבר ועוד אישה נותן מלכה
- Xiaomi MiMo⭐ מורחב
📋 קריטריונים לבחירת הערכים בקטגוריה זו
נכנס לכאן מונח ששייך ספציפית למודלי-שפה גדולים: איך הם בנויים, איך מאמנים אותם, איך פונים אליהם ואיך מודדים אותם. הסף: מונח שקורא נתקל בו בפועל כשהוא משתמש בכלים כאלה או קורא עליהם, לא כל וריאציה מחקרית שפורסמה. מושג למידה כללי שייך ליסודות בינה מלאכותית; ארגון בשם מסוים — חברה, עמותה או תאגיד — שייך לקטגוריות החברות, גם כשהמוצר שלו מתואר כאן, ואילו מודל בשם — GPT-4, קלוד, ג'מיני — נכנס דווקא לכאן, כי הוא מושא הקטגוריה עצמה; מערכת שבנויה מעל מודל ומבצעת משימות שייכת לכלים וסוכנים. הזרקת פרומפט ופריצת מודל נמצאות דווקא כאן ולא בבטיחות ואתיקה, מפני שהן תוקפות את המודל עצמו — הדיון הציבורי בסיכונים נמצא שם.