חלון-הקשר כזירת-תחרות: למה זה בכלל "מירוץ"
חלון-ההקשר (Context Window) הוא כמות הטקסט שמודל-שפה מביא בחשבון בבת-אחת בעת מענה — המושג עצמו וההשלכות הטכניות שלו מוסברים בהרחבה בערך הנפרד "חלון-הקשר". מה שהופך את הגודל הזה למגמה מתועדת ולא רק לפרמטר-טכני הוא האופן שבו הוא הפך, החל מ-2023, למספר שכל חברת-AI מובילה מציגה בכותרת הודעת-ההשקה שלה ומשווה ישירות מול המתחרות: הודעות-ההשקה של OpenAI, Anthropic, Google ו-Meta לאורך 2023–2025 פתחו כמעט תמיד בגודל חלון-ההקשר החדש כהישג מרכזי, וסיקור טכני-עיתונאי עצמאי חזר והציג את המספרים האלה זה מול זה כמדד-תחרות ישיר. זה בדיוק המבחן שמבדיל תופעה כזו מתיאור של מוצר בודד: אי-אפשר להסביר את הגידול הזה בלי להצביע על ארבע חברות נפרדות שרצות זו מול זו על אותו ציר, בערך-בו-זמנית.
ציוני-הדרך המתועדים: מ-2,048 טוקן למיליוני טוקנים
הנקודה ההתחלתית המתועדת היא GPT-3 של OpenAI, שיצא במאי 2020 עם חלון-הקשר של 2,048 טוקן בלבד. GPT-4 המקורי (מרץ 2023) הרחיב זאת ל-8,000 טוקן בגרסת-ברירת-המחדל, ועד 32,000 טוקן בגרסת-API מיוחדת. באותה תקופה בדיוק זינקה אנתרופיק קדימה: ב-11 במאי 2023 הודיעה החברה שהיא מרחיבה את חלון-ההקשר של קלוד מ-9,000 ל-100,000 טוקן. OpenAI הגיבה בכנס ה-DevDay הראשון שלה, ב-6 בנובמבר 2023, בהצגת GPT-4 Turbo עם חלון-הקשר של 128,000 טוקן. ב-21 בנובמבר 2023 הכריזה אנתרופיק על קלוד 2.1 עם 200,000 טוקן, לדבריה-שלה כפול מהחלון הקודם. גוגל נכנסה למירוץ ב-15 בפברואר 2024 עם Gemini 1.5 Pro: חלון-הקשר סטנדרטי של 128,000 טוקן, עד מיליון טוקן בסביבת-ייצור, ועד 10 מיליון טוקן שנבדקו במחקר. Meta עקפה את כולם רשמית ב-5 באפריל 2025, כשהיא הציגה את Llama 4 Scout עם חלון-הקשר של 10 מיליון טוקן — לעומת 128,000 טוקן בלבד ב-Llama 3 הקודם, לפי הצהרת החברה עצמה.
הפריצה ההנדסית: למה זה בכלל התאפשר
הגידול הזה לא היה רק החלטה עסקית — הוא חייב פריצות-דרך הנדסיות אמיתיות. מנגנון-הקשב (Attention) הקלאסי בארכיטקטורת הטרנספורמר צורך משאבי-חישוב שגדלים בחדות עם אורך-הטקסט, מה שהפך חלונות של מאות-אלפי טוקנים ליקרים מדי או איטיים מדי בשנים הראשונות. הקפיצה מ-128,000 למיליוני טוקנים אצל גוגל נשענה, לפי הדוח הטכני הרשמי של Gemini 1.5, על ארכיטקטורת תערובת-מומחים (Mixture-of-Experts) — שבה רק חלק מפרמטרי-הרשת מופעלים בכל חישוב בודד, מה שמאפשר להריץ הקשר עצום בלי לשלם את מלוא העלות החישובית על כל טוקן. אותו עיקרון של הפעלה חלקית-בלבד מופיע גם בארכיטקטורת Llama 4 Scout. במילים אחרות: המירוץ הזה לא נבחן רק בהצהרות-שיווק אלא גם בשאלה אילו מעבדות-מחקר הצליחו לפתור את בעיית-היעילות שמנעה מהחלון לגדול קודם לכן.
המספר המפורסם מול הביצוע בפועל
לצד המירוץ על המספר הגדול ביותר, התפתח דיון-ביקורתי מתועד בדבר הפער בין חלון-הקשר "מפורסם" לביצוע אפקטיבי. מחקר "Lost in the Middle" של חוקרים מסטנפורד (2023) הראה שביצועי מודלי-שפה גבוהים בהרבה כשמידע רלוונטי נמצא בתחילת הטקסט או בסופו, ויורדים משמעותית כשהוא נמצא באמצע חלון-הקשר — גם במודלים שמפרסמים חלון ארוך במיוחד. מחקר מקיף יותר של חוקרי Databricks, שהוצג בסדנת NeurIPS 2024 ובחן 20 מודלים מסחריים וקוד-פתוח, מצא שרק מעטים מהמודלים המתקדמים ביותר שומרים על דיוק-תשובה עקבי בצינור-RAG מלא מעל 64,000 טוקן, בעוד שרובם מגיעים לרמה קבועה כבר סביב 16,000–32,000 טוקן — הרחק מתחת לחלונות של מאות-אלפי או מיליוני טוקנים שמפורסמים להם. בפוסט-הבלוג הנלווה, שבחן 13 מודלים, פירטו החוקרים שכל מודל "נשבר" בדפוס שונה משלו: Claude 3 Sonnet, למשל, הראה קפיצה בכשלים מטעמי-זכויות-יוצרים מ-3.7 אחוזים ב-16,000 טוקן ל-49.5 אחוזים ב-64,000 טוקן, ואילו DBRX איבד יכולת ביצוע-הוראות מ-5.2 אחוזים ל-50.4 אחוזים בין 8,000 ל-32,000 טוקן. הממצאים האלה הפכו את שאלת "החלון האפקטיבי" לממד תחרותי בפני עצמו, לצד המספר הגולמי.
החיבור לוויכוח RAG מול חלון-הקשר
הגדילה העצומה בחלון-ההקשר היא הסיבה הישירה לוויכוח נפרד ומתועד: האם עדיין נחוץ אחזור-מוגבר-בייצור (RAG) כשאפשר, לכאורה, להזין למודל מיליון טוקן בבת-אחת? הדיון הזה מפורט בערך הנפרד "הוויכוח RAG מול חלון-הקשר ארוך", שכן הוא סוגיה בפני עצמה עם מחקרים ותשובות משלה, ולא רק תוצר-לוואי של המירוץ המתואר כאן. חשוב להבחין ביניהם: מירוץ חלון-ההקשר הוא תחרות על גודל-היכולת הטכנית בין מעבדות; הוויכוח על RAG הוא שאלה נפרדת על האופן הנכון להשתמש ביכולת הזו בפועל — שתי תופעות קשורות זו לזו, אך לא זהות.