מאיפה הוויכוח הזה בא
המושגים "חלון-הקשר" ו-RAG עצמם מוסברים בהרחבה בערכים הנפרדים שלהם. הוויכוח המתואר כאן הוא תופעה שונה: דיון תעשייתי ומחקרי שהתעורר ישירות מתוך מירוץ חלון-ההקשר (ראו הערך הנפרד) — ברגע שמודלים כמו Gemini 1.5 של גוגל הציגו ב-2024 חלונות-הקשר של מאות-אלפי ומיליוני טוקנים, עלתה שאלה מעשית: אם אפשר להזין למודל מיליון טוקן בבת-אחת, האם עדיין נחוץ שלב-אחזור נפרד שמחפש קודם את המידע הרלוונטי ורק אז בונה תשובה? השאלה הזו אינה תיאורטית בלבד — היא נבדקה במחקרים עצמאיים של יותר מקבוצת-מחקר אחת, וגם בפרסומים של חברות-כלים שמתמחות בתשתיות-RAG מסחריות, שיש להן אינטרס עסקי ישיר בתוצאה. תשובתן, כפי שיפורט בהמשך, לא הייתה חד-משמעית לאף אחד מהצדדים.
הטיעון בעד חלון-הקשר: פשטות ודיוק-אחזור גבוה
הטיעון המרכזי בעד הזנה ישירה לחלון-הקשר הארוך הוא פשטות הנדסית: אין צורך לבנות צינור-אחזור נפרד, מנגנון-הטמעה (Embedding) ומסד-נתונים וקטורי, ואין סיכון שאלגוריתם-האחזור יפספס מסמך רלוונטי לפני שהמודל בכלל ראה אותו. גוגל תמכה בטיעון הזה בנתונים: לפי הדוח הטכני הרשמי של Gemini 1.5 (2024), המודל השיג דיוק-אחזור של 100 אחוז עד חלון של 530,000 טוקן, ומעל 99.7 אחוז עד מיליון טוקן, במבחני "מחט בערמת-שחת" (Needle in a Haystack) — כלומר איתור פיסת-מידע בודדת שהוטמעה בתוך טקסט ענק. מבחן כזה הוא, לטענת התומכים בגישה, הוכחה שאין עוד צורך לפצל מידע לחתיכות ולסמוך על אלגוריתם-חיפוש שעלול לטעות.
הטיעון בעד RAG: עלות, ודיוק שמתמוטט במשימות אמיתיות
התומכים ב-RAG משיבים בשני טיעונים נפרדים. הראשון הוא עלות: מחקר של חוקרי גוגל (2024, Li ואחרים) מצא ש"כאשר יש מספיק משאבים, חלון-הקשר הארוך עולה בעקביות על RAG במונחי ביצועים ממוצעים. עם זאת, העלות הנמוכה משמעותית של RAG נשארת יתרון מובהק משלה", מכיוון שהזנת מיליון טוקן בכל שאילתה בודדת עולה הרבה יותר מאחזור כמה קטעים רלוונטיים בלבד. הטיעון השני הוא אמפירי: מבחני "מחט בערמת-שחת" קלים באופן לא-ריאלי, ומחקר Databricks שהוצג בסדנת NeurIPS 2024 ובחן 20 מודלים מצא שברוב המודלים דיוק-האחזור במשימות-RAG אמיתיות מתחיל להתדרדר הרבה לפני החלון המרבי המפורסם — לרוב כבר סביב 64,000 טוקן, גם אצל מודלים שמפרסמים חלון גדול בהרבה. מחקר "Lost in the Middle" (2023) תומך באותה מסקנה: מידע שממוקם באמצע חלון-הקשר נוטה "לאבוד" גם כשהוא נמצא טכנית בתוך גבולות החלון.
המחקר שבדק את שתי הגישות ישירות: הפתרון ההיברידי
המחקר המקיף ביותר שהתמודד ישירות עם השאלה הוא "Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach" של חוקרי גוגל (2024). המסקנה שלו הייתה כפולה: חלון-הקשר ארוך עדיף בממוצע כשיש תקציב מספיק, אבל RAG זול משמעותית — ולכן הציעו החוקרים שיטה שלישית בשם SELF-ROUTE: המודל מנסה תחילה לענות מתוך אחזור ממוקד בלבד, ורק אם הוא עצמו מצהיר שהשאלה "אינה ניתנת למענה" מהקטעים שנשלפו — סימן לשאלה מורכבת שדורשת הבנה גלובלית של המסמך — הפנייה מנותבת לחלון-ההקשר המלא — גישה שלפי המחקר שומרת על ביצועים קרובים לחלון-הקשר המלא, תוך הפחתה משמעותית בעלות-החישוב.
איפה זה עומד היום
לקראת סוף 2024 ובמהלך 2025 עבר חלק ניכר מהשיח בתעשייה מהשאלה הבינארית "RAG או חלון-הקשר" לכיוון היברידי: ניתוב שאילתות פשוטות ל-RAG, ושאילתות מורכבות לחלון-הקשר המלא — בדיוק העיקרון שהציע SELF-ROUTE. זהו דיון שממשיך להתפתח, לא הכרעה סגורה: תוצאותיו תלויות במודל הספציפי, באורך-הטקסט ובסוג-המשימה, וכל צד — מעבדות-המודלים הגדולות שדוחפות חלונות-הקשר ענקיים, וחברות-כלים שמתמחות בתשתיות-RAG — ממשיך לפרסם השוואות שתומכות בגישה שהוא עצמו מציע, מה שמחייב קורא זהיר לבדוק מי מפרסם כל השוואה ולא רק מה היא טוענת. מירוץ חלון-ההקשר (ראו הערך הנפרד) הוא הסיבה שהוויכוח הזה בכלל אפשרי — בלעדיו לא הייתה חלופה ריאלית ל-RAG מלכתחילה — אבל שני הדיונים נשארים נפרדים: אחד עוסק ביכולת הטכנית הגולמית, והשני בשאלה איך משתמשים בה נכון בפועל, בסביבת-ייצור אמיתית ולא רק במבחני-מעבדה.