הוויכוח RAG מול חלון-הקשר ארוך (RAG vs. Long-Context Debate)

מגמות ועדכונים

הגדרה

הוויכוח RAG מול חלון-הקשר ארוך הוא דיון טכני-תעשייתי מתועד, שהתעורר עם גידול חלונות-ההקשר ב-2024, בשאלה האם עדיף להזין למודל-שפה חלון-הקשר ענק וישיר או להמשיך להיעזר באחזור-מוגבר-בייצור (RAG) שמביא רק את המידע הרלוונטי בזמן השאילתה — דיון שמשתתפות בו מעבדות-מחקר, חברות-כלים ומעבדות-מודלים במקביל, כשהמחקר האמפירי מראה יתרונות שונים לכל גישה.

מאיפה הוויכוח הזה בא

המושגים "חלון-הקשר" ו-RAG עצמם מוסברים בהרחבה בערכים הנפרדים שלהם. הוויכוח המתואר כאן הוא תופעה שונה: דיון תעשייתי ומחקרי שהתעורר ישירות מתוך מירוץ חלון-ההקשר (ראו הערך הנפרד) — ברגע שמודלים כמו Gemini 1.5 של גוגל הציגו ב-2024 חלונות-הקשר של מאות-אלפי ומיליוני טוקנים, עלתה שאלה מעשית: אם אפשר להזין למודל מיליון טוקן בבת-אחת, האם עדיין נחוץ שלב-אחזור נפרד שמחפש קודם את המידע הרלוונטי ורק אז בונה תשובה? השאלה הזו אינה תיאורטית בלבד — היא נבדקה במחקרים עצמאיים של יותר מקבוצת-מחקר אחת, וגם בפרסומים של חברות-כלים שמתמחות בתשתיות-RAG מסחריות, שיש להן אינטרס עסקי ישיר בתוצאה. תשובתן, כפי שיפורט בהמשך, לא הייתה חד-משמעית לאף אחד מהצדדים.

הטיעון בעד חלון-הקשר: פשטות ודיוק-אחזור גבוה

הטיעון המרכזי בעד הזנה ישירה לחלון-הקשר הארוך הוא פשטות הנדסית: אין צורך לבנות צינור-אחזור נפרד, מנגנון-הטמעה (Embedding) ומסד-נתונים וקטורי, ואין סיכון שאלגוריתם-האחזור יפספס מסמך רלוונטי לפני שהמודל בכלל ראה אותו. גוגל תמכה בטיעון הזה בנתונים: לפי הדוח הטכני הרשמי של Gemini 1.5 (2024), המודל השיג דיוק-אחזור של 100 אחוז עד חלון של 530,000 טוקן, ומעל 99.7 אחוז עד מיליון טוקן, במבחני "מחט בערמת-שחת" (Needle in a Haystack) — כלומר איתור פיסת-מידע בודדת שהוטמעה בתוך טקסט ענק. מבחן כזה הוא, לטענת התומכים בגישה, הוכחה שאין עוד צורך לפצל מידע לחתיכות ולסמוך על אלגוריתם-חיפוש שעלול לטעות.

הטיעון בעד RAG: עלות, ודיוק שמתמוטט במשימות אמיתיות

התומכים ב-RAG משיבים בשני טיעונים נפרדים. הראשון הוא עלות: מחקר של חוקרי גוגל (2024, Li ואחרים) מצא ש"כאשר יש מספיק משאבים, חלון-הקשר הארוך עולה בעקביות על RAG במונחי ביצועים ממוצעים. עם זאת, העלות הנמוכה משמעותית של RAG נשארת יתרון מובהק משלה", מכיוון שהזנת מיליון טוקן בכל שאילתה בודדת עולה הרבה יותר מאחזור כמה קטעים רלוונטיים בלבד. הטיעון השני הוא אמפירי: מבחני "מחט בערמת-שחת" קלים באופן לא-ריאלי, ומחקר Databricks שהוצג בסדנת NeurIPS 2024 ובחן 20 מודלים מצא שברוב המודלים דיוק-האחזור במשימות-RAG אמיתיות מתחיל להתדרדר הרבה לפני החלון המרבי המפורסם — לרוב כבר סביב 64,000 טוקן, גם אצל מודלים שמפרסמים חלון גדול בהרבה. מחקר "Lost in the Middle" (2023) תומך באותה מסקנה: מידע שממוקם באמצע חלון-הקשר נוטה "לאבוד" גם כשהוא נמצא טכנית בתוך גבולות החלון.

המחקר שבדק את שתי הגישות ישירות: הפתרון ההיברידי

המחקר המקיף ביותר שהתמודד ישירות עם השאלה הוא "Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach" של חוקרי גוגל (2024). המסקנה שלו הייתה כפולה: חלון-הקשר ארוך עדיף בממוצע כשיש תקציב מספיק, אבל RAG זול משמעותית — ולכן הציעו החוקרים שיטה שלישית בשם SELF-ROUTE: המודל מנסה תחילה לענות מתוך אחזור ממוקד בלבד, ורק אם הוא עצמו מצהיר שהשאלה "אינה ניתנת למענה" מהקטעים שנשלפו — סימן לשאלה מורכבת שדורשת הבנה גלובלית של המסמך — הפנייה מנותבת לחלון-ההקשר המלא — גישה שלפי המחקר שומרת על ביצועים קרובים לחלון-הקשר המלא, תוך הפחתה משמעותית בעלות-החישוב.

איפה זה עומד היום

לקראת סוף 2024 ובמהלך 2025 עבר חלק ניכר מהשיח בתעשייה מהשאלה הבינארית "RAG או חלון-הקשר" לכיוון היברידי: ניתוב שאילתות פשוטות ל-RAG, ושאילתות מורכבות לחלון-הקשר המלא — בדיוק העיקרון שהציע SELF-ROUTE. זהו דיון שממשיך להתפתח, לא הכרעה סגורה: תוצאותיו תלויות במודל הספציפי, באורך-הטקסט ובסוג-המשימה, וכל צד — מעבדות-המודלים הגדולות שדוחפות חלונות-הקשר ענקיים, וחברות-כלים שמתמחות בתשתיות-RAG — ממשיך לפרסם השוואות שתומכות בגישה שהוא עצמו מציע, מה שמחייב קורא זהיר לבדוק מי מפרסם כל השוואה ולא רק מה היא טוענת. מירוץ חלון-ההקשר (ראו הערך הנפרד) הוא הסיבה שהוויכוח הזה בכלל אפשרי — בלעדיו לא הייתה חלופה ריאלית ל-RAG מלכתחילה — אבל שני הדיונים נשארים נפרדים: אחד עוסק ביכולת הטכנית הגולמית, והשני בשאלה איך משתמשים בה נכון בפועל, בסביבת-ייצור אמיתית ולא רק במבחני-מעבדה.

ארבעה מחקרים מרכזיים בוויכוח RAG מול חלון-הקשר
שנהממצא מרכזי
Lost in the Middle (סטנפורד)2023ביצועים יורדים כשמידע רלוונטי נמצא באמצע חלון-הקשר, לא בתחילתו או בסופו
Gemini 1.5 Technical Report (גוגל)2024דיוק-אחזור של מעל 99.7% עד מיליון טוקן במבחני "מחט בערמת-שחת"
RAG or Long-Context LLMs? (גוגל)2024חלון-הקשר עדיף בממוצע כשיש תקציב, אך RAG זול משמעותית; הוצע פתרון-ביניים SELF-ROUTE
Long Context RAG Performance (Databricks)2024רוב המודלים שומרים דיוק עקבי רק עד כ-64,000 טוקן, הרחק מתחת לחלון המרבי המפורסם

שאלות נפוצות ❓

האם RAG הפך מיותר עכשיו שיש חלונות-הקשר של מיליון טוקן?

לא לפי המחקר. גוגל עצמה מצאה שחלון-הקשר עדיף בממוצע כשיש מספיק תקציב-חישוב, אבל RAG נשאר זול משמעותית יותר — ולכן שתי הגישות ממשיכות להתקיים זו לצד זו, לעיתים קרובות כפתרון היברידי.

מה זה SELF-ROUTE?

שיטה שהציעו חוקרי גוגל (2024): המודל מנסה קודם לענות מתוך אחזור ממוקד, ורק כשהוא עצמו מצהיר שאינו יכול לענות כך — הפנייה עוברת לחלון-ההקשר המלא, כדי לשמור על ביצועים קרובים לחלון-המלא בעלות נמוכה יותר.

למה מבחני "מחט בערמת-שחת" לא מספיקים כדי להכריע בוויכוח?

כי הם בודקים איתור פיסת-מידע בודדת וברורה, בעוד שמחקר Databricks מ-NeurIPS 2024 הראה שבמשימות-RAG אמיתיות ומורכבות יותר הדיוק מתחיל להתדרדר הרבה לפני החלון המרבי המפורסם — לרוב כבר סביב 64,000 טוקן.

מה הקשר בין הוויכוח הזה ל"מירוץ חלון-ההקשר"?

מירוץ חלון-ההקשר הוא התחרות בין מעבדות על גודל-היכולת הטכנית; הוויכוח הזה הוא שאלה נפרדת על איך נכון להשתמש ביכולת הזו בפועל. בלי הגידול העצום בחלונות-ההקשר, הוויכוח הזה לא היה מתעורר מלכתחילה.

מהי תופעת "אבוד-באמצע" ולמה היא רלוונטית כאן?

מחקר "Lost in the Middle" (2023) הראה שמידע הממוקם באמצע חלון-הקשר, ולא בתחילתו או בסופו, נוטה להתפספס על-ידי המודל — גם כשהוא נמצא טכנית בתוך גבולות החלון, ולא רק כשהחלון קטן מדי.