דלג לתוכן

אחזור-מוגבר-בייצור (RAG)

מודלים ושפה

הגדרה

אחזור-מוגבר-בייצור (RAG) היא טכניקה שבה מודל AI מחפש קודם מידע ממקור חיצוני, ורק אז בונה ממנו תשובה — כדי לצמצם הזיות ולהישען על מקורות אמיתיים.

💡 דוגמה

שואלים את Perplexity שאלה. לפני שהוא עונה, הוא מחפש באתרים, קורא, ורק אז כותב תשובה עם קישורים למקורות. כמו אדם שבודק בספר עיון לפני שהוא עונה.

מה זה RAG וכיצד הוא בנוי מבחינה טכנית

אחזור-מוגבר-בייצור (RAG — Retrieval-Augmented Generation) הוא ארכיטקטורה שמחברת שני רכיבים נפרדים: מנוע-חיפוש שמאחזר מידע רלוונטי ממאגר-נתונים חיצוני, ומודל שפה גדול (LLM) שמנסח מהמידע הזה תשובה בשפה טבעית. הרעיון המרכזי, שהוצג לראשונה במאמר מחקר של חברת Facebook AI (כיום Meta) ב-2020, הוא לתת למודל "לעיין במקורות" לפני שהוא עונה, בדיוק כמו אדם שבודק ספר-עיון לפני שהוא משיב לשאלה, במקום להסתמך אך ורק על מה ש"שינן" באימון. השם עצמו מתאר את התהליך בשני שלבים: אחזור (Retrieval) של מסמכים רלוונטיים, ואז יצירה (Generation) של תשובה על בסיסם.

מבחינה טכנית, RAG בנוי משלושה שלבים עיקריים. ראשית, מסמכי-המקור (מדריכים פנימיים, מאמרים, תיעוד-מוצר) מפוצלים לקטעים קטנים (Chunks) ומומרים להטמעה וקטורית (Embedding) — ייצוג מספרי שמלכוד את המשמעות הסמנטית של כל קטע, ונשמר במאגר ייעודי שנקרא מסד-נתונים וקטורי (Vector Database). כאשר משתמש שואל שאלה, השאלה עצמה מומרת לאותו סוג ייצוג וקטורי, והמערכת מאתרת את הקטעים הקרובים ביותר לה במרחב הווקטורי — לא לפי התאמת-מילים מדויקת, אלא לפי קרבה במשמעות. לבסוף, הקטעים שנמצאו מוזנים יחד עם השאלה המקורית למודל השפה, שמנסח מהם תשובה קוהרנטית ומצטטת-מקור.

שימושים בפועל ויתרון הגמישות על-פני אימון-מחדש

השימוש הנפוץ ביותר ב-RAG הוא לחבר צ'אטבוט ארגוני למאגר-ידע פנימי שהמודל מעולם לא ראה באימון — תיעוד-מוצר עדכני, מסמכי-מדיניות, או ארכיון תמיכת-לקוחות — כדי שהתשובות יתבססו על המידע האמיתי והעדכני של הארגון, ולא רק על מה שהיה זמין ברשת בזמן אימון המודל. כלים כמו Perplexity AI (מנוע-חיפוש מבוסס-AI) בנויים על הרעיון הזה מהיסוד: כל תשובה מלווה בקישורי-מקור לאתרים שאוחזרו בזמן-אמת. גם עוזרי-תכנות מודרניים משתמשים בגרסה של RAG כדי לאחזר קטעי-קוד רלוונטיים מתוך פרויקט שלם לפני הצעת שינוי, במקום להסתמך רק על מה שהמודל "זוכר" מהאימון הכללי שלו.

היתרון המרכזי של RAG על פני אימון-מחדש של מודל הוא הגמישות: כדי לעדכן את הידע של מערכת RAG מספיק להוסיף מסמך חדש למאגר — תהליך שלוקח דקות ולא דורש אימון-מודל יקר מחדש. זו הסיבה שגישה זו הפכה נפוצה כל-כך בעולם הארגוני מאז 2023: לפי סקרי-שוק מ-2026, רוב יישומי-ה-LLM בסביבת ייצור כוללים כיום רכיב-RAG כלשהו, בעיקר משום שהוא נותן מענה בו-זמנית לשלוש בעיות נפרדות — הזיות, מידע לא-עדכני, ופרטיות (המידע הרגיש נשאר במאגר הארגוני הפרטי ולא נכנס לאימון מודל חיצוני).

מ-RAG נאיבי לייצור: חיפוש היברידי והזיה מבוססת-מקור

יישום RAG "נאיבי" — חלוקה גסה של מסמכים, ואיחזור פשוט של שלושת הקטעים הכי-דומים — מתפקד סביר בדוגמאות-הדגמה אך נשבר תחת דרישות-ייצור אמיתיות: איחזור עלול לפספס את הקטע הרלוונטי באמת אם החלוקה נעשתה בנקודה לא-מתאימה, והמודל עלול "להזות" מתוך הידע הכללי שלו כשהקטעים שהובאו אליו לא באמת עונים על השאלה. כדי להתמודד עם זה, מערכות-ייצור מודרניות משלבות "חיפוש היברידי" — שילוב של חיפוש-סמנטי-וקטורי עם חיפוש מבוסס-מילות-מפתח קלאסי (כמו BM25) — יחד עם שלב "דירוג-מחדש" (Reranking) שמסנן ומסדר-מחדש את התוצאות המועמדות לפי רלוונטיות אמיתית לפני שהן מגיעות למודל, ולפי בדיקות-שוק, השילוב הזה משפר את דיוק-האיחזור בכ-5 עד 15 אחוזים לעומת חיפוש וקטורי בלבד.

חשוב להבין: RAG מצמצם הזיות משמעותית אבל לא מבטל אותן. אם המאגר עצמו מכיל מידע שגוי או מיושן, המודל עלול "לצטט בביטחון" את הטעות כאילו הייתה עובדה מאומתת — התופעה נקראת לעיתים "הזיה מבוססת-מקור". גם כשהאיחזור מוצלח, המודל עדיין עלול לפרש לא-נכון את הקטעים שהובאו אליו, במיוחד כשהם סותרים זה את זה או כשהשאלה דורשת שילוב-מסקנות בין כמה מסמכים במקום ציטוט ישיר מאחד מהם. בגלל זה מערכות RAG רציניות כוללות שכבת-בדיקה שמעריכה את איכות-האיחזור עצמו, לא רק את איכות התשובה הסופית.

RAG מול חלופות: כוונון-עדין, חלון-הקשר, עלות ואבטחה

RAG לא היחיד בדרכים לתת למודל גישה למידע שהוא לא אומן עליו — הוא מתחרה משלים לשתי גישות אחרות: כוונון עדין (Fine-tuning), שמאמן-מחדש חלק מהמודל על הנתונים הספציפיים באופן שמטמיע את הידע "לתוך" משקלי המודל עצמו; והרחבת חלון-ההקשר (Context Window) — פשוט להזין את כל המסמך הרלוונטי כחלק מהשאילתה, בלי שלב-איחזור נפרד, גישה שהפכה ריאלית יותר ככל שחלונות-ההקשר של המודלים המובילים גדלו למיליון טוקן ומעלה. לכל גישה יש נקודת-חוזק שונה, ולעיתים קרובות פתרונות-ייצור אמיתיים משלבים את השלוש יחד: כוונון עדין להתאמת סגנון-תשובה, RAG לעדכניות ולעובדות ספציפיות, וחלון-הקשר להזנת מסמך בודד ורלוונטי-ישירות כשמדובר בכמות-מידע קטנה מספיק.

עלות התפעול השוטף היא שיקול מעשי נוסף. כל שאילתה במערכת RAG דורשת לפחות שתי קריאות למודל (אחת ליצירת ההטמעה-הווקטורית של השאלה, ואחת ליצירת התשובה עצמה) בנוסף לחיפוש במאגר-הווקטורי, מה שמייקר ומאט כל תשובה בהשוואה לשאילתה ישירה למודל בלי איחזור. ככל שהמאגר גדל למיליוני מסמכים, גם עלות האחסון והאינדוקס של הווקטורים הופכת לשיקול תפעולי משמעותי, ולכן ארגונים רבים משתמשים בטכניקת "מטמון סמנטי" — שמירת תשובות לשאלות דומות שכבר נשאלו, כדי לחסוך את מחזור-האיחזור-והיצירה המלא בכל פעם מחדש.

לבסוף, RAG חושף גם סיכון-אבטחה ייחודי לו שנקרא "הרעלת-איחזור" (Retrieval Poisoning): אם תוקף מצליח להחדיר מסמך זדוני למאגר שהמערכת שואבת ממנו — למשל דרך תוכן שנשלט חיצונית כמו דף-אינטרנט או קובץ שהועלה על ידי משתמש — הוא עלול להטות את תשובות המערכת בלי לגעת במודל השפה עצמו בכלל. הבעיה הזו הפכה נושא-מחקר פעיל במיוחד ככל ש-RAG השתלב במערכות-סוכן (AI Agent) שמבצעות פעולות בפועל על בסיס מה שהן "קוראות", לא רק מציגות טקסט למשתמש אנושי.

התפתחות: מהמאמר המקורי ב-2020 ועד RAG אגנטי

המאמר המקורי משנת 2020, "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks", נכתב על ידי צוות מ-Facebook AI Research בהובלת פטריק לואיס, ובחן בתחילה בעיקר משימות סגורות יחסית כמו מענה-על-שאלות מתוך ויקיפדיה. מאז, הרעיון התרחב הרבה מעבר לכוונה המקורית: גרסאות מתקדמות כמו GraphRAG (Microsoft, 2024) בונות גרף-קשרים בין ישויות בתוך המסמכים במקום להסתפק בקטעי-טקסט בודדים, מה שמאפשר תשובות טובות יותר לשאלות שדורשות חיבור-מסקנות בין כמה מקורות ("מי היה המנכ״ל כשהחברה נרכשה?") ולא רק שליפת-עובדה בודדת ("מתי נוסדה החברה?").

מגמה בולטת נוספת מ-2025-2026 היא "RAG אגנטי" (Agentic RAG): במקום סבב-איחזור בודד וקבוע-מראש, המודל עצמו מחליט באופן דינמי כמה סבבי-חיפוש הוא צריך, מנסח-מחדש את השאילתה אם התוצאות הראשוניות לא מספקות, ולעיתים משלב כמה מאגרי-מידע שונים לפני שהוא מרכיב תשובה סופית — למעשה, שילוב בין RAG לבין ההתנהגות האוטונומית-יותר שמאפיינת סוכן בינה מלאכותית. הגישה הזו יקרה ואיטית יותר לכל שאילתה, אבל משפרת משמעותית את הדיוק במשימות מורכבות שדורשות איסוף-מידע ממקורות מרובים.

האם חלונות-הקשר הגדולים מייתרים RAG, ואיך מודדים איכות

הגדילה הדרמטית של חלונות-הקשר אצל מודלים מובילים — למיליון טוקן ומעלה אצל חלק מהם נכון ל-2026 — עוררה שאלה לגיטימית: האם עדיין יש טעם ב-RAG, אם אפשר פשוט "לזרוק" מסמך שלם לתוך הפרומפט? המחקר עד כה מצביע על כך שהתשובה תלויה בהיקף: עבור מסמך בודד או קומץ-מסמכים, הזנה ישירה אכן יכולה להתחרות ב-RAG וגם לפשט את הארכיטקטורה. אך גם עם חלון-הקשר ענק, מודלים סובלים מתופעה שנקראת "אבוד-באמצע" (Lost in the Middle) — נטייה לשים-לב פחות למידע שממוקם באמצע קלט ארוך מאשר למידע שבתחילתו או בסופו — ולכן עבור מאגרי-ידע ארגוניים גדולים באמת (אלפי מסמכים ומעלה), איחזור ממוקד עדיין עולה בביצועים, בעלות ובמהירות על הזנת-הכול.

הערכת איכות מערכת RAG בפועל מחייבת למדוד שני דברים נפרדים ולא רק אחד: איכות-האיחזור (האם הקטעים שנשלפו אכן רלוונטיים לשאלה) ואיכות-היצירה (האם התשובה הסופית נאמנה לקטעים שסופקו לה, ולא "בורחת" מהם בחזרה למה שהמודל "זוכר" מהאימון הכללי). מסגרות-הערכה ייעודיות כמו RAGAS פותחו בדיוק כדי לתת ציון נפרד לכל אחד מהמדדים הללו, כי מערכת יכולה להצליח באחד ולהיכשל בשני — למשל לשלוף בדיוק את הקטעים הנכונים ועדיין לייצר מהם תשובה לא-מדויקת.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש דרכים לתת למודל שפה גישה למידע חדש
RAGכוונון עדיןחלון-הקשר המורחב
עדכון ידע חדשמיידי — מוסיפים מסמך למאגרדורש אימון מחדשמיידי — מזינים בפרומפט
עלות שוטפת לשאילתהבינונית (איחזור + יצירה)נמוכה (כמו שאילתה רגילה)גבוהה ככל שהקלט ארוך יותר
מתאים במיוחד למאגרי-ידע גדולים ומתעדכניםסגנון והתנהגות עקבייםמסמך בודד או מעטים, קצרי-טווח
מפחית הזיות?כן, משמעותיתלא ישירותכן, אם המידע לא "אבד באמצע"

🎯 נסו בעצמכם · 2 דקות

שאלו צ'אטבוט שאלה על מסמך שלכם — פעם בלי לצרף אותו, ופעם אחרי שהעליתם אותו. השוו: באיזו תשובה יש פרטים מהמסמך עצמו?

מתוך מונח השבוע של Wiki-AI.

שאלות נפוצות ❓

האם RAG מבטל הזיות לגמרי?

לא. הוא מצמצם אותן משמעותית כי המודל עונה ממקורות אמיתיים ולא רק מהזיכרון שלו, אבל אם המקור עצמו שגוי או שהמודל מפרש אותו לא נכון, ההזיה עדיין יכולה לקרות.

מה ההבדל בין RAG לחיפוש רגיל באינטרנט?

חיפוש רגיל מחזיר רשימת קישורים שהמשתמש צריך לקרוא בעצמו; RAG שולף את המידע הרלוונטי ומנסח ממנו תשובה מוכנה, בדרך כלל עם ציטוט למקור.

האם RAG יקר להפעיל?

יקר יותר משאילתה רגילה למודל, כי נדרש גם שלב-חיפוש, אבל בדרך כלל זול משמעותית מכוונון עדין של מודל שלם.

איזה סוג ארגון הכי נהנה מ-RAG?

ארגון עם מאגר-ידע פנימי גדול ומתעדכן — תיעוד מוצר, ארכיון תמיכה, מדיניות פנימית — שרוצה שהצ׳אטבוט יענה מהמידע העדכני שלו ולא רק מידע כללי מהאינטרנט.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו