RAG סוכני (Agentic RAG)

כלים וסוכנים

הגדרה

RAG סוכני הוא דפוס-ארכיטקטורה שבו סוכן-AI שולט באופן פעיל במחזור-האחזור עצמו — מתכנן אילו מקורות לחפש, מבקר את איכות התוצאות שחזרו, ומחליט אם לאחזר שוב — במקום סבב-אחזור בודד וקבוע-מראש.

מה משתנה כשסוכן שולט במחזור-האחזור

אחזור-מוגבר-בייצור (RAG) רגיל, כפי שמתואר בערך הייעודי לו באתר הזה, מבצע סבב-אחזור אחד וקבוע-מראש: השאלה מומרת להטמעה וקטורית, נשלפים הקטעים הדומים ביותר לה, והם מוזנים למודל שמנסח מהם תשובה. RAG סוכני הוא דפוס-ארכיטקטורה שבו סוכן-AI (ראו הערך סוכן בינה מלאכותית) שולט באופן פעיל במחזור הזה עצמו, ולא רק בניסוח התשובה הסופית ממנו: הסוכן מחליט אילו מקורות לפנות אליהם, מעריך אם התוצאות שחזרו מספיקות בכלל כדי לענות על השאלה, ומחליט האם לאחזר שוב — עם שאילתה מנוסחת-מחדש, ממקור אחר, או בשילוב כמה מקורות. סקירה מקיפה בשם "Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG", שפורסמה בינואר 2025 על ידי אדיטי סינג (Aditi Singh), אבול אהטשם (Abul Ehtesham) ועמיתיהם, מנסחת את הדפוס הזה כהרחבה של RAG רגיל בעזרת ארבעה מרכיבים-סוכניים מוכרים: רפלקציה, תכנון, קריאה-לכלים, ושיתוף-פעולה בין כמה סוכנים. הסקירה מציעה גם טקסונומיה לסיווג ארכיטקטורות-RAG-סוכני, לפי ארבעה צירים: מספר-הסוכנים המעורבים (סוכן בודד מול כמה סוכנים), מבנה-הבקרה (רצף קבוע מול תיאום אדפטיבי), רמת-האוטונומיה, ואופן ייצוג-הידע.

תכנון מראש: פירוק שאלה מורכבת לפני שמתחילים לאחזר

מרכיב נוסף שמבדיל RAG סוכני מ-RAG רגיל הוא שלב-תכנון שמתרחש עוד לפני סבב-האחזור הראשון: כשהשאלה מורכבת ומכילה בתוכה כמה תת-שאלות — למשל "השווה בין המדיניות של שתי החברות בנושא X, והסבר למה ההבדל נוצר" — סוכן שמתכנן מראש יפרק אותה למשימות-משנה נפרדות, יחפש עבור כל משימה בנפרד, ורק אז ירכיב את כל התשובות-החלקיות לכדי תשובה אחת מלוכדת. זה שונה מ-RAG רגיל, שמזין את השאלה המורכבת כמות שהיא לחיפוש-וקטורי בודד ומקווה שהתוצאה תכסה את כל חלקיה בבת-אחת — גישה שנוטה להחמיץ תת-שאלות ששונות מהותית זו מזו במשמעות הסמנטית שלהן, גם כשהן מנוסחות באותה שאלה.

שתי טכניקות-יסוד: Self-RAG ו-CRAG

שתי טכניקות שפורסמו עוד לפני שהמונח "RAG סוכני" הפך שגור ממחישות איך זה עובד בפועל. Self-RAG, שהציגו אקארי אסאי (Akari Asai) ועמיתיה באוקטובר 2023, מאמנת את המודל עצמו לפלוט אסימוני-רפלקציה (Reflection Tokens) ייעודיים: אסימונים שמחליטים באופן דינמי אם בכלל נחוץ אחזור לשאלה הנוכחית, ואסימונים נוספים שמדרגים את הרלוונטיות של כל קטע שאוחזר ואת האמינות של התשובה שהמודל עצמו ניסח ממנו. לפי המאמר, הגישה הזו עלתה בביצועים על מודלים גדולים יותר כמו ChatGPT במשימות מענה-על-שאלות-פתוחות, הסקה ואימות-עובדות. CRAG (Corrective Retrieval-Augmented Generation), שהציגו שי-צ'י יאן (Shi-Qi Yan) ועמיתיו בינואר 2024, ניגשת לבעיה מהכיוון ההפוך: מעריך-אחזור קליל בודק כל קטע שנשלף ומחזיר ציון-ביטחון; כשהציון נמוך, המערכת מפעילה פעולה מתקנת — למשל חיפוש-אינטרנט משלים כדי להביא מידע איכותי יותר — ומריצה אלגוריתם פירוק-והרכבה-מחדש שמסנן מתוך הקטעים שנאחזרו רק את החלקים הרלוונטיים באמת.

מימוש בפועל: לולאת אחזור-דירוג-ניסוח-מחדש

בפרקטיקה, RAG סוכני מיושם לרוב כלולאת-מצבים מפורשת ולא כ"קסם" סמוי בתוך פרומפט אחד. LangChain מתעדת דוגמה כזו ברשומת-בלוג בשם "Self-Reflective RAG with LangGraph" מפברואר 2024: המערכת מאחזרת קטעים, מדרגת את רלוונטיותם, ואם כולם נמצאים לא-רלוונטיים היא מנסחת-מחדש את השאלה ומנסה לאחזר שוב; רק כשיש קטעים מספקים היא עוברת לניסוח תשובה, ואז מדרגת גם את התשובה עצמה לפי מידת-ההיאחזות שלה במקורות. LlamaIndex, מסגרת-עבודה מתחרה, מגדירה "RAG סוכני" כאחד משימושי-הדגל שלה — עוזר-מחקר מוגבר-הקשר שלא רק עונה על שאלות פשוטות אלא מבצע משימות-מחקר מורכבות באמצעות פירוק-שאלה למשימות-משנה, בחירת-כלי מתאים לכל משימה, ותכנון הסדר שבו לבצע אותן.

ההבדל בין RAG סוכני לבין מחקר עמוק

ההבדל בין RAG סוכני לבין הערך מחקר עמוק (Deep Research) באתר הזה מטושטש לעיתים, אבל יש לו עיגון במקור: Anthropic עצמה, ברשומת-הנדסה מיוני 2025 בשם "How we built our multi-agent research system", מנגידה את המערכת שלה במפורש מול "גישות מסורתיות המשתמשות ב-RAG": "גישות מסורתיות המשתמשות ב-RAG משתמשות באחזור סטטי... לעומת זאת, הארכיטקטורה שלנו משתמשת בחיפוש רב-שלבי שמאתר מידע רלוונטי באופן דינמי ומסתגל לממצאים חדשים" — ו-Anthropic ממסגרת את המערכת שלה עצמה כתכונת "מחקר" (Research), לא כ"RAG סוכני". ההבדל המעשי: RAG סוכני הוא דפוס-הארכיטקטורה הכללי — כל מערכת שבה סוכן שולט במחזור-האחזור עונה על ההגדרה, גם אם היא סוכן בודד שמריץ שני סבבי-חיפוש על מסד-נתונים ארגוני פנימי. מחקר עמוק הוא קטגוריית-מוצר ספציפית שמיישמת בדיוק את אותו רעיון בקנה-מידה גדול הרבה יותר — לרוב בעזרת כמה סוכנים שמחפשים במקביל ברחבי האינטרנט הפתוח, ומרכיבים מהממצאים דוח ארוך ומצוטט. במילים אחרות: כל מחקר-עמוק הוא, במובן הארכיטקטוני, גם RAG סוכני — אבל לא כל RAG סוכני הוא מחקר-עמוק.

סוכן בודד מול כמה סוכנים: שתי צורות של RAG סוכני

הטקסונומיה שמציעה הסקירה מ-2025 מבחינה גם בין RAG סוכני בסוכן בודד לבין RAG סוכני רב-סוכני. בגרסה החד-סוכנית, אותו סוכן אחד אחראי גם על תכנון-החיפוש, גם על ביצועו וגם על ביקורת-התוצאות — בדיוק כמו הלולאה שמתארת LangChain ב-LangGraph. בגרסה הרב-סוכנית, התפקידים הללו מתחלקים בין כמה סוכנים ייעודיים: סוכן-תכנון שמפרק את השאלה למשימות-משנה, סוכן-אחזור אחד או יותר שכל אחד מתמחה במקור-מידע אחר (מסד-נתונים וקטורי, מנוע-חיפוש-אינטרנט, מסד-SQL ארגוני), וסוכן-ביקורת שמעריך את איכות-התוצרים לפני שהם מגיעים לשלב-הניסוח הסופי. הרב-סוכניות מאפשרת מקביליות — כמה סוכני-אחזור יכולים לחפש בו-זמנית במקורות שונים — אבל מוסיפה גם עלות-תיאום בין הסוכנים עצמם, מעבר לעלות-האחזור הבסיסית.

מתי הסוכן מפסיק לאחזר: קריטריוני-עצירה

מכיוון שסבב-אחזור נוסף תמיד יכול, לפחות תיאורטית, לשפר מעט את איכות-התשובה, מערכות RAG סוכני בפועל חייבות קריטריון-עצירה מפורש — אחרת הלולאה עלולה להימשך בלי-סוף. הקריטריונים הנפוצים ביותר הם שילוב של תקציב-קשיח (מספר מרבי מוגדר-מראש של סבבי-חיפוש שהמערכת מרשה לעצמה, בלי קשר לאיכות-התוצאה) וסף-ביטחון (ברגע ששלב-הביקורת — כמו זה שמתאר CRAG — מדרג את התוצאות כמספקות דיו, הלולאה נעצרת גם אם עוד לא מוצה התקציב). הבחירה בין העדפת תקציב-קשיח להעדפת סף-איכות היא בעצמה החלטת-עיצוב עם השלכות מנוגדות: תקציב-קשיח נמוך מבטיח עלות צפויה אך עלול לעצור לפני שהתשובה מספיק טובה, וסף-איכות עשוי לספק תשובה מדויקת יותר אך בעלות בלתי-צפויה מראש — בדיוק המתח שהסקירה מ-2025 מכנה אתגר באופטימיזציית-ביצועים.

הערכת-איכות ב-RAG סוכני: מעבר למדידת סבב בודד

כלי-הערכה סטנדרטיים ל-RAG (כמו RAGAS, שמוזכר בערך אחזור-מוגבר-בייצור) נבנו במקור למדוד סבב-אחזור-ויצירה בודד: כמה רלוונטיים הקטעים שנשלפו, וכמה נאמנה התשובה להם. ב-RAG סוכני, שבו יש כמה סבבים ברצף, ההערכה מורכבת יותר — צריך לבחון לא רק את התשובה הסופית אלא גם את איכות-ההחלטות בדרך: האם הסוכן זיהה נכון מתי התוצאות הראשוניות לא מספיקות, האם ניסוח-מחדש של השאלה אכן שיפר את האיחזור, והאם מספר-הסבבים שנבחר היה סביר ביחס לתועלת שהתקבלה. כלי-הערכה ייעודיים לסוכנים, כמו אלה שמתוארים בערך הערכת סוכנים (Agent Evaluation) באתר הזה, נועדו בדיוק לגשר על הפער הזה — להעריך את התהליך כולו, לא רק את התוצר הסופי שלו.

יישום נפוץ: עוזרי-קוד שמחפשים בבסיס-קוד ענק

דוגמה מוחשית ליישום RAG סוכני שאינה קשורה כלל לחיפוש-אינטרנט: עוזר-תכנות שעובד על בסיס-קוד גדול. חיפוש-וקטורי בודד עשוי להחזיר את קטעי-הקוד הדומים ביותר מילולית לשאילתה, אך לפספס קובץ רלוונטי שמנוסח אחרת לגמרי. סוכן שמיישם RAG סוכני יכול להתחיל בחיפוש רחב, לבדוק אם התוצאות מכסות את כל מה שדרוש להבנת המשימה — למשל האם נמצאו גם הבדיקות הרלוונטיות וגם ההגדרות שמהן משתמש הקוד — ולהריץ חיפוש נוסף וממוקד יותר במידת הצורך, לפני שהוא בכלל מציע שינוי בקוד.

RAG סוכני מול בינה מלאכותית אגנטית באופן כללי

כדאי גם להבדיל בין RAG סוכני לבין בינה מלאכותית אגנטית (Agentic AI) באופן כללי, שיש לה ערך נפרד ורחב יותר באתר הזה. בינה מלאכותית אגנטית מתארת כיוון-התפתחות רחב של כל תחום ה-AI לעבר מערכות שפועלות באופן עצמאי לאורך זמן להשלמת מטרות מורכבות — קריאה-לכלים, תכנון, ביצוע-רב-שלבי, לאו דווקא סביב אחזור-מידע כלל. RAG סוכני הוא יישום ממוקד של אותו עיקרון-כללי בתחום ספציפי אחד: איך סוכן שולט במחזור-האחזור שלו. כל RAG סוכני הוא, במידה מסוימת, ביטוי של בינה מלאכותית אגנטית — אבל רוב מה שנכלל תחת בינה מלאכותית אגנטית (למשל סוכן שמזמין טיסה או כותב קוד) אינו RAG סוכני כלל, כי אין בו רכיב-אחזור-מידע מרכזי.

המחיר: יותר סבבים, יותר עלות, קושי-הערכה

כל סבב-אחזור נוסף, כל שלב-ביקורת וכל ניסוח-מחדש של השאלה הם קריאה נוספת למודל-שפה — כך שהעלות והזמן-לתשובה של RAG סוכני עולים באופן ישיר עם מספר-הסבבים שהסוכן בוחר להריץ, בניגוד לסבב-אחזור הבודד והצפוי-מראש של RAG רגיל. הסקירה מ-2025 מציינת במפורש שהרחבת הדפוס הזה בקנה-מידה מעוררת אתגרים בהערכת-איכות ואופטימיזציית-ביצועים, בדיוק בגלל שאי-אפשר לדעת מראש כמה סבבים ייקח לסוכן להגיע לתשובה — מה שמקשה גם על תקצוב עלויות מראש וגם על בניית מבחני-הערכה עקביים שמשווים בין ארכיטקטורות שונות.

שלוש רמות של שליטה באחזור
RAG רגילRAG סוכנימחקר עמוק (Deep Research)
מספר סבבי-אחזורקבוע — סבב אחדדינמי — הסוכן מחליט כמהדינמי, בדרך כלל רב-סוכני ומקביל
מקור המידעמאגר-ידע אחד מוגדר-מראשכמה מקורות, לפי בחירת הסוכןבעיקר האינטרנט הפתוח
עלות וזמן לתשובהנמוכים וצפוייםעולים עם מספר הסבביםהגבוהים ביותר — לרוב דקות
מתאים במיוחד לשאילתות-עובדה פשוטותמשימות שדורשות בירור איכות-תוצאותמחקר פתוח ודוחות ארוכים

שאלות נפוצות ❓

מה ההבדל בין RAG סוכני ל-RAG רגיל?

RAG רגיל מבצע סבב-אחזור בודד וקבוע-מראש; ב-RAG סוכני הסוכן עצמו שולט במחזור — מחליט אילו מקורות לבדוק, מעריך אם התוצאות מספיקות, ומחליט אם לאחזר שוב.

מה זה Self-RAG ו-CRAG?

שתי טכניקות-יסוד: Self-RAG מאמנת את המודל להחליט בעצמו מתי לאחזר ולבקר את איכות התוצאות; CRAG משתמשת במעריך-אחזור נפרד שמפעיל חיפוש-משלים כשהתוצאות שנשלפו לא מספיק אמינות.

מה ההבדל בין RAG סוכני למחקר עמוק?

RAG סוכני הוא דפוס-ארכיטקטורה כללי; מחקר עמוק הוא קטגוריית-מוצר ספציפית שמיישמת את אותו רעיון בקנה-מידה גדול, לרוב עם כמה סוכנים שמחפשים במקביל באינטרנט הפתוח.

האם RAG סוכני תמיד עדיף על RAG רגיל?

לא. הוא יקר ואיטי יותר בגלל סבבי-האחזור המרובים, ולכן משתלם בעיקר במשימות מורכבות שדורשות איסוף-מידע ממקורות מרובים — לא בשאילתות-עובדה פשוטות.