מאמר, לא רק ספרייה
בשונה מרוב הכלים בקטגוריה הזו, ל-RAGAS יש מקור אקדמי מתועד: המאמר "Ragas: Automated Evaluation of Retrieval Augmented Generation" מאת שהול אס, ג'יתין ג'יימס, לואיס אספינוסה-אנקה וסטיבן שוקארט, שהוגש ל-arXiv ב-26 בספטמבר 2023. המאמר מציג "הערכה ללא-רפרנס (reference-free) של צינורות RAG" - כלומר מדדים שלא דורשים תשובת-זהב שנכתבה מראש בידי אדם, מה שהופך את ההערכה לזולה-משמעותית להרצה על נפח גדול: אפשר להעריך אלפי שאלות-תשובה בלי לגייס צוות-אנוטציה שיכתוב תשובת-ייחוס לכל אחת.
לפי התקציר, המסגרת בוחנת שלושה ממדים: עד כמה רכיב-השליפה מזהה קטעים רלוונטיים, עד כמה מודל-השפה משתמש בהם במדויק, ואיכות הפלט הסופי עצמו. הפרסום האקדמי הזה - במקום רק פוסט-בלוג או README - הוא חלק ממה שהעניק ל-RAGAS את הלגיטימיות שהפכה אותה למדדי-ברירת-מחדל: חוקרים אחרים יכלו לצטט אותה, להשוות אליה, ולבנות עליה, ולא רק לאמץ אותה כי היא נוחה.
ארבעה מדדים שהפכו לשפה משותפת
מהמאמר צמחה סוללת-מדדים שהשתרשה כשפה משותפת בתעשייה כולה, גם אצל כלים מתחרים. "נאמנות" (Faithfulness) בודקת אם התשובה נשענת על ההקשר שנשלף ולא מכילה טענות שאין להן עיגון בו - כלומר, האם המודל 'המציא' פרט שלא היה בחומר שהובא לו. "דיוק-הקשר" (Context Precision) מודד איזה חלק מהקטעים שנשלפו רלוונטי בפועל לשאלה - שליפה שמביאה חמישה קטעים ורק אחד מהם רלוונטי מקבלת ציון נמוך גם אם התשובה הסופית יצאה נכונה. "כיסוי-הקשר" (Context Recall) בודק אם ההקשר שנשלף מכיל את כל המידע הדרוש כדי לענות על השאלה במלואה. ו"רלוונטיות-תשובה" (Response Relevancy) מודדת עד כמה התשובה עונה בפועל על מה שנשאל, ולא סוטה לכיוון קרוב-אך-לא-מדויק.
לצידם קיימים מדדים נוספים ומתמחים יותר - כיסוי-ישויות-הקשר (Context Entities Recall), רגישות-לרעש (Noise Sensitivity) שבודקת עמידות כשמוזרק מידע לא-רלוונטי להקשר, וגרסאות מולטימודליות של המדדים המרכזיים לאפליקציות שמשלבות תמונות וטקסט. ארבעת המדדים הראשונים בלבד כבר הפכו למונחי-סטנדרט שמפתחי-RAG משתמשים בהם גם כשהם לא מריצים את הספרייה עצמה - סימן ברור לכך שהמסגרת עיצבה איך מדברים על איכות-RAG בכלל.
מ-RAG בלבד לתהליכי-עבודה סוכניים
השם עדיין נושא את ה-RAG שבבסיסו, אבל המסגרת התרחבה מעבר לכך: התיעוד הרשמי מציין ש"יש מדדים זמינים ליישומים ומשימות שונות, כמו RAG ותהליכי-עבודה סוכניים (agentic workflows)". ההרחבה הזו הגיונית: סוכן שמבצע שליפה כחלק משרשרת-כלים ארוכה יותר סובל מאותה בעיה בדיוק - האם המידע שהוא הביא באמת רלוונטי, והאם התשובה הסופית נאמנה לו - רק שעכשיו יש עוד צעדים באמצע (קריאות-כלים נוספות, החלטות-ניתוב) שגם הם עשויים לסטות מהמידע שנשלף.
RAGAS משתלבת ישירות עם מסגרות כמו לאנגצ'יין, כך שאפשר להריץ את המדדים שלה כחלק מלולאת-הפיתוח הרגילה בלי לבנות שכבת-הערכה מאפס. בפועל, כשמפתח מריץ pipeline של RAG בתוך לאנגצ'יין ורוצה לדעת אם שינוי בפרומפט-השליפה שיפר את האיכות, הוא יכול לקרוא לפונקציית-RAGAS ישירות על תוצאות-הריצה בלי לעבור דרך פלטפורמה חיצונית כלל.
רישיון וקהילה
RAGAS מופצת ברישיון Apache-2.0, פתוח יותר מבחינה מסחרית מ-ELv2 (פיניקס) ומאפשר שימוש חופשי כולל בפרויקטים קנייניים, בלי אף הגבלה על הצעתה כחלק ממוצר מתחרה. המאגר הציבורי שלה צבר כ-15.8 אלף כוכבים ב-GitHub ו-1.7 אלף פיצולים - מספרים שמראים שהיא הפכה לתלות סטנדרטית בפרויקטי-RAG רבים, ולא רק לכלי-מחקר נישתי שנשאר בגבולות האקדמיה. הרישיון הפתוח-לחלוטין הזה, יחד עם המקור האקדמי, כנראה תרמו לכך שהמדדים שלה אומצו כדי-פנימי בתוך פלטפורמות מתחרות ולא רק כמוצר-קצה עצמאי.
מה היא לא: לא פלטפורמה, אלא ספריית-מדדים
ההבדל המהותי בין RAGAS לבין רוב שאר הכלים בקטגוריה הזו הוא סוג-המוצר. לאנגסמית', לאנגפיוז, פיניקס ו-Braintrust הן פלטפורמות מלאות עם ממשק, אחסון-עקבות ולוחות-בקרה. RAGAS היא ספריית-פייתון שמחשבת ציונים - והיא מיועדת להיות מוזרקת לתוך פלטפורמות כאלה, לא להחליף אותן. בפועל, לאנגסמית', לאנגפיוז ופיניקס כולן תומכות בהרצת מדדי-RAGAS בתוך צינור-ההערכה שלהן, כך שצוות יכול לבחור פלטפורמה אחת לתצוגה ולניהול, ולהשתמש ב-RAGAS כמנוע-הציונים שמזין אותה.
זה ממקם אותה כרובד "מה למדוד", בזמן שהפלטפורמות האחרות מספקות את הרובד "איך לצפות בזה רץ ולאחסן את התוצאה". ההפרדה הזו בין 'שכבת-מדדים' ל'שכבת-פלטפורמה' היא בעצמה תבנית-ארכיטקטורה שהתבססה בקטגוריה, ו-RAGAS היא הדוגמה הבולטת ביותר לצד ה'מדדים' של אותה תבנית.
מגבלה מובנית: שופט מבוסס-מודל
כמו כל מדד מבוסס LLM-as-judge, גם מדדי RAGAS - נאמנות, רלוונטיות ואחרים - נשענים על מודל-שפה שמעריך את הפלט, לא על כלל דטרמיניסטי. המשמעות היא שאיכות-ההערכה כבולה מלמעלה לאיכות מודל-השיפוט שבוחרים להריץ, ותוצאות עשויות להשתנות במקצת בין ריצות או בין גרסאות-מודל שונות - צוות שמשווה ציון-נאמנות שחושב מול GPT-4 לציון שחושב מול מודל אחר עלול להסיק מסקנות שגויות אם הוא לא שם-לב להבדל.
זו לא ביקורת ייחודית ל-RAGAS - היא חלה על כל כלי בקטגוריה שמשתמש בשיפוט-מודל, כולל תכונות ה-LLM-as-judge שאצל לאנגסמית', לאנגפיוז, פיניקס ו-Braintrust - אבל היא הסיבה שהמסגרת משלבת גם מדדים דטרמיניסטיים-יותר (כמו חישובי-חפיפה טקסטואלית) לצד המדדים מבוססי-השיפוט, כדי לא להישען אך ורק על שכבת-שיפוט אחת.
מאמר שממשיך להתעדכן
המאמר המכונן לא נשאר קפוא בגרסתו המקורית: לפי arXiv, הוא הוגש לראשונה ב-26 בספטמבר 2023 ותוקן לאחרונה באפריל 2025 - כמעט שנה וחצי של עדכונים לאחר הפרסום הראשוני. זה משקף דבר חשוב לגבי איך מסגרות-הערכה כמו RAGAS מתפתחות בפועל: לא כמאמר-חד-פעמי שמפרסמים ושוכחים, אלא כמסמך-חי שמתעדכן במקביל להתפתחות הספרייה עצמה ולביקורת שהיא צוברת מהקהילה שמשתמשת בה. זו תבנית שונה מהותית ממבחנים כמו SWE-bench, שבהם הגרסה המקורית נשארת יציבה והתפתחות מתבטאת בעיקר בוריאנטים נפרדים (Verified, Lite) ולא בעדכון המאמר המקורי עצמו.
התמזגות-מקורות הזו - מאמר אקדמי שממשיך להתעדכן לצד ספרייה שממשיכה להתפתח בקוד - נדירה יחסית בתחום מדעי-המחשב, שבו לרוב מאמר נשאר מוקפא ברגע הפרסום וכל שיפור-המשך מתפרסם כמאמר נפרד. הבחירה של הכותבים להמשיך לעדכן את אותו מאמר עצמו מקלה על מי שרוצה לצטט מקור-אחד יציב, אבל גם דורשת תשומת-לב: ציטוט למאמר מ-2023 לא בהכרח משקף את הגרסה העדכנית ביותר של המתודולוגיה.
מה שהמדדים-המקוריים לא נבנו למדוד
ארבעת המדדים המרכזיים - נאמנות, דיוק-הקשר, כיסוי-הקשר ורלוונטיות-תשובה - נולדו כדי לענות על שאלות שמתאימות ל-pipeline קלאסי של 'שאלה, שליפה, תשובה' בצעד אחד. סוכן שמבצע כמה סבבי-שליפה, מחליט-בעצמו מתי לחפש שוב, ומשלב תוצאות מכמה כלים לפני שהוא עונה - מציב שאלות נוספות שהמדדים המקוריים לא תוכננו במפורש לענות עליהן, כמו 'האם רצף-החלטות-הכלים היה יעיל' ולא רק 'האם התשובה הסופית נאמנה למה שנשלף בסוף'. זו הסיבה הסבירה להרחבת התיעוד הרשמי כך שיכלול גם "מדדים... לתהליכי-עבודה סוכניים" באופן מפורש, ולא רק למדדי-RAG המקוריים.
ההרחבה הזו ממחישה דפוס רחב יותר בקטגוריה: כלי-הערכה שנולדו סביב מקרה-שימוש צר (RAG חד-שלבי) נדרשים כל הזמן להתרחב כדי לכסות את המורכבות הנוספת שסוכנים-רב-שלביים מכניסים, ולא תמיד ברור מראש אם מדד שתוכנן למקרה הפשוט ממשיך להיות תקף בגרסה המורכבת יותר.
הרחבות סביב הליבה
מעבר לארבעת המדדים המרכזיים, RAGAS כוללת גם יכולות שמסייעות להפעיל אותם בקנה-מידה: יצירה אוטומטית של מערכי-בדיקה (test set generation) מתוך מסמכי-המקור של האפליקציה עצמה, כך שצוות לא צריך לכתוב ידנית מאות שאלות-בדיקה לפני שהוא יכול להתחיל להעריך. זו תוספת מעשית שמקטינה את המחסום-הראשוני להתחיל להשתמש במסגרת - בלי מערך-בדיקה, אין למה להריץ את המדדים מלכתחילה, וכתיבה ידנית של מערך כזה יכולה לעצור צוותים קטנים עוד לפני שהם מתחילים.
השילוב הזה - מדדים סטנדרטיים בצד אחד, וכלי-עזר ליצירת-נתוני-בדיקה בצד השני - הוא חלק ממה שהפך את RAGAS לנקודת-כניסה נפוצה לצוותים שרק מתחילים לבנות תהליך-הערכה סדור למערכת-RAG, ולא רק לצוותים מנוסים שכבר יודעים בדיוק אילו שאלות לשאול.
למה זה שייך לקטגוריית כלים-וסוכנים
RAGAS שונה מרוב שאר שבעת הכלים כאן בכך שהיא לא פלטפורמה שאפשר להראות בסקרינשוט אחד - היא מסגרת-מדדים. אבל היא זכאית למקום בקטגוריה בדיוק כי היא הגדירה בפועל אוצר-מילים משותף לתחום שלם: לפני המאמר מ-2023, כל צוות שבנה מערכת-RAG המציא בעצמו איך למדוד 'האם התשובה טובה' - לפעמים בהשוואה-אנושית ידנית, לפעמים בחפיפת-מילים גולמית. "נאמנות", "דיוק-הקשר" ו"כיסוי-הקשר" הפכו למונחי-תקן שגם כלים מתחרים מיישמים ומציגים בממשק שלהם, מה שממחיש איך ספרייה יכולה 'לשנות פרקטיקה' בלי להיות מוצר-קצה בפני עצמה.
האבחנה הזו חשובה גם כדי להסביר למה RAGAS לא מיותרת לצד הפלטפורמות המלאות בקטגוריה: היא לא מתחרה בהן על שכבת-התצוגה והניהול, אלא מספקת את שכבת-ה'מה נכון למדוד' שהן עצמן בחרו לאמץ במקום להמציא מחדש.