פיניקס של Arize (Arize Phoenix)

כלים וסוכנים

הגדרה

פיניקס של Arize (Arize Phoenix) היא ספריית קוד-פתוח לנצפות, הערכה וניסויים על אפליקציות וסוכני-AI, שמפתחת חברת Arize AI ומבוססת על תקן-המעקב OpenInference שהחברה עצמה יצרה מעל OpenTelemetry.

מחברת-ניטור-ML לכלי-סוכנים פתוח

Arize AI היא חברה שהתמחתה במקור בניטור מודלי-machine-learning קלאסיים בפרודקשן - זיהוי-סחיפת-נתונים (data drift), ירידת-דיוק וכדומה, עוד לפני שעולם ה-LLM והסוכנים היה קיים בצורתו הנוכחית. פיניקס היא הזרוע הפתוחה שלה לעולם הזה: "פלטפורמת נצפות-AI בקוד פתוח שנועדה לניסוי, הערכה ואיתור-תקלות", כלשון האתר הרשמי. מי שצריך תשתית-ניהול מלאה יכול לעבור למוצר המסחרי המקביל, Arize AX, אבל - וזו נקודה מרכזית - "אותו מכשור מבוסס-OpenTelemetry/OpenInference עובד עם שניהם", כך שמעבר בין הגרסה הפתוחה לגרסה המנוהלת לא דורש לכתוב מחדש את שכבת-האיסוף.

הרקע הזה - חברה שכבר ניהלה מוצר-ניטור מסחרי ל-ML קלאסי לפני עידן ה-LLM - מבדיל את Arize מרוב שאר השחקנים בקטגוריה, שרובם נולדו ישירות מתוך גל-הסוכנים של 2023-2024. הניסיון הקודם הזה ניכר בהחלטות-עיצוב של פיניקס: התמקדות באגנוסטיות לספק ולמסגרת, ולא בהידוק סביב מסגרת-אחת ספציפית.

OpenInference: תקן שהם כתבו בעצמם

בזמן שחלק מהמתחרים מתבססים על מוסכמות-הסמנטיקה הרשמיות של OpenTelemetry ל-GenAI (ראו נצפוּת סוכנים), Arize כתבה מפרט מקביל משלה בשם OpenInference. לפי המאגר הרשמי, זהו "אוסף של מוסכמות ותוספים שמשלים את OpenTelemetry כדי לאפשר מעקב אחרי אפליקציות-AI", ומטרתו "לספק תובנה על הפעלת מודלי-שפה וההקשר הסובב אותם - שליפה ממאגרי-וקטורים, שימוש בכלים חיצוניים כמו מנועי-חיפוש או ממשקי-API". התקן "נתמך באופן טבעי בפיניקס וב-Arize AX, אבל אפשר להשתמש בו עם כל backend תואם-OpenTelemetry". בפועל זה אומר שמכשור שנכתב לפי OpenInference לא נועל את המשתמש דווקא למוצרי Arize - מה שהחברה עצמה מדגישה כשהיא כותבת שהפלטפורמה "בנויה על גבי OpenTelemetry, ואגנוסטית לספק, לשפה ולמסגרת-פיתוח".

הבחירה לכתוב תקן-מכשור עצמאי, ולא להסתפק במוסכמות-ה-GenAI הרשמיות של OpenTelemetry, מעידה על תזמון: OpenInference פותח בזמן שמוסכמות ה-GenAI הרשמיות עדיין היו (ונשארות, לפי תיעוד OpenTelemetry עצמו) בסטטוס Development בלבד. Arize בחרה להוביל בעצמה במקום לחכות לתקן-רשמי סופי, מה שהעניק לה יתרון-תזמון על חשבון יצירת שכבת-תרגום נוספת שמפתחים צריכים להכיר.

ארבע יכולות סביב לולאת-שיפור אחת

התיעוד הרשמי מתאר את פיניקס כמי שמעניקה "תהליך-עבודה לדיבוג ואיטרציה". "מעקב" מאפשר "לראות מה קרה במהלך ריצה בודדת של האפליקציה, צעד אחר צעד" - כולל קריאות-מודל, שליפה, שימוש-בכלים ולוגיקה מותאמת-אישית. "הערכה" מודדת את "איכות-הפלט", עם ניקוד על-ידי מעריכי-LLM, בדיקות-קוד או תיוג-אנושי. "הנדסת-פרומפטים" מאפשרת "לשכלל הנחיות תוך שימוש בדוגמאות אמיתיות מהאפליקציה", עם ניהול-גרסאות ובדיקת-חלופות ויכולת-החזרה (replay) על עקבה קיימת. ו"מערכי-נתונים וניסויים" מאפשרים "לבדוק שינויים באופן שיטתי על אותם קלטים" ו"להשוות תוצאות-הערכה כדי לאשר שהשינוי אכן שיפר ביצועים".

פיניקס מוסיפה גם סוכן מובנה משלה, PXI, שמיועד "לדבג עקבות ולשכלל פרומפטים בהקשר" - כלומר להשתמש בסוכן-AI כדי לנתח את הפלט של סוכני-AI אחרים, וכן שילוב עם סוכן-קידוד שיכול להגדיר מכשור באופן אוטומטי בקוד קיים. זה מציב את פיניקס בקצה-המתקדם של מגמה רחבה בקטגוריה - שימוש בסוכן כדי לפקח ולשפר סוכן אחר, ולא רק להציג לו-אדם דוחות.

רישיון ELv2: פתוח, אבל לא MIT

פיניקס מופצת תחת Elastic License 2.0 (ELv2) - רישיון-קוד-פתוח, אבל עם הגבלות מסחריות ספציפיות (בעיקר על הצעת המוצר עצמו כשירות מתחרה ל-Arize). זה שונה מ-MIT (לאנגפיוז, Promptfoo) ומ-Apache-2.0 (RAGAS), ומשקף מודל נפוץ אצל חברות שרוצות לשמור על קוד-פתוח נגיש למפתחים תוך הגנה על נתיב-ההכנסה המסחרי שלהן - בעיקר מפני שחברות-ענן גדולות יציעו את אותו המוצר כשירות-מתחרה בלי להשקיע בפיתוחו. בהקשר של הקטגוריה כולה, שלושת סוגי-הרישוי (MIT מלא, ELv2 מוגבל, ו'open core' עם תיקיית-ee נפרדת אצל לאנגפיוז) מייצגים שלוש נקודות-איזון שונות בין פתיחות למודל-עסקי בר-קיימא.

אימוץ

המאגר הציבורי של פיניקס צבר מעל 11 אלף כוכבים ב-GitHub. הפלטפורמה תומכת בכמה שפות - פייתון, JavaScript, Java, Go - ומתחברת למסגרות נפוצות כמו לאנגצ'יין, LlamaIndex ו-OpenAI Agents SDK, כך שאפשר להפעיל אותה מעל מחסניות שונות בלי לשנות קוד-אפליקציה. התמיכה הרב-שפתית הזו, יחד עם ההצהרה המפורשת על אגנוסטיות לספק, ממקמת את פיניקס כבחירה טבעית לארגונים עם מחסנית-טכנולוגית מעורבת שלא רוצים להתחייב לשפה או למסגרת יחידה.

המקום בתוך הקטגוריה

פיניקס מתחרה ישירות בלאנגפיוז כאלטרנטיבה הפתוחה ללאנגסמית'. ההבדל המרכזי הוא שהיא מגיעה מחברה שכבר בנתה מוצר-ניטור מסחרי לפני עידן ה-LLM (Arize AX), כך שהיא נהנית מניסיון-ארגוני קודם בשאלות כמו קנה-מידה ותאימות-ארגונית. מנגד, ההשקעה שלה בתקן OpenInference משלה - ולא רק במוסכמות ה-GenAI הרשמיות של OpenTelemetry - יוצרת שכבת-תרגום נוספת שמפתחים צריכים להכיר, גם אם היא תואמת-לאחור לכל backend תואם-OpenTelemetry. מבחינת קריטריון 'הגדיר את הפרקטיקה', פיניקס תורמת בכך שהיא (יחד עם OpenInference) הייתה בין המפרטים המוקדמים והמאומצים-ביותר לתיעוד סוכנים - עוד לפני שמוסכמות ה-GenAI הרשמיות של OpenTelemetry הבשילו.

ניסויים כמושג-מפתח, לא רק תוספת

אחת הנקודות שמבדילות את התיאור העצמי של פיניקס מכלים אחרים בקטגוריה היא הדגש המוקדם על "ניסויים" (experiments) כמושג-ליבה, לצד מערכי-נתונים - לא רק כפיצ'ר משני שמתווסף אחרי שהמעקב וההערכה כבר קיימים. זה מתבטא בכך שהתיעוד הרשמי מתאר את היכולת הזו כמאפשרת "לבדוק שינויים באופן שיטתי על אותם קלטים" ו"להשוות תוצאות-הערכה כדי לאשר שהשינוי אכן שיפר ביצועים" - ניסוח שמזכיר שיטת-מחקר מדעית קלאסית (קבוצת-בקרה, השוואת-תנאים) יותר מאשר סתם 'לוג של מה שקרה'. ניתן לשער שזה נובע מהרקע המחקרי-ארגוני של Arize AI בניטור-ML קלאסי, תחום שבו מתודולוגיית-ניסויים מבוקרים כבר הייתה מבוססת עוד לפני עידן ה-LLM.

מ-PXI ועד סוכן-הגדרת-המכשור: שכבה נוספת של אוטומציה

מעבר לסוכן-הדיבוג הפנימי PXI, פיניקס גם משלבת יכולת של סוכן-קידוד חיצוני שיכול להגדיר מכשור (instrumentation) בקוד-קיים באופן אוטומטי - כלומר לנתח ריפוזיטורי, לזהות איפה יש קריאות-מודל שצריך לעטוף במכשור-מעקב, ולהוסיף את הקוד הדרוש בעצמו במקום שמפתח-אנושי יעשה זאת ידנית שורה-שורה. זו דוגמה נוספת למגמה שחוזרת אצל כמה מהכלים בקטגוריה: להשתמש בסוכן-AI כדי להקל על ה'עלות-הכניסה' של שילוב כלי-נצפות בפרויקט קיים, ולא רק כדי לנתח את הנתונים אחרי שהמכשור כבר קיים ורץ.

תמיכה רב-שפתית כהצהרת-כוונות

פיניקס תומכת בארבע שפות-תכנות - פייתון, JavaScript, Java ו-Go - טווח רחב יותר מרוב המתחרים הפתוחים בקטגוריה. זו לא רק נוחות טכנית: זו הצהרה מכוונת על מי הלקוח-היעד. ארגון גדול עם מחסנית-backend מעורבת (שירותי Go לביצועים, Java בליבה-הארגונית, פייתון לצד-ה-ML) לא צריך לבחור איזה חלק מהמערכת שלו יקבל נצפות-מלאה ואיזה יישאר בחוץ - כל השפות מקבלות אותה רמת-תמיכה בתקן OpenInference.

הבחירה הזו מתיישבת עם הרקע הארגוני של Arize AI כחברה שכבר שירתה לקוחות-Enterprise גדולים בעולם ה-ML הקלאסי, שבו מחסניות-טכנולוגיה מעורבות הן הכלל ולא היוצא-מן-הכלל. מתחרות שצמחו ישירות מתוך קהילת-מפתחי-פייתון של עולם ה-LLM נוטות להתחיל דווקא משם ולהרחיב בהדרגה לשפות אחרות.

מקור בניטור-ML קלאסי, לא רק ב-LLM

כדאי להדגיש שוב את הנקודה מהסעיף הראשון כי היא לא טריוויאלית: Arize AI קיימת ופעלה בתחום ניטור-machine-learning עוד לפני שהיא נגעה ב-LLM בכלל - זיהוי data drift, ניטור-דיוק וזיהוי-הטיות (bias) במודלי-סיווג ורגרסיה קלאסיים שרצים בפרודקשן. זה שונה מהותית מהרקע של רוב שאר הכלים בקטגוריה, שנולדו ישירות מתוך גל-הסוכנים של 2023-2024 בלי ניסיון-קודם בניטור-מודלים בכלל.

המשמעות המעשית: פיניקס לא רק 'מוסיפה עקבות ל-LLM' - היא מיישמת על עולם-הסוכנים מחשבה שכבר הבשילה בעולם ה-ML הקלאסי, כמו הצורך להבחין בין 'המערכת קרסה' לבין 'המערכת ממשיכה לרוץ אבל התדרדרה בשקט' (בדיוק ההבחנה שערך נצפוּת סוכנים מדגיש). הדגש החזק של פיניקס על הערכה וניסויים שיטתיים, ולא רק על תצוגת-עקבות גולמית, סביר שנובע מאותו רקע ארגוני.

שני תקנים מקבילים: מחיר הבחירה המוקדמת

היתרון של תזמון-מוקדם - לכתוב תקן-מכשור לפני שהתקן הרשמי הבשיל - נושא גם מחיר. היום קיימים שני מפרטים שמכסים שטח דומה: מוסכמות ה-GenAI הרשמיות של OpenTelemetry (עדיין בסטטוס Development, כמתואר בערך נצפוּת סוכנים), ו-OpenInference של Arize, שכבר בשלה ונתמכת בפועל בכלים רבים. מפתח שמתחיל פרויקט חדש היום צריך להחליט לאיזה מהשניים לכתוב מכשור, וגם אם OpenInference תואמת-לאחור ל-OpenTelemetry, זו עדיין החלטה עם השלכות ארוכות-טווח על תחזוקת-הקוד.

בפועל, Arize מהמרת על כך שהיתרון של תקן-בשל-ופרוס-כבר עולה על הסיכון שהמוסכמות הרשמיות של OpenTelemetry יתייצבו בסוף ויהפכו לברירת-המחדל היחידה בתעשייה. ככל שמוסכמות ה-GenAI הרשמיות יבשילו ויצאו מסטטוס Development, יהיה מעניין לראות אם OpenInference תתמזג לתוכן, תישאר כשכבת-תוספת, או תמשיך להתקיים כאלטרנטיבה נפרדת.

שאלות נפוצות ❓

מה ההבדל בין פיניקס ל-Arize AX?

פיניקס היא הגרסה הפתוחה והחינמית; Arize AX היא המוצר המסחרי-המנוהל של אותה חברה. לפי Arize, אותו מכשור מבוסס-OpenInference עובד עם שתיהן, כך שאפשר להתחיל בפיניקס ולעבור ל-AX בלי לשכתב את שכבת-האיסוף.

מה זה OpenInference?

מפרט שכתבה Arize, "משלים את OpenTelemetry", לתיעוד קריאות-מודל, שליפה ושימוש-בכלים חיצוניים באפליקציות-AI. הוא נתמך באופן טבעי בפיניקס, אך תואם לכל backend שתומך ב-OpenTelemetry, כך שהוא לא נועל משתמשים למוצרי Arize בלבד.

פיניקס היא קוד פתוח לגמרי חינמי?

היא מופצת ברישיון Elastic License 2.0 (ELv2) - קוד פתוח וזמין לשימוש, אך עם הגבלות מסחריות מסוימות (בעיקר על הצעתה כשירות מתחרה), בשונה מרישיון MIT הפתוח-לחלוטין של לאנגפיוז או Promptfoo.

איזה סוגי-פעולות פיניקס מודדת?

מעקב אחרי כל צעד בריצת האפליקציה - קריאות-מודל, שליפה, שימוש-בכלים - יחד עם הערכת-איכות באמצעות מעריכי-LLM, בדיקות-קוד או תיוג-אנושי, וניסויים שמשווים גרסאות על אותם מערכי-קלט.