מחברת-ניסויי-ML למוצר-סוכנים נפרד
Weights & Biases נוסדה ב-2017 בידי לוקאס ביוולד, כריס ואן-פלט ושון לואיס, בתקופה שבה - לפי החברה עצמה - "הכלים למתרגלי-machine-learning היו לא-מספקים באופן יסודי" ו"מעקב אחר מודלים היה בעיקר תרגיל ידני; שחזור שלהם היה כמעט בלתי-אפשרי". המוצר המקורי, Experiments, נבנה לפתור בדיוק את זה - מעקב שיטתי אחרי ריצות-אימון של מודלים, השוואת-היפר-פרמטרים, וגרפים שמראים איך מדדי-אימון מתקדמים לאורך זמן.
Weave הוא מוצר נפרד, שנבנה שנים אחר-כך במיוחד עבור עולם ה-LLM והסוכנים, ולא הרחבה פשוטה של Experiments. ההבדל הזה חשוב: מי שמכיר את W&B ממעקב-ניסויים קלאסי עלול להניח ש-Weave היא עוד "פיצ'ר" באותה מסך - בפועל זה מוצר עם מודל-נתונים שונה לגמרי, שנבנה כי הצורך לעקוב אחרי ריצת-אימון בודדת עם מדדים מספריים שונה מהותית מהצורך לעקוב אחרי שיחה מרובת-צעדים בין סוכן למשתמש ולכלים חיצוניים.
יחידת-המידע היא לא 'ניסוי', אלא 'סשן' ו'תור'
התיעוד הרשמי מתאר את Weave כמי שמארגנת "נצפות ושיפור מתמשך לסוכנים בפרודקשן". ההבדל המבני המרכזי ממעקב-הניסויים הקלאסי: Weave בנויה "מהיסוד לתוך סשנים (sessions) ותורות (turns)" ומספקת "מעקב-ילידי-לסוכנים" שמתייחס ל"סשנים, תורות, צעדים, כלים וסוכני-משנה כמושגי-יסוד" - כלומר לא עוד לוג שטוח של קריאות-API, אלא מבנה-נתונים שמכיר את המושגים שמאפיינים סוכן: שיחה מרובת-תורות, קריאה לכלי בתוך תור, האצלה לסוכן-משנה שמבצע תת-משימה ומחזיר תוצאה.
לפי החברה, זה "עושה ניווט קל יותר מאשר מעקב-קוד מסורתי" - טענה שמבדילה אותה ממכשור גנרי שלא נבנה מלכתחילה עבור מבנה-שיחה סוכני, ומחייב את המפתח לשחזר בעצמו את מבנה-הסשנים מתוך שטף של אירועים בלתי-מובנים. באופן מעשי, זה אומר שמפתח שבודק למה סוכן נכשל יכול לצלול ישר לתור הבעייתי בתוך הסשן, בלי לגלול ידנית דרך עשרות קריאות-API לא-קשורות.
הערכה, לוחות-מובילים ומגרש-משחקים
מעבר למעקב, Weave כוללת "מסגרת-הערכה גמישה" שמאפשרת "למדוד כל שיפור בהרתמות (harnesses) ובמודלים בביטחון" ולתפוס נסיגות (regressions) לפני שהן מגיעות לפרודקשן - כלומר להריץ סוויטת-בדיקות קבועה על כל שינוי בסוכן ולוודא שהוא לא נהיה גרוע יותר בפרט שכבר עבד. תוצאות-הערכה אפשר לצבור ל"לוחות-מובילים (leaderboards) שמציגים את המבצעים-הטובים-ביותר ולשתף אותם בארגון" - יכולת שמזכירה את התרבות התחרותית שסביב מבחנים כמו SWE-bench, אבל בתוך ארגון בודד, כך שצוותים שונים יכולים להשוות בין גרסאות-סוכן שהם בונים על אותו מדד בדיוק.
יש גם "מגרש-משחקים" (Playground) ל"בחינת מודלים וטכניקות-הנחיה לפני בניית סוכן-AI", כולל בדיקת מודלים חדשים מול עקבות-פרודקשן אמיתיות - כלומר לא מול דוגמאות-סינתטיות, אלא מול מה שכבר קרה בשטח, כך שאפשר לדעת אם מודל חדש שיצא לשוק יתפקד טוב יותר על אותם קלטים-אמיתיים שהמשתמשים כבר שלחו.
מותג-אם ותיק מול מתחרים צעירים
רוב שאר שבעת הכלים בקטגוריה הזו - לאנגסמית', לאנגפיוז, פיניקס, Braintrust, Promptfoo - הם חברות שנולדו בין 2023 ל-2024, ישירות מתוך גל-הסוכנים. Weave, לעומת זאת, נסמכת על חברה בת-כמעט-עשור שכבר עברה סבבי-גיוס, בנתה בסיס-לקוחות רחב בקהילת-ML, נרכשה ב-2025 בידי CoreWeave, והגיעה עם תשתית-חשבונות, אבטחה ותמיכה ארגונית קיימת מראש. זה יתרון תחרותי אמיתי במובן אחד - פחות סיכון-הישרדות, יציבות-חברה מוכחת - אבל גם עלול להיות חיסרון-תפיסתי: מפתח שמחפש 'את הכלי הכי חדש ומתמחה' לסוכני-AI עלול לדלג על Weave בהנחה מוטעית שמדובר רק בתוסף למוצר-הניסויים הוותיק, ולא לבדוק את המוצר לגופו.
מנקודת-המבט ההפוכה, הוותק הזה גם אומר ש-Weights & Biases כבר עברה את השלב שרוב מתחרותיה הצעירות בקטגוריה עדיין נמצאות בו - גיוס-הון חוזר ונשנה כדי להוכיח כדאיות. במקום זאת, Weave יכולה להישען על תזרים-הכנסות קיים ובסיס-משתמשים שכבר משלם עבור Experiments. ומעבר לכך: במרץ 2025 הודיעה CoreWeave, ספקית-ענן-ה-GPU, על רכישת Weights & Biases בתמורה מדווחת של כ-1.7 מיליארד דולר, והעסקה נסגרה במאי 2025. כלומר Weave אינה מתחרה על סבב-הגיוס הבא מול הסטארטאפים הצעירים בקטגוריה — היא חלק מחברת-תשתית-ענן ציבורית, וזה, לא תזרים-ההכנסות לבדו, מה שמסיר ממנה את לחץ-הגיוס שמניע חלק מהחלטות-המוצר אצל המתחרות.
מ-2017 לעולם-הסוכנים: פער-זמן שמסביר את הארכיטקטורה
כמעט שמונה שנים חלפו בין הקמת Weights & Biases ב-2017 סביב מעקב-ניסויי-machine-learning לבין הצורך לבנות מוצר ייעודי-לסוכנים. בשמונה השנים האלה, מודל-הנתונים של Experiments התייצב סביב מושג ה'ריצה' (run) - אימון בודד עם היפר-פרמטרים קבועים ועקומת-אימון אחת. כשהצורך בסוכנים הופיע, אי-אפשר היה פשוט להוסיף 'עוד סוג-ריצה' למודל הקיים, כי סוכן לא מייצר עקומת-מדדים יחידה שמשתפרת עם הזמן - הוא מייצר עץ-שיחות מרובה-ענפים עם החלטות-ניתוב בכל צומת. הפער הזה בין שני מודלי-הנתונים הוא ההסבר ההנדסי לכך ש-Weave נבנתה כמוצר נפרד ולא כהרחבה של הטבלאות והגרפים שכבר היו קיימים ב-Experiments.
שילוב עם W&B, לא תחליף לו
בשונה מכלים עצמאיים כמו לאנגפיוז או פיניקס, Weave יושבת בתוך אקוסיסטם קיים: היא דורשת חשבון-W&B ומפתח-API כדי לשלוח נתונים, ומספקת ספריות ב-Python וב-TypeScript. זה יתרון לארגונים שכבר משתמשים ב-W&B למעקב-אימון-מודלים קלאסי ורוצים שכבת-כלים אחת לכל מחזור-החיים - מאימון ועד סוכן בפרודקשן - בלי לנהל שני ספקי-כלים נפרדים עם שני ממשקי-ניהול ושתי חשבוניות. אבל זה גם אומר שהמוצר פחות טבעי למי שמתחיל מאפס בלי היכרות עם W&B, ומעדיף פתרון עצמאי-לגמרי כמו לאנגפיוז או פיניקס שאפשר להפעיל בלי תלות במוצר-אם.
לולאת-שיפור אוטונומית
מעבר לצפייה והערכה, Weave מתארת יכולת ש"מאפשרת שיפור אוטונומי" - סוכנים שקוראים נתוני-פרודקשן חיים ומריצים לולאות-איטרציה אוטומטיות על בסיסם, כלומר לא רק מציגים למפתח דוח, אלא מתחילים בעצמם תהליך של ניתוח-כשלים והצעת-שיפור. זו יכולת שלא קיימת במעקב-ניסויים מסורתי, ומייצגת את הכיוון שאליו כלי-הנצפות בקטגוריה כולה נעים: לא רק להציג למפתח מה קרה, אלא לתת לסוכן-נוסף להשתמש בנתונים כדי לשפר את הסוכן המקורי - מגמה שמופיעה גם ב-PXI של פיניקס, אך Weave מציבה אותה כחלק מרכזי יותר בסיפור-המוצר שלה.
המקום בתוך הקטגוריה
Weave מתחרה ישירות בלאנגסמית', לאנגפיוז, פיניקס ו-Braintrust על אותה שכבת-פונקציונליות - מעקב, הערכה, לוחות-בקרה. מה שמייחד אותה הוא נקודת-הכניסה: ארגונים רבים כבר משתמשים ב-W&B למעקב-ניסויי-ML, כך ש-Weave מציעה להם המשך טבעי בלי ספק-חדש בשרשרת-הכלים. זה גם הסיכון המרכזי בבחינת הערך שלה: כדי להעריך את Weave נכון צריך להפריד אותה בבירור מהמוצר-האם ולבחון אותה כמוצר-סוכנים בפני עצמו - ולא כ"עוד לשונית" בתוך פלטפורמת-ניסויים ותיקה, שכן זו בדיוק ההבחנה שהתיעוד הרשמי עצמו מקפיד לעשות בין 'סשנים ותורות' לבין 'ריצות-אימון'.
איסוף-משוב כחלק מהמעקב עצמו
מעבר למעקב ולהערכה, Weave מתוארת כמי שמאפשרת גם "לאסוף משוב" ולצבור "מטריקות על התנהגות-האפליקציה" - כלומר לא רק לתעד מה הסוכן עשה, אלא גם לקשור לכך תגובת-משתמש-קצה (כמו דירוג 'עזר/לא עזר' על תשובה ספציפית) ישירות לאותה עקבה. זה סוגר מעגל שכלים רבים בקטגוריה משאירים כפער: תצפית טכנית (מה קרה) ומשוב-איכותי (האם זה היה טוב, מנקודת-המבט של מי שקיבל את התשובה בפועל) נשמרים לרוב במערכות שונות, מה שמקשה לחבר בין ביקורת-משתמש קונקרטית לבין העקבה הטכנית שהובילה אליה.
כשהמשוב חי באותה מערכת כמו המעקב וההערכה, אפשר להזין אותו ישירות חזרה למערך-ההערכה - למשל להפוך תשובה שדורגה כ'לא עזרה' למקרה-בדיקה חדש בלוח-המובילים, באותה לולאה שהתיעוד הרשמי מתאר כ'שיפור אוטונומי'.
מה שכל שבעת הכלים האחרים בקטגוריה מספרים ביחד
כשמניחים את Weave לצד לאנגסמית', לאנגפיוז, פיניקס, Braintrust, RAGAS, Promptfoo ו-SWE-bench, עולה תבנית ברורה: כמעט כל אחד מהם - בלי קשר אם הוא פלטפורמה סגורה, ספרייה פתוחה, או מבחן אקדמי - הגיע למסקנה דומה, שסוכן דורש מודל-נתונים ייעודי משלו ולא הרחבה של כלי-לוגים כלליים. לאנגסמית' בנתה את SmithDB, Braintrust בנתה את Brainstore, וגם Weave נטשה את מודל-הניסויים-הבודדים לטובת סשנים-ותורות - שלושה פתרונות טכניים שונים לאותה תובנה בדיוק.
ההתכנסות הזו, על-פני חברות שלא עבדו יחד ובאו מרקעים שונים לגמרי (סטארטאפ-קוד-פתוח, חברת-ML-ותיקה, פלטפורמת-ניסויים ותיקה עוד יותר), היא עצמה עדות חזקה לכך ש'נצפוּת-סוכנים' ו'הערכת-סוכנים' אינן רק מונחי-שיווק, אלא בעיה הנדסית אמיתית שדרשה פתרונות-מבנה חדשים - ושכל השחקנים המובילים בקטגוריה נאלצו להתמודד איתה בעצמם, כל אחד בדרכו.
האם הפריימינג 'Weave כמוצר עצמאי' מחזיק מעמד?
זו שאלה שכדאי לשאול במפורש: Weave היא לא רק תג-מכירות על גבי מוצר-הניסויים הוותיק, אלא בנויה - לפי התיעוד הרשמי עצמו - על מודל-נתונים שונה לחלוטין (סשנים/תורות במקום ריצות), עם יכולות ספציפיות לסוכנים (מעקב-ילידי-לכלים ולסוכני-משנה, לוחות-מובילים, מגרש-משחקים מול עקבות-אמיתיות) שלא היו קיימות ב-Experiments מעולם. במובן הזה הפריימינג מחזיק: יש כאן הרחבת-קטגוריה אמיתית, לא רק שם חדש.
עם זאת, שווה לשים-לב שהתלות בחשבון-W&B ובמפתח-ה-API שלו נשארת מבנית: Weave לא נמכרת ולא פועלת כמוצר עצמאי-לגמרי בפני עצמו, בניגוד ללאנגפיוז או לפיניקס שאפשר להפעיל בלי שום קשר לחברה אחרת. לכן ההשוואה ההוגנת ביותר היא לא 'Weave מול W&B הישנה', אלא 'Weave כמוצר-סוכנים בתוך משפחת-מוצרים רחבה יותר' - ובגבולות ההשוואה הזו, הפריימינג של השאלה עומד היטב.