מהבעיה של Evals לחברה
Braintrust גייסה סבב-Seed של 5.1 מיליון דולר בהובלת Saam Motamedi מקרן Greylock, שהוכרז ב-13 בדצמבר 2023 - עם סך-גיוס כולל של 8.3 מיליון דולר עד אז. המייסד והמנכ"ל, אנקור גויאל, תיאר את הבעיה שהחברה פותרת במילים: "הערכה (evals) הפכה לרכיב חיוני בלולאת-הפיתוח של תוכנת-AI". במילים אחרות: צוותי-הנדסה כבר לא יכולים להסתפק ב"זה נראה טוב" כשהם משנים פרומפט או מודל - הם צריכים מספר שמראה אם השינוי שיפר או החמיר, באותו אופן שבדיקות-יחידה (unit tests) קובעות אם שינוי-קוד שבר משהו בתוכנה רגילה.
כבר בהודעת-הסבב צוינו לקוחות ראשונים - Zapier, Coda, Airtable ו-Instacart - חברות מוצר-בוגרות שכבר הריצו סוכני-AI בפרודקשן ונתקלו ישירות בבעיה שגויאל תיאר: אין דרך שיטתית לדעת אם גרסה חדשה של הסוכן טובה יותר מהקודמת, מעבר לבדיקה ידנית של כמה דוגמאות.
שלוש פעולות: תצפית, הערכה, גילוי
המוצר מאורגן סביב שלוש יכולות. "תצפית" (Observe) מאפשרת "לבחון פרומפטים, תשובות וקריאות-כלים בזמן-אמת" על-פני עקבות-פרודקשן. "הערכה" (Evaluate) מאפשרת "לנקד פלטים באמצעות מודלים, קוד או בני-אדם" ו"להריץ ניסויים מול מערכי-נתונים אמיתיים" - כלומר לא רק ציון חד-פעמי, אלא השוואה שיטתית בין גרסאות על אותו מערך-קלט קבוע. ו"גילוי" (Discover) סוגר את המעגל: "לזהות התנהגות חשובה, לאמת את הראיות, לבדוק שיפור ולמדוד את התוצאה - הכול במערכת אחת".
התיאור הרשמי מסכם את הרעיון כך: "לגלות דפוסים בפרודקשן, להפוך אותם להערכות, ולשפר איכות עם כל שחרור-גרסה" - כלומר סגירת-מעגל בין מה שקורה בשטח לבין מה שנבדק לפני השחרור הבא. הרעיון המרכזי כאן הוא שתצפית בפרודקשן לא אמורה להישאר תצפית-בלבד: כל תקרית שמתגלה בזמן-אמת אמורה להפוך למקרה-בדיקה קבוע במערך-ההערכה, כך שגרסאות עתידיות לא יחזרו על אותה טעות.
Brainstore: מסד-נתונים ייעודי, כמו אצל המתחרה
בדומה ל-SmithDB של לאנגסמית', גם Braintrust בנתה מסד-נתונים קנייני משלה, בשם Brainstore, "שתוכנן במיוחד לנצפות-סוכנים כדי שאפשר יהיה לשאול שאילתות על מיליוני עקבות במהירות". הבחירה לבנות תשתית-נתונים ייעודית - ולא להסתפק במסד-נתונים כללי - חוזרת אצל שני השחקנים המסחריים המובילים בקטגוריה, ומעידה שבקנה-מידה ארגוני, ניתוח-עקבות בזמן-סביר הוא בעצמו בעיה הנדסית לא-טריוויאלית, לא רק פרט-יישומי שאפשר לפתור עם מסד-נתונים-יחסים רגיל.
הפלטפורמה תומכת ב-SDK-ים לחמש שפות - פייתון, TypeScript, Go, Ruby ו-C# - טווח רחב יחסית שמעיד על כוונה לשרת גם ארגונים עם מחסניות-backend מגוונות ולא רק סטארטאפים שכותבים הכול ב-Python או TypeScript. החברה גם מחזיקה בהסמכת SOC 2 Type II ומציעה תאימות ל-GDPR ול-HIPAA, יחד עם אפשרויות-פריסה היברידיות - שילוב שמכוון בבירור ללקוחות ארגוניים עם דרישות-רגולציה כבדות.
Functions: להעביר את ההערכה לקוד
עם גיוס סדרה-A של 36 מיליון דולר, שהוכרז ב-8 באוקטובר 2024 בהובלת מרטין קסאדו מ-a16z (סך-גיוס מצטבר: 45 מיליון דולר), החברה הציגה גם יכולת בשם Functions - המאפשרת למפתחים "ליצור כלים, פרומפטים ומעריכים בקוד עצמו", ואז לפרוס אותם בפקודה אחת, braintrust push. זה מעביר את לוגיקת-ההערכה מממשק-ניהול חזותי לקוד גרסאי בריפוזיטורי - גישה שמדברת לצוותי-הנדסה שרגילים לעבוד עם CI/CD, ולא רוצים ששינוי במעריך-הערכה יתבצע דרך לחיצות-עכבר בממשק-אינטרנט בלי מעקב-גרסאות.
בין המשקיעים בסבב-A, מלבד a16z, מופיעים גם שמות פרטיים מתוך Vercel, Notion, Zapier, OpenAI ומיסטרל - מה שמצביע על כך שהחברה גייסה גם 'הון-אסטרטגי' מאנשים בתוך התעשייה שמכירים את הבעיה מקרוב, ולא רק הון פיננסי טהור.
לקוחות וגידול
בין הלקוחות ששמם הופיע בהודעות הרשמיות של החברה: Notion, Stripe, Vercel, Airtable, Instacart, Zapier, Coda, Cloudflare, Replit, Box, Retool ו-The Browser Company. לפי הודעת סבב ה-A, "הצוות הממוצע שמשתמש ב-Braintrust מריץ יותר מ-10 ניסויים ביום" - מדד לאימוץ בתוך מעגל-הפיתוח היומיומי, לא רק שימוש חד-פעמי בתחילת פרויקט. קצב כזה מרמז שההערכה הפכה בפועל לחלק משגרת-הפיתוח השוטפת של הצוותים האלה, ולא לפעילות שמתבצעת רק לפני שחרור-גרסה גדול.
החברה גם מחזיקה בהסמכת SOC 2 Type II, ובפברואר 2026 הוכרז עליה סבב-B נוסף בהיקף 80 מיליון דולר, בהובלת ICONIQ - שלושה שלבי-גיוס תוך שנתיים וקצת, קצב שמעיד על צמיחה מהירה יחסית לשוק-הנישה הזה, ומציב אותה לצד לאנגסמית' כאחת משתי הפלטפורמות המסחריות-הסגורות המגייסות בקנה-מידה הגדול ביותר בקטגוריה.
המקום בתוך הקטגוריה
Braintrust ולאנגסמית' הן שתי הפלטפורמות המסחריות-הסגורות המובילות בקטגוריית ההערכה והנצפות, אבל עם דגש שונה: לאנגסמית' נולדה כהרחבה של מסגרת-סוכנים ספציפית (לאנגצ'יין) ורק אחר-כך התרחבה להיות אגנוסטית; Braintrust נולדה כתשתית-הערכה עצמאית מלכתחילה, בלי מסגרת-אֵם משלה, וממותגת סביב לולאת-ה-evals עצמה יותר מסביב מעקב כללי. מול האלטרנטיבות הפתוחות (לאנגפיוז, פיניקס), שתיהן מציעות תשתית מנוהלת בקנה-מידה תמורת ויתור על גישה לקוד-המקור - עסקה שלקוחות ארגוניים גדולים, ששמם מופיע ברשימת-הלקוחות למעלה, בחרו לקבל במפורש.
שם שממנו נגזרת ציפייה: 'אמון' כתשתית
השם Braintrust - שמזכיר 'מאגר-אמון-קוגניטיבי' - מתיישב עם המסר החוזר בכל תקשורת-החברה: לא רק לתעד מה סוכן עשה, אלא לתת לצוות-הנדסה בסיס אמין-דיו כדי להחליט אם לשחרר גרסה חדשה לפרודקשן. זה שונה מהותית מהמסר של כלי-מעקב גרידא, שמסתפק בהצגת-נתונים בלי לטעון דבר על מהימנות ההחלטה שמתקבלת על בסיסם. ההבדל הזה במסר - בין 'הנה מה שקרה' לבין 'הנה למה אפשר לסמוך על זה' - הוא חלק ממה שמסביר למה Braintrust ולאנגסמית' ממותגות כפלטפורמות-תשתית ארגוניות, בזמן שחלק מהמתחרות הפתוחות ממותגות יותר כ'כלי-מפתח' טכני.
השוואה עם שאר הכלים בקטגוריה מחדדת את הנקודה: RAGAS ו-Promptfoo ממותגים סביב פעולה קונקרטית (מדידה, בדיקה); לאנגפיוז ופיניקס ממותגות סביב תכונת-קוד-פתוח; ואילו Braintrust ולאנגסמית' - שתי הפלטפורמות הסגורות המובילות - בחרו למתג את עצמן סביב תוצאה עסקית (אמון, ביטחון-לשחרר), לא סביב מנגנון טכני. זה עשוי לשקף הבנה משותפת ששני המוצרים האלה פונים בעיקר לקהל-קבלת-החלטות ארגוני, לא רק למפתח הבודד שכותב את הקוד.
קצב-גיוס שמשקף שוק שעדיין רותח
שלושה סבבי-גיוס תוך פחות משלוש שנים - Seed בדצמבר 2023, Series A באוקטובר 2024, ו-Series B בפברואר 2026 - הם קצב חריג גם לפי סטנדרטים של סטארטאפים-חמים. הוא מסמן שמשקיעים ממשיכים לראות בקטגוריית-ההערכה שוק שעדיין לא הגיע לנקודת-רוויה, גם אחרי שכלים מתחרים (לאנגסמית', לאנגפיוז, פיניקס) כבר צברו נתח-שוק ומוניטין משלהם. העובדה ש-a16z, גריילוק ומשקיעים אסטרטגיים מתוך Vercel, Notion, Zapier, OpenAI ומיסטרל כולם החליטו להיכנס לאותה חברה מחזקת את התמונה: Braintrust לא רק שרדה תחרות מוקדמת, אלא הצליחה להתבדל מספיק כדי להמשיך למשוך הון בקצב מואץ גם כשהשוק כבר נהיה צפוף יותר.
טווח-שפות רחב כהימור על סוג-הלקוח
Braintrust מציעה SDK-ים רשמיים לחמש שפות - פייתון, TypeScript, Go, Ruby ו-C# - טווח חריג יחסית לקטגוריה, שרוב חבריה מתמקדים בעיקר בפייתון ו-TypeScript. הבחירה הזו ניכרת גם ברשימת-הלקוחות: Stripe (Ruby ידוע כשפת-הליבה ההיסטורית שלה) ו-Box (סביבת-Enterprise מבוססת-.NET/C# בחלקים נרחבים) הם דוגמאות לחברות שסביר שהיו נתקלות במחסום אילו הפלטפורמה תמכה רק בשתי שפות מרכזיות. זה מרמז שהחברה בנתה את התשתית שלה מראש עם עין לשוק-הארגוני הרחב, ולא רק לקהל-מפתחי-הסטארטאפים המצומצם יותר שמשתמש כמעט תמיד ב-Python/TypeScript.
ציות ואבטחה כחלק מהצעת-הערך
בין הלקוחות המוזכרים בהודעות הרשמיות מופיעות חברות מכל הגדלים ותחומי-העיסוק - מ-Stripe וה-Browser Company ועד Instacart ו-Cloudflare - ורבות מהן פועלות תחת דרישות-רגולציה כבדות (פינטק, תשתית-ענן). זו כנראה הסיבה שהחברה בחרה להשקיע מוקדם יחסית בהסמכת SOC 2 Type II ובתמיכה ב-GDPR וב-HIPAA, ולהציע גם אפשרויות-פריסה היברידיות - לא רק SaaS טהור. אצל מתחרה פתוח כמו לאנגפיוז, נטל-הציות עובר לארגון עצמו כשהוא בוחר להריץ עצמאית; אצל Braintrust, שנשארת מוצר סגור-לגמרי, הנטל הזה מנוהל מראש ברמת-הפלטפורמה, מה שמסביר חלק מהערך שהיא מציעה ללקוחות-הארגוניים הגדולים ברשימה.
למה זה נחשב 'הגדיר את הפרקטיקה' ולא רק עוד SaaS
הקריטריון המרכזי שמייחד את Braintrust מכלי-עזר כלליים הוא שהיא מיצבה את ה-evals עצמם - ולא את הלוגים או את התצפית - כמוצר-הליבה. בעוד רוב הכלים בקטגוריה הגיעו מכיוון 'מעקב שממנו נגזרת הערכה', Braintrust הפכה את סדר-העדיפויות: המסר השיווקי שלה, מהיום הראשון, היה שהערכה שיטתית היא הפעולה שצריך לבנות סביבה תהליך-פיתוח שלם, ותצפית היא רק אחד המקורות שמזינים אותה. הבחירה הזו השפיעה על שאר השוק: פלטפורמות אחרות בקטגוריה - כולל לאנגסמית' ולאנגפיוז - הרחיבו את יכולות-ה-evals שלהן משמעותית מאז 2023, בתקופה שבה Braintrust כבר מיצבה את עצמה סביב זה במפורש.
עם זאת, כדאי להזכיר שהמוצר עדיין צעיר יחסית (סוף 2023) לעומת חלק מהמתחרים, כך שההשפעה שלו על עיצוב-הקטגוריה עדיין נמדדת יותר במגמת-הגיוס והלקוחות-הארגוניים שהוא צבר תוך זמן קצר, ופחות בהיסטוריה ארוכה של אימוץ בקנה-מידה.