מייסדים מהחזית
איאן ובסטר, מנכ"ל-שותף-מייסד, ניהל קודם לכן "צוותי הנדסת-LLM ופלטפורמת-מפתחים ב-Discord, בקנה-מידה של 200 מיליון משתמשים תוך שמירה על סטנדרטים קפדניים של בטיחות, אבטחה ומדיניות". מייקל ד'אנג'לו, שותפו לייסוד וה-CTO, שימש קודם לכן "סגן-נשיא-הנדסה וראש-AI ב-Smile Identity", עם "רקורד של הרחבת פתרונות למידת-מכונה לשירות מעל 100 מיליון אנשים". השניים מתארים את עצמם כ"אנשי-אבטחה והנדסה שהרחיבו מוצרי-AI-יוצר למאות מיליוני משתמשים", ובנו את "הכלים שהיו רוצים שיהיו להם כשהם עצמם עמדו בחזית" - כלומר המוצר נולד מכאב ישיר של המייסדים בזמן שהם עצמם היו אחראים לבטיחות מוצרי-AI בקנה-מידה עצום, לא מתיאוריה אקדמית.
החברה מבוססת בסן-פרנסיסקו, ולפי האתר הרשמי היא נתמכת בקהילה של 348 תורמי-קוד-פתוח - מספר שמעיד על כך שהפרויקט לא נשען רק על צוות-הליבה של החברה, אלא גדל דרך תרומות חיצוניות מרובות מהתחלה מוקדמת יחסית.
שתי יכולות: בדיקת-הנחיות וצוות-אדום
הכלי משרת שני צרכים שונים. הראשון הוא בדיקת-פרומפטים שיטתית: "איטרציה על פרומפטים, הגדרת בדיקות ב-YAML, וצפייה בהכול באופן מקומי" - כלשון עדות שהחברה מציגה מ-OpenAI עצמה. זה מאפשר להריץ אותו סט-בדיקות מול כמה ספקי-מודל שונים (OpenAI, Anthropic, Azure, Bedrock, Ollama ואחרים) ולהשוות ביניהם על אותם קריטריונים בדיוק.
השני הוא צוות-אדום ייעודי לסיכוני-AI, שכולל "הזרקות-פרומפט ישירות ועקיפות", "פריצות (jailbreaks) מותאמות למגני-האבטחה שלך", "דליפות מידע-אישי ונתונים", "הפרות-כללי-עסק", ו"שימוש-לא-בטוח בכלים בתוך סוכנים" - יותר מ-50 סוגי-פגיעות (vulnerability types) בסך-הכול, לפי האתר הרשמי, שנוצרות אוטומטית מתוך "מודיעין-איומים בזמן-אמת מקהילה של מעל 300 אלף משתמשים" - כלומר הכלי לא רק מריץ רשימת-התקפות סטטית, אלא מתעדכן מדפוסי-תקיפה שקהילת-המשתמשים חושפת בפועל.
ריצה מקומית, לא שירות-ענן
עיקרון-עיצוב מרכזי של Promptfoo הוא שהבדיקות "רצות 100% מקומית" - כלומר תוכן-ההנחיות ותשובות-המודל לא עוברות דרך שרת חיצוני של החברה כדי להיבדק, שיקול קריטי לארגונים שמתמודדים עם נתונים רגישים ולא יכולים לשלוח אותם לשירות-בדיקה חיצוני. זה מתחבר ישירות לצינורות CI/CD קיימים - GitHub, GitLab, Jenkins ואחרים - ותומך גם ב-MCP ובמסגרות-סוכנים, כך שאפשר להריץ בדיקות-בטיחות כחלק משגרת-הבנייה הרגילה, לא כפרויקט-אבטחה נפרד שמישהו צריך לזכור להריץ ידנית לפני שחרור.
אימוץ, כולל אצל ספקי-המודלים עצמם
לפי האתר הרשמי, ב-Promptfoo משתמשים מעל 300 אלף מפתחים בקוד הפתוח, וכ-156 מתוך חברות ה-Fortune 500 משלבות אותו במחזור-הפיתוח שלהן. המאגר הציבורי צבר כ-25.4 אלף כוכבים ב-GitHub. פרט בולט - ומעיד על כיוון-האמון בתעשייה - הוא ש-OpenAI ו-Anthropic עצמן מוזכרות כמשתמשות בכלי, לצד עדות רשמית מ-OpenAI שמשבחת את האפשרות "לאטרר על פרומפטים, להגדיר בדיקות ב-YAML ולצפות בהכול מקומית". זה יוצא-דופן בתעשייה: ספקי-מודל גדולים שמשתמשים בכלי-בדיקה חיצוני על המודלים של עצמם, ולא רק בכלים פנימיים - עדות מסוימת לכך שהמתודולוגיה של Promptfoo נתפסת כאמינה גם מנקודת-המבט של מי שבונה את המודלים עצמם.
OpenAI הסכימה לרכוש, הקוד נשאר פתוח
ב-9 במרץ 2026 פרסמו ובסטר וד'אנג'לו הודעה משותפת: "Promptfoo הסכימה להירכש על-ידי OpenAI" - עסקה הכפופה לתנאי-סגירה מקובלים. השניים הסבירו שהם מצטרפים ל-OpenAI כי "פלטפורמת האבטחה, ההערכה והציות שבנינו יכולה להשפיע הכי הרבה על האופן שבו צוותים בונים ופורסים AI". במקביל, ההודעה מבטיחה במפורש: "Promptfoo תישאר קוד פתוח ונמשיך לשרת משתמשים ולקוחות", תוך המשך תחזוקת "חבילת-הקוד-הפתוחה ככלי מוביל לצוות-אדום, סריקה סטטית והערכות עבור כל מודל או אפליקציית-AI" - כלומר גם מודלים של מתחרים כמו Anthropic, לא רק מודלי-OpenAI.
לפני העסקה גייסה החברה השקעות מ-Insight Partners ו-Andreessen Horowitz. הרכישה הזו, שהתרחשה תוך שנתיים בלבד מהקמת החברה, ממחישה עד כמה תחום-האבטחה וההערכה של סוכני-AI הפך קריטי מספיק כדי שספק-מודל מוביל ירצה לרכוש שחקן מוביל בו, ולא רק לבנות תחליף פנימי.
המקום בתוך הקטגוריה
Promptfoo תופסת נישה שונה מהפלטפורמות הגדולות בקטגוריה. בעוד לאנגסמית', לאנגפיוז, פיניקס ו-Braintrust מתמקדות בעיקר בנצפות ובהערכת-איכות שוטפת בפרודקשן, Promptfoo ממוקדת בשלב שלפני-הפרודקשן - בדיקה שיטתית ותקיפה-יזומה לפני שקוד מגיע ללקוחות, בדומה לאופן שבו כלי-אבטחת-קוד קלאסיים (SAST/DAST) פועלים בעולם התוכנה הרגיל. הרכישה על-ידי OpenAI, תוך הבטחה מפורשת להמשך קוד-פתוח, ממקמת אותה כתקן-דה-פקטו לבדיקות-אבטחה של סוכנים - ולא כמתחרה ישירה לכלי-המעקב היומיומי. השילוב הזה - בדיקה יזומה לפני שחרור, לא רק תצפית אחרי-מעשה - הוא בדיוק מה שמבדיל אותה מכל שאר שבעת הכלים האחרים בקטגוריה הזו.
פחות משנתיים מהקמה ועד רכישה על-ידי ספק-מודל מוביל
ציר-הזמן שווה תשומת-לב בפני עצמו: איאן ובסטר ומייקל ד'אנג'לו הקימו את Promptfoo ב-2024, ופחות משנתיים לאחר מכן - במרץ 2026 - כבר הגיעה ההודעה על הסכמה להירכש בידי OpenAI. זה קצב חריג גם ביחס לכלים אחרים בקטגוריה שדורשים בדרך-כלל שלושה-ארבעה סבבי-גיוס עצמאיים לפני אירוע-יציאה כלשהו (כפי שרואים אצל Braintrust ולאנגפיוז). ייתכן שהקצב הזה משקף לא רק הצלחה מסחרית של Promptfoo עצמה, אלא גם תזמון: השאלה 'איך בודקים שסוכן-AI בטוח לפני שמשחררים אותו' הפכה קריטית מספיק, מספיק מהר, כדי שספק-מודל מוביל ירצה להבטיח שליטה על התשובה לה, ולא להמתין שהשוק יתבגר בעצמו.
קהילה כמנוע-מודיעין, לא רק כמדד-פופולריות
348 תורמי-קוד-פתוח וקהילה של מעל 300 אלף משתמשים אינם רק מספרי-אימוץ להצגה בעמוד-הבית - לפי החברה, הם גם מקור-הנתונים שממנו נגזר "מודיעין-איומים בזמן-אמת" שמזין את יכולות-הצוות-האדום. כלומר, ככל שיותר צוותים מריצים את הכלי ומדווחים (במפורש או באמצעות איתור אוטומטי) על דפוסי-תקיפה חדשים שהם נתקלים בהם, כך מאגר-הפגיעויות שהכלי בודק מולו מתעדכן ומשתפר עבור כל שאר המשתמשים. זהו אפקט-רשת קלאסי שקשה לשחזר לכלי-אבטחה סגור שבונה את מאגר-הפגיעויות שלו רק מתוך צוות-מחקר פנימי מצומצם - ואולי חלק מההסבר לכך ש-OpenAI בחרה לרכוש דווקא כלי עם קהילה כזו, במקום לבנות מאגר-פגיעויות דומה מאפס.
טקסונומיית-פגיעויות כמוצר בפני עצמו
רשימת-הפגיעויות של Promptfoo - למעלה מ-50 סוגים, לפי האתר הרשמי - לא מסתכמת בהזרקות-פרומפט גנריות. היא מפרידה בין קטגוריות שונות באופן מכוון: הזרקה ישירה (משתמש-קצה כותב תוקפנות ישירות בשדה-הקלט) מול הזרקה עקיפה (תוכן-זדוני שמגיע דרך מסמך או תוצאת-חיפוש שהסוכן קורא), פריצות שמותאמות ספציפית למגני-האבטחה שהארגון כבר הגדיר, דליפות-מידע-אישי, הפרות-כללי-עסק (כמו סוכן-שירות-לקוחות שמבטיח החזר-כספי שאסור לו להבטיח), ושימוש-לא-בטוח בכלים - קטגוריה שרלוונטית במיוחד לסוכנים שמפעילים כלים חיצוניים ולא רק עונים בטקסט.
ההפרדה הזו לקטגוריות נפרדות, ולא רשימת-התקפות גנרית אחת, היא מה שהופך את הכלי לשימושי בפועל לצוותי-אבטחה: אפשר להתמקד קודם בקטגוריה שהכי רלוונטית לאפליקציה הספציפית (למשל 'שימוש-לא-בטוח בכלים' לסוכן שמבצע פעולות אמיתיות במערכות חיצוניות), במקום להריץ סוללת-בדיקות גנרית שלא מותאמת לפרופיל-הסיכון של המוצר.
התקנה בלי חיכוך
פרט קטן שמסביר חלק מהאימוץ הרחב: הכלי מופץ במקביל דרך npm, Homebrew ו-pip - שלושת ערוצי-ההפצה שמפתחי-פייתון, מפתחי-Node.js ומשתמשי-macOS/Linux כבר מכירים ומשתמשים בהם יומיומית להתקנת כלי-שורת-פקודה אחרים. זה נשמע פרט טכני שולי, אבל בהקשר של כלי-בדיקה שאמור להיכנס לצינור CI/CD, מחסום-התקנה נמוך הוא בדיוק מה שמבדיל בין כלי שצוות-הנדסה מנסה פעם אחת ונוטש, לבין כלי שנשאר בתשתית-הבדיקות הקבועה של הפרויקט.
השילוב של התקנה-קלה, ריצה-מקומית-לגמרי (בלי חשבון-ענן שצריך ליצור קודם), והגדרת-בדיקות בקובץ YAML פשוט - כל אחד לבדו נשמע כמו פרט-נוחות, אבל יחד הם ההסבר הפשוט ביותר לכך ש-Promptfoo הגיעה למאות אלפי משתמשים ולעשרות אלפי כוכבים ב-GitHub תוך כשנתיים מהקמת החברה.
מה הרכישה משדרת על מצב-התחום
העובדה ש-OpenAI - ספקית-המודלים המובילה בשוק - בחרה לרכוש דווקא כלי-בדיקה-ואבטחה חיצוני, ולא לבנות תחליף פנימי בלבד, אומרת משהו על איך התעשייה מתייחסת לבעיית-הבטיחות-של-סוכנים כיום: היא מספיק מורכבת וממוסדת שכדאי לרכוש שחקן שכבר בנה קהילה של 300 אלף מפתחים ותשתית-איתור-פגיעויות שמתעדכנת מהשטח, במקום לגדל את זה מאפס. ההבטחה המפורשת להמשיך לתמוך גם במודלים מתחרים - לא רק ב-OpenAI - חשובה כאן: היא זו שמאפשרת ל-Promptfoo להישאר 'כלי-תשתית ניטרלי' ברמת-אמון של כל התעשייה, ולא להפוך לכלי-שיווק פנימי של חברה אחת.
מנקודת-המבט של הקטגוריה כולה, זו גם דוגמה ראשונה בסדר-גודל כזה לרכישה של כלי-הערכה/בדיקה עצמאי בידי ספק-מודל מוביל - מהלך שעשוי לעודד גם ספקים אחרים (Anthropic, Google) לשקול רכישות דומות של כלי-תשתית בקטגוריה, או לפחות להעמיק שיתופי-פעולה עם הכלים הקיימים.