מה זה חיזוי אלח-דם בבינה מלאכותית
אלח-דם (ספסיס) הוא מצב מסכן-חיים שבו תגובת הגוף לזיהום פוגעת ברקמות ובאיברים של הגוף עצמו; לפי ויקיפדיה, יש הממליצים לתת אנטיביוטיקה בתוך שעה מהאבחון — כל שעת עיכוב מעלה לטענתם את הסיכון לתמותה בכ-6 אחוזים — אך אותו ערך מציין שמחקרים אחרים לא מצאו תועלת במתן מוקדם יותר. חיזוי אלח-דם בבינה מלאכותית הוא ניסיון להקדים את התסמינים הגלויים: מודל אלגוריתמי, המוטמע ברשומה הרפואית הממוחשבת של המטופל, מפיק ציון-סיכון שוטף ומתריע לצוות כשהוא חוצה סף מסוים. דוגמה בולטת ומתועדת לגישה הזו היא Epic Sepsis Model (ESM), מודל קנייני של חברת התוכנה הרפואית Epic, שבזמן פרסום מחקר-האימות עליו כבר פעל ב"מאות בתי-חולים ברחבי ארצות הברית".
מה Epic טענה על דיוק המודל
את ביצועי המודל דיווחה Epic במונחי AUC (Area Under the Curve — מדד סטטיסטי שערכו נע בין 0 ל-1 ומבטא עד כמה טוב המודל מבחין בין מטופל בסיכון גבוה למטופל בסיכון נמוך; ככל שהערך קרוב יותר ל-1 כך ההבחנה טובה יותר). לפי מסמכים פנימיים של Epic שהוצגו במחקר-האימות, ולפי מאמר-כנס קודם שנכתב בשיתוף עם Epic, טווח ה-AUC שדיווחה החברה עמד על 0.76 עד 0.83, ובמאמר-הכנס גם 0.73.
מה מצא מחקר-האימות החיצוני
ב-2021 פרסמו חוקרים מאוניברסיטת מישיגן (Wong ואחרים) מחקר-אימות חיצוני בכתב-העת JAMA Internal Medicine, שבדק את המודל על 38,455 אשפוזים של 27,697 מטופלים אמיתיים. הממצא המרכזי: AUC של 0.63 בלבד — נמוך משמעותית מהטווח שדיווחה Epic. רגישות המודל (שיעור מקרי אלח-הדם האמיתיים שהמודל אכן זיהה) עמדה על 33 אחוזים בלבד, וסגוליות על 83 אחוזים. ציון-סיכון גבוה הופיע ב-18 אחוזים מכלל האשפוזים (6,971 מתוך 38,455) — עומס-התראות כבד על הצוות. מתוך 2,552 האשפוזים שבהם התפתח אלח-דם, רק ב-183 (7 אחוזים) הצטרפו שני התנאים יחד — המודל סימן ציון-סיכון של 6 ומעלה, והמטופל גם לא קיבל אנטיביוטיקה בזמן; החוקרים ראו במספר הנמוך הזה עדות לרגישות הנמוכה של המודל לעומת העבודה הקלינית בפועל. את 67 אחוזים ממקרי אלח-הדם המערכת לא זיהתה כלל — ו-60 אחוזים מתוכם קיבלו אנטיביוטיקה בזמן בלי קשר אליה.
מה קרה מאז — והאם זה נפתר
בעקבות הממצאים עדכנה Epic את המודל לגרסה חדשה (ESM v2), המבוססת על עצי-החלטה מוגברים (gradient-boosted trees) במקום רגרסיה לוגיסטית, וניתנת לכיול נפרד בכל בית-חולים על סמך נתוני-עבר מקומיים. מחקר-המשך שפורסם בפברואר 2026 בכתב-העת JAMA Network Open, ושבדק את הגרסה המעודכנת על 227,091 אשפוזים בארבע מערכות-בריאות שונות, מצא הבחנה משופרת — AUC שנע בין 0.82 ל-0.92 — אך גם "עומס-התראות גבוה" ו"ערך-ניבוי-חיובי נמוך" (0.13 עד 0.26), לצד שונות ניכרת בין המוסדות בביצועי המודל. החוקרים המליצו במפורש שכל מוסד יבצע מחקר-אימות מקומי משלו לפני הפעלת המודל, ולא יסתמך רק על נתוני היצרן.
למה זה מקרה-מבחן לבינה מלאכותית ברפואה
המקרה נדון בהרחבה בספרות על פערי-אימות בבינה מלאכותית קלינית: מודל שנבדק בעיקר מול נתוני-הפיתוח של היצרן, ורק אחרי פריסה נרחבת עבר אימות עצמאי חיצוני — בדיוק הפער שגם בהדמיה רפואית בבינה מלאכותית (ai-medical-imaging) מתואר כחסם מרכזי לאימוץ בטוח של כלים דומים. הלקח שחוזר בשני מחקרי-ההמשך על Epic Sepsis Model זהה: ביצועים שדיווח היצרן אינם תחליף לאימות חיצוני ובלתי-תלוי, במוסד המשתמש בפועל.