דלג לתוכן

אמת קרקע (Ground Truth)

יסודות בינה מלאכותית

הגדרה

אמת קרקע (Ground Truth) היא תשובת הייחוס: התשובה שמתייחסים אליה כנכונה כשמאמנים מודל או בודקים אותו — מדידה ישירה או שיפוט של אנשים — ואליה משווים את מה שהמודל חזה.

💡 דוגמה

אפליקציה מזהה בתמונה "חתול". כדי לדעת אם צדקה, צריך תשובה שנקבעה מראש.

אמת קרקע: התשובה הזו, שלרוב קבעו אנשים, ואליה משווים את הניחוש של המודל.

מהשטח אל המודל

אמת קרקע (Ground Truth) היא, לפי ויקיפדיה, מידע שידוע כנכון כי הוא מבוסס על תצפית ומדידה ישירה, ולא על הסקה. השימוש הטכני במונח התפתח בחישה מרחוק: לפי ויקיפדיה, כבר ב-1972 תיארה נאס"א נתונים על החומרים שעל פני כדור הארץ כחיוניים לכיול מדידות. מי שמפענח תצלום לוויין צריך לדעת מה באמת נמצא על הקרקע במקום שצולם — שדה, יער או שכונה — כדי לבדוק אם הפענוח נכון. משם עבר המונח לסטטיסטיקה וללמידת מכונה.

דוגמה יומיומית מוויקיפדיה: טלפון חכם מחזיר קואורדינטות של מיקום. הקואורדינטות הן הערכה; אמת הקרקע היא המקום שבו המכשיר באמת נמצא. הדיוק נמדד לפי המרחק בין השניים.

מה זה אומר בלמידת מכונה

בלמידת מכונה, אמת הקרקע היא "התוצאה האידיאלית הצפויה", כלשון ויקיפדיה — התשובה שאליה משווים את מה שהמודל חזה. בדרך כלל היא חלק מהנתונים המתויגים: התמונה והתווית "חתול", המייל והתווית "ספאם". תשובות כאלה משמשות באימון, כדי ללמד את המודל. בבדיקה משווים את המודל לתשובות של דוגמאות נפרדות שלא ראה באימון — קבוצת מבחן (Test Set).

כדאי להבחין בין שלושה מונחים קרובים. תיוג נתונים (Data Labeling) הוא התהליך — העבודה של הוספת התשובות. אמת הקרקע היא התוצאה שמתייחסים אליה כנכונה. ועיגון עובדתי (Grounding), למרות הדמיון בשם, הוא משהו אחר לגמרי: חיבור התשובה של מודל שפה למקור מידע חיצוני.

ויקיפדיה מדגישה נקודה שקל לפספס: בלמידת מכונה, אמת הקרקע "אינה בהכרח נכונה באופן אובייקטיבי". היא יכולה להיות שיפוט של אנשים, או משהו שהוסק מהתנהגות משתמשים. במסנן דואר זבל, למשל, התוויות "ספאם" ו"לא ספאם" עשויות להיות סובייקטיביות או לא מדויקות — ובכל זאת הן משמשות כאמת הקרקע. לעומת זאת, כשבודקים מערכת ראייה ממוחשבת שמעריכה מרחקים, מד-טווח לייזר מכויל יכול לספק מדידה אובייקטיבית.

מי מחליט מה נכון

בהרבה משימות שמעניינות אנשים אין מכשיר מדידה. מישהו צריך להחליט. ברפואה זה בולט במיוחד. בפוסט בבלוג של Google Research מדצמבר 2019 תיארו דייב סטיינר ושרוויה שטי פרויקט לפענוח צילומי חזה. הם כתבו שרוב המאמצים בתחום הפיקו תוויות מתוך דוחות הרדיולוגים באמצעות עיבוד שפה, או הסתמכו על קורא יחיד — ושתי הדרכים "עלולות להכניס חוסר עקביות או טעויות", שבעייתיות במיוחד בשלב הבדיקה.

הפתרון שלהם היה פאנל: שלושה רדיולוגים בחנו כל תמונה בקבוצות הכוונון והמבחן הסופיות, ויישבו מחלוקות בדיון. כדי להפחית הטיה בגלל אישיות או ותק של רופא מסוים, הדיון התנהל באופן אנונימי במערכת מקוונת. לפי הפוסט, התהליך אפשר לא פעם לזהות ממצאים קשים שבהתחלה רק רדיולוג אחד הבחין בהם. גוגל פרסמה תוויות שנקבעו בתהליך הזה עבור 4,374 תמונות במאגר ציבורי. עוד ממצא מהפוסט: לפי החוקרים, המודל זיהה לא פעם ממצאים שהרדיולוגים החמיצו באופן עקבי, וגם להפך.

כשאין תשובה אחת

החוקרים לורה ארויו וכריס וולטי פרסמו ב-2015 בכתב העת AI Magazine מאמר בשם "אמת היא שקר". לטענתם, תיוג אנושי במשימות של פירוש משמעות נשען על "אידיאל מיושן של אמת נכונה אחת". הם מנו שבעה מיתוסים על תיוג אנושי, ושני הראשונים ברשימה הם ההנחה שלכל דוגמה יש פירוש נכון אחד, וההנחה שמחלוקת בין מתייגים היא סימן לאיכות ירודה.

במחקרים שלהם, שעסקו בעיקר בתיוג משפטים, הם מצאו ש"מחלוקת אינה רעש אלא אות": כשמתייגים לא מסכימים, זה יכול להעיד שהמשפט עצמו עמום, ולא רק שהמתייגים עבדו רע. הם מצאו גם שהנחיות מפורטות יותר אכן מבטלות מחלוקת, "אבל אינן משפרות את האיכות" — הן מאלצות את המתייגים לבחור תשובות שאולי אינם חושבים שהן נכונות. החלופה שהציעו נקראת "אמת ההמון" (Crowd Truth): לאסוף תיוגים מאנשים רבים על אותה דוגמה, ולשמור את טווח הפירושים הסבירים במקום לכפות תשובה אחת.

גם אמת הקרקע טועה

גם כשיש תשובה נכונה, מי שרשם אותה יכול לטעות. מחקר של קרטיס נורת'קאט ושותפיו, שפורסם ב-arXiv במרץ 2021, בדק תוויות בעשרה ממערכי הנתונים הנפוצים ביותר בראייה ממוחשבת, בשפה ובשמע — בקבוצות המבחן, או בקבוצה חלופית כשלא הייתה קבוצת מבחן מוגדרת. לפי החוקרים, הטעויות בתוויות "רבות ונפוצות": הם העריכו ממוצע של לפחות 3.3% תוויות שגויות בעשרת המאגרים. בקבוצת האימות של ImageNet הם זיהו 2,916 תוויות שגויות, כ-6% ממנה.

השיטה הייתה דו-שלבית: אלגוריתם סימן תוויות חשודות, ואנשים בדקו אותן. בממוצע, 51% מהמקרים שהאלגוריתם סימן התבררו כשגויים באמת. המסקנה של החוקרים נוגעת לכל מי שבוחר מודל לפי ציון: כשקבוצת המבחן עצמה רועשת, המודל עם הציון הגבוה ביותר אינו בהכרח הטוב ביותר. בניסוי שבו שינו את הרכב קבוצת הבדיקה של ImageNet ומדדו מול תוויות מתוקנות, מודל ResNet-18 הקטן עקף את ResNet-50 הגדול ממנו כשחלקן של הדוגמאות שתויגו במקור באופן שגוי הגיע לכ-9%, לעומת 2.9% בקבוצה שממנה התחילו.

למה זה חשוב למי שקורא תוצאות

כשמודל נבדק מול תוויות, מספר כמו "המודל צודק ב-95% מהמקרים" הוא השוואה בין המודל לבין אמת קרקע מסוימת. הוא תלוי באיכות התשובות שאליהן השוו אותו, וגם בהרכב קבוצת הבדיקה. לכן שווה לשאול מי קבע את התשובות: מכשיר מדידה, מתייג יחיד, פאנל מומחים או המון אנשים.

צוות גוגל הגיע למסקנה דומה מכיוון אחר. לפי הפוסט שלהם, השוואה בין שני מודלים שנבדקו על מאגרים שונים היא "בעלת ערך מזערי" בלי פרטים נוספים, כמו הרכב המקרים במאגר או הביצועים של רדיולוגים על אותם מקרים. ונורת'קאט ושותפיו ממליצים לשפוט מודלים מול קבוצות מבחן שהתוויות בהן תוקנו, במיוחד כשמדובר בנתונים רועשים מהעולם האמיתי.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש דרכים לקבוע אמת קרקע
מדידה במכשירתיוג בידי אנשיםפאנל מומחים
דוגמהמד-טווח לייזר מכויל שמודד מרחקתוויות "ספאם" ו"לא ספאם" למייליםשלושה רדיולוגים שמיישבים מחלוקת על צילום חזה
מה המקורות אומרים עליהלפי ויקיפדיה, זו אמת קרקע אובייקטיביתלפי ויקיפדיה, התוויות עשויות להיות סובייקטיביות או לא מדויקותלפי גוגל, אפשרה לזהות ממצאים קשים שרק רופא אחד הבחין בהם בהתחלה
מתי משתמשיםכשיש גודל פיזי שאפשר למדודבמשימות שיפוט, ובכמויות גדולותבמחקר של גוגל — לקבוצות הכוונון והמבחן, כי תיוג ידני של מאות אלפי תמונות אינו מעשי

שאלות נפוצות ❓

האם אמת קרקע היא תמיד האמת?

לא. בלמידת מכונה היא התשובה שהוחלט להתייחס אליה כנכונה. לפעמים זו מדידה מדויקת, ולפעמים שיפוט של אנשים שיכול להיות סובייקטיבי או שגוי. מחקר מ-2021 זיהה כ-6% תוויות שגויות בקבוצת האימות של ImageNet.

מה ההבדל בין אמת קרקע לתיוג נתונים?

תיוג נתונים הוא העבודה של הוספת תשובות לדוגמאות. אמת הקרקע היא התוצאה — התשובות שמשמשות אחר כך לאימון ולבדיקה של המודל.

האם זה קשור לעיגון עובדתי (Grounding)?

לא, למרות הדמיון בשם. עיגון עובדתי הוא חיבור תשובה של מודל שפה למקור מידע חיצוני, כמו מסמך או תוצאת חיפוש. אמת קרקע היא התשובה הנכונה שאליה משווים מודל באימון ובבדיקה.

מה עושים כשהמתייגים לא מסכימים?

הגישה המקובלת היא ליישב את המחלוקת, למשל בדיון בין מומחים או בהנחיות מפורטות יותר. החוקרים לורה ארויו וכריס וולטי טוענים שלפעמים כדאי דווקא לשמור את המחלוקת, כי היא מלמדת שהדוגמה עמומה.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו