תיוג נתונים (Data Labeling)
הגדרה
תיוג נתונים הוא הוספת תשובה נכונה ("תווית") לכל דוגמה במערך-נתונים — שלב הכרחי בלמידה מפוקחת, ולעיתים קרובות מבוצע ע"י אנשים בפועל, לא רק אוטומטית.
כדי שמודל ילמד לזהות "חתול" בתמונה, צריך תמונות רבות שכל אחת מסומנת "חתול" או "לא חתול" — מישהו (או תהליך אוטומטי) צריך לבצע את הסימון הזה מראש, לפני שהאימון בכלל מתחיל.
כשפיי-פיי לי בנתה את ImageNet ב-2009 (ראו הערך "מערך נתונים"), תיוג-ידני של מיליוני תמונות אחת-אחת היה בלתי-אפשרי לצוות קטן — הפתרון היה גיוס-המונים דרך פלטפורמת Amazon Mechanical Turk, ששילמה לאלפי אנשים ברחבי העולם סכום זעיר עבור כל תמונה שתייגו.
תיוג נתונים לא נעלם עם הופעת מודלי-השפה-הגדולים — הוא רק שינה צורה. בשלב ה-RLHF (למידת חיזוק מפידבק אנושי) שהופך מודל-חיזוי-טקסט גולמי לעוזר-שיחה שימושי, "תיוג" פירושו בדרך-כלל מדרגים אנושיים שקוראים כמה תשובות שונות של המודל לאותה שאלה, ומדרגים איזו מהן טובה יותר — משימה מורכבת ועדינה בהרבה מ"חתול או לא חתול", שדורשת שיפוט-איכות ולא רק זיהוי-עובדה. חברות ייעודיות כמו Scale AI הפכו לספקיות-שירות מרכזיות לתיוג-נתונים בקנה-מידה תעשייתי עבור מעבדות-ה-AI המובילות.
תיוג נתונים בקנה-מידה גדול (מיליוני דוגמאות) הוא עדיין לעיתים קרובות עבודה אנושית שנעשית ע"י צוותי-תיוג, לרוב במדינות שכר-נמוך — נושא שעורר ביקורת ציבורית חריפה בשנים האחרונות על תנאי-העבודה, כולל חשיפה חוזרת של עובדי-תיוג שנחשפים לתוכן פוגעני (אלימות, תוכן מיני) כחלק מתיוג-בטיחות עבור מודלים גדולים, בשכר נמוך משמעותית ממה שהחברות המזמינות את השירות גובות מלקוחותיהן. מגמה נגדית שהתחזקה בשנים האחרונות היא מעבר מתיוג-המוני-וזול לעבר "תיוג-מומחים" יקר-ומדויק — רופאים שמתייגים תמונות-רנטגן, עורכי-דין שמתייגים מסמכים משפטיים, מתכנתים שמדרגים איכות-קוד — כי ככל שהמודלים נעשים מתוחכמים יותר, גם רף-האיכות הנדרש מהתיוג עצמו עולה בהתאם.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות