דלג לתוכן

תיוג נתונים (Data Labeling)

יסודות בינה מלאכותית

הגדרה

תיוג נתונים הוא הוספת תשובה נכונה ("תווית") לכל דוגמה במערך-נתונים — שלב הכרחי בלמידה מפוקחת, ולעיתים קרובות מבוצע ע"י אנשים בפועל, לא רק אוטומטית.

כדי שמודל ילמד לזהות "חתול" בתמונה, צריך תמונות רבות שכל אחת מסומנת "חתול" או "לא חתול" — מישהו (או תהליך אוטומטי) צריך לבצע את הסימון הזה מראש, לפני שהאימון בכלל מתחיל.

כשפיי-פיי לי בנתה את ImageNet ב-2009 (ראו הערך "מערך נתונים"), תיוג-ידני של מיליוני תמונות אחת-אחת היה בלתי-אפשרי לצוות קטן — הפתרון היה גיוס-המונים דרך פלטפורמת Amazon Mechanical Turk, ששילמה לאלפי אנשים ברחבי העולם סכום זעיר עבור כל תמונה שתייגו.

תיוג נתונים לא נעלם עם הופעת מודלי-השפה-הגדולים — הוא רק שינה צורה. בשלב ה-RLHF (למידת חיזוק מפידבק אנושי) שהופך מודל-חיזוי-טקסט גולמי לעוזר-שיחה שימושי, "תיוג" פירושו בדרך-כלל מדרגים אנושיים שקוראים כמה תשובות שונות של המודל לאותה שאלה, ומדרגים איזו מהן טובה יותר — משימה מורכבת ועדינה בהרבה מ"חתול או לא חתול", שדורשת שיפוט-איכות ולא רק זיהוי-עובדה. חברות ייעודיות כמו Scale AI הפכו לספקיות-שירות מרכזיות לתיוג-נתונים בקנה-מידה תעשייתי עבור מעבדות-ה-AI המובילות.

תיוג נתונים בקנה-מידה גדול (מיליוני דוגמאות) הוא עדיין לעיתים קרובות עבודה אנושית שנעשית ע"י צוותי-תיוג, לרוב במדינות שכר-נמוך — נושא שעורר ביקורת ציבורית חריפה בשנים האחרונות על תנאי-העבודה, כולל חשיפה חוזרת של עובדי-תיוג שנחשפים לתוכן פוגעני (אלימות, תוכן מיני) כחלק מתיוג-בטיחות עבור מודלים גדולים, בשכר נמוך משמעותית ממה שהחברות המזמינות את השירות גובות מלקוחותיהן. מגמה נגדית שהתחזקה בשנים האחרונות היא מעבר מתיוג-המוני-וזול לעבר "תיוג-מומחים" יקר-ומדויק — רופאים שמתייגים תמונות-רנטגן, עורכי-דין שמתייגים מסמכים משפטיים, מתכנתים שמדרגים איכות-קוד — כי ככל שהמודלים נעשים מתוחכמים יותר, גם רף-האיכות הנדרש מהתיוג עצמו עולה בהתאם.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו