ראייה ממוחשבת (Computer Vision)
🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.
הגדרה
ראייה ממוחשבת (Computer Vision) היא ענף ב-AI שמלמד מחשבים "לראות" ולהבין תוכן בתמונות ובווידאו.
💡 דוגמה
הטלפון שמזהה את הפנים שלכם ונפתח, או אפליקציה שמזהה צמח מצילום.
איך מחשב רואה תמונה
כשאדם מסתכל על תמונה הוא רואה כלב על ספה. מה שהמחשב מקבל הוא טבלת מספרים: לכל פיקסל שלושה ערכים, לעוצמת האדום, הירוק והכחול. בתמונה רגילה יש מיליוני מספרים כאלה, ואין באף אחד מהם דבר שאומר כלב.
כל תפקידה של ראייה ממוחשבת הוא לגשר על הפער הזה — להפוך טבלת מספרים למשמעות. והקושי אינו טכני בלבד: אותו כלב עצמו מייצר טבלאות מספרים שונות לחלוטין בכל צילום. התאורה משתנה, הזווית משתנה, הכלב מוסתר למחצה, הרקע אחר. אדם אינו שם לב לזה כלל. תוכנה חייבת להתמודד עם כל וריאציה כזו במפורש.
עד כמה הקושי הזה הוערך בחסר אפשר ללמוד ממסמך מפורסם: ביולי 1966 פרסם סימור פפרט במעבדת הבינה המלאכותית של MIT מזכר שהגדיר פרויקט קיץ לסטודנטים, שמטרתו לבנות מערכת שתפריד תמונה לאזורים, תתאר את צורתם, ותזהה את העצמים שבה. המשימה הזו העסיקה את התחום שישים שנה, ולא קיץ אחד.
רגע המהפך: ImageNet ו-AlexNet
במשך עשרות שנים התבססה ראייה ממוחשבת על כללים שמהנדסים כתבו ידנית: איך לזהות קצה, איך לזהות פינה, אילו צירופים מרמזים על עצם. השיטה עבדה סבירות בתנאי מעבדה מבוקרים, ונשברה בעולם האמיתי.
שני דברים שינו את התמונה. הראשון היה מאגר נתונים. פיי-פיי לי החלה ב-2006 לפתח את הרעיון של ImageNet, מאגר של יותר מ-14 מיליון תמונות שסווגו ידנית ליותר מ-20,000 קטגוריות. עבודת התיוג עצמה נמשכה מיולי 2008 עד אפריל 2010, והעסיקה כ-49,000 עובדים מ-167 מדינות.
השני היה 2012. רשת בשם AlexNet, של אלכס קריז׳בסקי, איליה סוצקבר וג׳פרי הינטון, ניצחה את תחרות ImageNet השנתית עם שיעור טעות של 15.3% — יותר מעשר נקודות אחוז מתחת למקום השני. היא אומנה על שני כרטיסי מסך ביתיים בלבד, במשך חמישה עד שישה ימים. מאותו רגע התחום כולו עבר ללמידה עמוקה, והכללים הידניים נזנחו.
ארבע המשימות המרכזיות בתחום
ראייה ממוחשבת היא שם כולל למשפחה של משימות שונות, וכדאי להבחין ביניהן כי כל אחת דורשת דבר אחר.
סיווג תמונה עונה על שאלה אחת בלבד: מה יש בתמונה. הפלט הוא תווית אחת לתמונה כולה, למשל חתול.
זיהוי עצמים עונה גם על השאלה איפה. הפלט הוא רשימת עצמים, ולכל אחד מהם מלבן שמסמן את מיקומו בתמונה. זו המשימה שרכב אוטונומי זקוק לה כדי לדעת שיש הולך רגל, ובאיזה מרחק הוא נמצא.
פילוח, או סגמנטציה, מדייק צעד נוסף: הוא מסווג כל פיקסל בנפרד, וכך מסמן את קו המתאר המדויק של העצם. זה מה שנדרש בהדמיה רפואית, כשצריך למדוד את גבולותיו של גידול ולא רק לאתר אותו.
זיהוי פנים הוא מקרה מיוחד של השוואה: המערכת מחלצת מהפנים ייצוג מספרי, ומשווה אותו למאגר קיים כדי לקבוע במי מדובר. מכאן גם רגישותו המיוחדת מבחינת פרטיות, שכן הוא מחייב מאגר של פנים מזוהות מראש.
איך רשת קונבולוציה מזהה עצם
הטכניקה ששלטה בתחום מאז 2012 נקראת רשת קונבולוציה (CNN), והרעיון שלה פשוט להסבר.
במקום להסתכל על התמונה כולה בבת אחת, הרשת מעבירה עליה חלוניות קטנות שמחפשות תבנית מקומית מסוימת — למשל קו אלכסוני, או מעבר מבהיר לכהה. אותה חלונית בדיוק מוחלת על כל אזורי התמונה, ולכן היא מזהה את התבנית בכל מקום שבו תופיע. זו התכונה שמאפשרת לרשת לזהות חתול גם כשהוא בפינה השמאלית ולא במרכז.
השכבות מסודרות בהיררכיה. השכבה הראשונה מוצאת קצוות ופינות. השכבה שמעליה מצרפת קצוות לצורות. מעליה מצטרפות צורות לחלקים, כמו עין, אוזן או גלגל. ורק בשכבות העליונות מורכב מהם עצם שלם.
איש לא הגדיר את החלוקה הזו מראש. היא נוצרה מאליה בזמן האימון. בשנים האחרונות נוספו לתחום גם ארכיטקטורות מבוססות טרנספורמר, שמתחרות ברשתות הקונבולוציה ולעיתים עוקפות אותן.
איפה ראייה ממוחשבת עובדת היום
ראייה ממוחשבת כבר אינה הדגמה במעבדה. היא מוטמעת בתשתיות שרוב האנשים משתמשים בהן בלי לדעת.
ברפואה, מערכות שמנתחות הדמיה עוברות אישור רגולטורי בדיוק כמו מכשור רפואי אחר. רשימת המכשירים מבוססי-AI המאושרים לשיווק בארצות הברית, שמנהל מינהל המזון והתרופות האמריקאי (FDA), מונה כיום יותר מ-1,500 מכשירים, ובקרב הרשומות האחרונות בה רובם המכריע שייכים לתחום ההדמיה.
בתחבורה, החברה הישראלית Mobileye בנתה את מערכות הסיוע לנהג שלה סביב מצלמה בודדת ועיבוד תמונה, במקום סביב חיישני לייזר יקרים. לפי נתוני החברה נשלחו עד היום יותר מ-200 מיליון שבבי EyeQ לרכבים ברחבי העולם.
ובתעשייה ובחקלאות, מצלמות בקו ייצור מאתרות פגמים בקצב שאדם אינו יכול לעמוד בו, ומערכות בשדה מזהות מחלות בעלים ומאפשרות טיפול ממוקד במקום ריסוס גורף.
המגבלות: הטעיות מכוונות והטיה בנתונים
ראייה ממוחשבת נכשלת באופנים שאדם לא היה נכשל בהם, ושתי דוגמאות מוכרות ממחישות למה.
הראשונה נקראת דוגמה יריבה. במחקר שפורסם ב-2017 הדביקו חוקרים מדבקות שחורות ולבנות על תמרור עצור אמיתי. לעין אנושית התמרור נשאר תמרור עצור לגמרי. מסווג תמרורים סטנדרטי טעה בזיהוי ב-100% מהתמונות שצולמו במעבדה, וב-84.8% מפריימי הווידאו שצולמו מרכב בתנועה. השינוי לא היה בעצם עצמו, אלא בתבנית שהמודל למד להיאחז בה.
השנייה היא הטיה. במחקר Gender Shades מ-2018 בדקו ג׳וי בואלמוויני וטימניט גברו שלוש מערכות מסחריות לסיווג מגדר מתמונת פנים. שיעור השגיאה עבור נשים כהות עור הגיע ל-34.7%, לעומת 0.8% לכל היותר עבור גברים בהירי עור. הפער נבע ממאגרי אימון שהיו מוטים מלכתחילה לטובת עור בהיר — עדות לכך שהמערכת לומדת גם את מה שחסר בנתונים, לא רק את מה שיש בהם.
גרסה פשוטה של הערך, לגיל 12. כל מה שכתוב כאן מופיע גם בערך המלא.
כשאתם מסתכלים על תמונה, אתם רואים מיד כלב שוכב על ספה. המחשב מקבל משהו אחר לגמרי: טבלה ענקית של מספרים. כל נקודה קטנה בתמונה, שנקראת פיקסל, מתוארת בשלושה מספרים: כמה אדום, כמה ירוק וכמה כחול יש בה. באף אחד מהמספרים האלה לא כתוב "כלב".
ראייה ממוחשבת (Computer Vision) היא התחום שמנסה להפוך את טבלת המספרים הזאת למשמעות. וזה קשה יותר ממה שנשמע: מצלמים את אותו כלב בתאורה אחרת, מזווית אחרת, או כשהוא מוסתר למחצה, ומקבלים טבלה שונה לגמרי. ב-1966 הגדירו במעבדת מחקר פרויקט קיץ לסטודנטים שיפתור את זה. המשימה העסיקה את התחום שישים שנה, ולא קיץ אחד.
איך זה עובד היום? התוכנה, שבנויה משכבות של חישובים זו מעל זו, לא מסתכלת על כל התמונה בבת אחת. היא מעבירה עליה חלונית קטנה שמחפשת דבר פשוט, כמו קו אלכסוני, בכל מקום בתמונה. זה קצת כמו לחפש את וולי: לא סורקים את כל הדף בבת אחת, אלא עוברים אזור אחרי אזור ומחפשים את החולצה המפוספסת. השכבה הראשונה מוצאת קווים ופינות, השכבה הבאה מחברת אותם לצורות, אחר כך לחלקים כמו עין או אוזן, ורק בסוף לכלב שלם. אף אחד לא תכנן את החלוקה הזאת מראש. היא נוצרה מעצמה בזמן האימון.
אבל גם מערכת טובה טועה בדרכים משונות. חוקרים הדביקו כמה מדבקות שחורות ולבנות על תמרור עצור, ומסווג תמרורים כבר לא זיהה אותו נכון, למרות שכל אדם היה רואה שזה עדיין תמרור עצור. המערכת נאחזה בתבנית שלמדה, לא בתמרור עצמו.
בפעם הבאה שהטלפון נפתח כשהוא מזהה את הפנים שלכם, זו ראייה ממוחשבת בפעולה.
מה המושג אומר לארגון ולעסק. כל עובדה כאן מופיעה גם בערך המלא.
ראייה ממוחשבת היא היכולת להפיק מידע שימושי מתמונות ומווידאו: מה מופיע בהם, איפה, ובאילו גבולות מדויקים. זו כבר לא הדגמה במעבדה. היא מוטמעת במכשור רפואי שעבר אישור רגולטורי, במערכות סיוע לנהג ובקווי ייצור.
הדבר הראשון שכדאי להבין הוא שמדובר במשפחה של משימות, ולכל אחת פלט אחר. סיווג תמונה נותן תווית אחת לכל התמונה. זיהוי עצמים מסמן כל עצם במלבן, ואומר גם איפה הוא. פילוח מסווג כל פיקסל ומשרטט קו מתאר מדויק, כמו שנדרש כשמודדים גבולות של גידול בהדמיה. זיהוי פנים משווה ייצוג מספרי של פנים למאגר קיים. בדיקת פגמים בקו ייצור, איתור מחלות עלים בשדה ותיוג ארכיון תמונות אינם אותה בעיה, ולכן כדאי להגדיר קודם איזו משימה בדיוק נדרשת.
מה זה נותן: מצלמות בקו ייצור מאתרות פגמים בקצב שאדם אינו יכול לעמוד בו, ובחקלאות אפשר לעבור מריסוס גורף לטיפול ממוקד.
והגבולות: המערכת נכשלת באופנים שאדם לא היה נכשל בהם. במחקר מ-2017 כמה מדבקות על תמרור עצור הספיקו כדי שמסווג סטנדרטי יטעה בזיהוי שלו, כי המודל נאחז בתבנית שלמד ולא בעצם. במחקר Gender Shades מ-2018 שיעור השגיאה של מערכות מסחריות לסיווג מגדר היה גבוה בהרבה אצל נשים כהות עור מאשר אצל גברים בהירי עור, כי מאגרי האימון היו מוטים מלכתחילה. המערכת לומדת גם את מה שחסר בנתונים. זיהוי פנים רגיש במיוחד מבחינת פרטיות, כי הוא מחייב מאגר של פנים מזוהות מראש. המסקנה: לבחון את המערכת בתנאים שלכם, עם התאורה, הזוויות והאוכלוסייה שלכם, ולא רק בהדגמה של הספק.
שאלות שכדאי לשאול ספק, צוות או יועץ:
- איזו משימה המערכת מבצעת בפועל (סיווג, זיהוי עצמים, פילוח או זיהוי פנים), והאם זו המשימה שהבעיה שלנו דורשת?
- על אילו תמונות אומן המודל, ועד כמה הן דומות לתאורה, לזוויות ולמצלמות שלנו?
- האם שיעורי השגיאה נבדקו בנפרד לקבוצות שונות של אנשים או של מוצרים, ומה נמצא?
- איך המערכת נבדקה מול הטעיות מכוונות, כמו מדבקות או שינויים קטנים בעצם?
- אם יש זיהוי פנים: איפה נשמר מאגר הפנים המזוהות, ומי יכול לגשת אליו?
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| סיווג תמונה | זיהוי עצמים | פילוח | |
|---|---|---|---|
| השאלה שנענית | מה יש בתמונה | מה יש ואיפה הוא | אילו פיקסלים שייכים לכל עצם |
| מבנה הפלט | תווית אחת לתמונה | מלבן סביב כל עצם | מסכה לכל עצם, פיקסל אחר פיקסל |
| דוגמת שימוש | תיוג אלבום תמונות | זיהוי הולכי רגל ברכב | מדידת גבולות גידול בהדמיה |
שאלות נפוצות ❓
מה זו ראייה ממוחשבת?
ענף בבינה מלאכותית שמלמד מחשבים להפיק משמעות מתמונות ומווידאו: לזהות מה מופיע בהם, איפה, ובאילו גבולות מדויקים.
איך מחשב מזהה מה יש בתמונה?
הוא מקבל את התמונה כטבלת מספרים, ורשת מאומנת מזהה בה תבניות בהדרגה: תחילה קצוות ופינות, אחר כך צורות, ולבסוף עצם שלם.
האם זיהוי פנים מדויק באותה מידה לכולם?
לא. בדיקת NIST מ-2019 בחנה 189 אלגוריתמים ומצאה ברובם שיעורי התאמת-שווא גבוהים פי 10 עד 100 בפנים אסייתיות ואפרו-אמריקאיות לעומת פנים של לבנים.
איפה נתקלים בראייה ממוחשבת ביומיום?
בפתיחת טלפון בזיהוי פנים, בחיפוש בתמונות לפי תוכן, במערכות סיוע לנהג ברכב, ובניתוח הדמיה רפואית בבתי חולים ובמרפאות.