דלג לתוכן

ראייה ממוחשבת (Computer Vision)

יסודות בינה מלאכותית

🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.

הגדרה

ראייה ממוחשבת (Computer Vision) היא ענף ב-AI שמלמד מחשבים "לראות" ולהבין תוכן בתמונות ובווידאו.

💡 דוגמה

הטלפון שמזהה את הפנים שלכם ונפתח, או אפליקציה שמזהה צמח מצילום.

רמת הסבר:

איך מחשב רואה תמונה

כשאדם מסתכל על תמונה הוא רואה כלב על ספה. מה שהמחשב מקבל הוא טבלת מספרים: לכל פיקסל שלושה ערכים, לעוצמת האדום, הירוק והכחול. בתמונה רגילה יש מיליוני מספרים כאלה, ואין באף אחד מהם דבר שאומר כלב.

כל תפקידה של ראייה ממוחשבת הוא לגשר על הפער הזה — להפוך טבלת מספרים למשמעות. והקושי אינו טכני בלבד: אותו כלב עצמו מייצר טבלאות מספרים שונות לחלוטין בכל צילום. התאורה משתנה, הזווית משתנה, הכלב מוסתר למחצה, הרקע אחר. אדם אינו שם לב לזה כלל. תוכנה חייבת להתמודד עם כל וריאציה כזו במפורש.

עד כמה הקושי הזה הוערך בחסר אפשר ללמוד ממסמך מפורסם: ביולי 1966 פרסם סימור פפרט במעבדת הבינה המלאכותית של MIT מזכר שהגדיר פרויקט קיץ לסטודנטים, שמטרתו לבנות מערכת שתפריד תמונה לאזורים, תתאר את צורתם, ותזהה את העצמים שבה. המשימה הזו העסיקה את התחום שישים שנה, ולא קיץ אחד.

רגע המהפך: ImageNet ו-AlexNet

במשך עשרות שנים התבססה ראייה ממוחשבת על כללים שמהנדסים כתבו ידנית: איך לזהות קצה, איך לזהות פינה, אילו צירופים מרמזים על עצם. השיטה עבדה סבירות בתנאי מעבדה מבוקרים, ונשברה בעולם האמיתי.

שני דברים שינו את התמונה. הראשון היה מאגר נתונים. פיי-פיי לי החלה ב-2006 לפתח את הרעיון של ImageNet, מאגר של יותר מ-14 מיליון תמונות שסווגו ידנית ליותר מ-20,000 קטגוריות. עבודת התיוג עצמה נמשכה מיולי 2008 עד אפריל 2010, והעסיקה כ-49,000 עובדים מ-167 מדינות.

השני היה 2012. רשת בשם AlexNet, של אלכס קריז׳בסקי, איליה סוצקבר וג׳פרי הינטון, ניצחה את תחרות ImageNet השנתית עם שיעור טעות של 15.3% — יותר מעשר נקודות אחוז מתחת למקום השני. היא אומנה על שני כרטיסי מסך ביתיים בלבד, במשך חמישה עד שישה ימים. מאותו רגע התחום כולו עבר ללמידה עמוקה, והכללים הידניים נזנחו.

ארבע המשימות המרכזיות בתחום

ראייה ממוחשבת היא שם כולל למשפחה של משימות שונות, וכדאי להבחין ביניהן כי כל אחת דורשת דבר אחר.

סיווג תמונה עונה על שאלה אחת בלבד: מה יש בתמונה. הפלט הוא תווית אחת לתמונה כולה, למשל חתול.

זיהוי עצמים עונה גם על השאלה איפה. הפלט הוא רשימת עצמים, ולכל אחד מהם מלבן שמסמן את מיקומו בתמונה. זו המשימה שרכב אוטונומי זקוק לה כדי לדעת שיש הולך רגל, ובאיזה מרחק הוא נמצא.

פילוח, או סגמנטציה, מדייק צעד נוסף: הוא מסווג כל פיקסל בנפרד, וכך מסמן את קו המתאר המדויק של העצם. זה מה שנדרש בהדמיה רפואית, כשצריך למדוד את גבולותיו של גידול ולא רק לאתר אותו.

זיהוי פנים הוא מקרה מיוחד של השוואה: המערכת מחלצת מהפנים ייצוג מספרי, ומשווה אותו למאגר קיים כדי לקבוע במי מדובר. מכאן גם רגישותו המיוחדת מבחינת פרטיות, שכן הוא מחייב מאגר של פנים מזוהות מראש.

איך רשת קונבולוציה מזהה עצם

הטכניקה ששלטה בתחום מאז 2012 נקראת רשת קונבולוציה (CNN), והרעיון שלה פשוט להסבר.

במקום להסתכל על התמונה כולה בבת אחת, הרשת מעבירה עליה חלוניות קטנות שמחפשות תבנית מקומית מסוימת — למשל קו אלכסוני, או מעבר מבהיר לכהה. אותה חלונית בדיוק מוחלת על כל אזורי התמונה, ולכן היא מזהה את התבנית בכל מקום שבו תופיע. זו התכונה שמאפשרת לרשת לזהות חתול גם כשהוא בפינה השמאלית ולא במרכז.

השכבות מסודרות בהיררכיה. השכבה הראשונה מוצאת קצוות ופינות. השכבה שמעליה מצרפת קצוות לצורות. מעליה מצטרפות צורות לחלקים, כמו עין, אוזן או גלגל. ורק בשכבות העליונות מורכב מהם עצם שלם.

איש לא הגדיר את החלוקה הזו מראש. היא נוצרה מאליה בזמן האימון. בשנים האחרונות נוספו לתחום גם ארכיטקטורות מבוססות טרנספורמר, שמתחרות ברשתות הקונבולוציה ולעיתים עוקפות אותן.

איפה ראייה ממוחשבת עובדת היום

ראייה ממוחשבת כבר אינה הדגמה במעבדה. היא מוטמעת בתשתיות שרוב האנשים משתמשים בהן בלי לדעת.

ברפואה, מערכות שמנתחות הדמיה עוברות אישור רגולטורי בדיוק כמו מכשור רפואי אחר. רשימת המכשירים מבוססי-AI המאושרים לשיווק בארצות הברית, שמנהל מינהל המזון והתרופות האמריקאי (FDA), מונה כיום יותר מ-1,500 מכשירים, ובקרב הרשומות האחרונות בה רובם המכריע שייכים לתחום ההדמיה.

בתחבורה, החברה הישראלית Mobileye בנתה את מערכות הסיוע לנהג שלה סביב מצלמה בודדת ועיבוד תמונה, במקום סביב חיישני לייזר יקרים. לפי נתוני החברה נשלחו עד היום יותר מ-200 מיליון שבבי EyeQ לרכבים ברחבי העולם.

ובתעשייה ובחקלאות, מצלמות בקו ייצור מאתרות פגמים בקצב שאדם אינו יכול לעמוד בו, ומערכות בשדה מזהות מחלות בעלים ומאפשרות טיפול ממוקד במקום ריסוס גורף.

המגבלות: הטעיות מכוונות והטיה בנתונים

ראייה ממוחשבת נכשלת באופנים שאדם לא היה נכשל בהם, ושתי דוגמאות מוכרות ממחישות למה.

הראשונה נקראת דוגמה יריבה. במחקר שפורסם ב-2017 הדביקו חוקרים מדבקות שחורות ולבנות על תמרור עצור אמיתי. לעין אנושית התמרור נשאר תמרור עצור לגמרי. מסווג תמרורים סטנדרטי טעה בזיהוי ב-100% מהתמונות שצולמו במעבדה, וב-84.8% מפריימי הווידאו שצולמו מרכב בתנועה. השינוי לא היה בעצם עצמו, אלא בתבנית שהמודל למד להיאחז בה.

השנייה היא הטיה. במחקר Gender Shades מ-2018 בדקו ג׳וי בואלמוויני וטימניט גברו שלוש מערכות מסחריות לסיווג מגדר מתמונת פנים. שיעור השגיאה עבור נשים כהות עור הגיע ל-34.7%, לעומת 0.8% לכל היותר עבור גברים בהירי עור. הפער נבע ממאגרי אימון שהיו מוטים מלכתחילה לטובת עור בהיר — עדות לכך שהמערכת לומדת גם את מה שחסר בנתונים, לא רק את מה שיש בהם.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש המשימות שנבדלות במבנה הפלט
סיווג תמונהזיהוי עצמיםפילוח
השאלה שנעניתמה יש בתמונהמה יש ואיפה הואאילו פיקסלים שייכים לכל עצם
מבנה הפלטתווית אחת לתמונהמלבן סביב כל עצםמסכה לכל עצם, פיקסל אחר פיקסל
דוגמת שימושתיוג אלבום תמונותזיהוי הולכי רגל ברכבמדידת גבולות גידול בהדמיה

שאלות נפוצות ❓

מה זו ראייה ממוחשבת?

ענף בבינה מלאכותית שמלמד מחשבים להפיק משמעות מתמונות ומווידאו: לזהות מה מופיע בהם, איפה, ובאילו גבולות מדויקים.

איך מחשב מזהה מה יש בתמונה?

הוא מקבל את התמונה כטבלת מספרים, ורשת מאומנת מזהה בה תבניות בהדרגה: תחילה קצוות ופינות, אחר כך צורות, ולבסוף עצם שלם.

האם זיהוי פנים מדויק באותה מידה לכולם?

לא. בדיקת NIST מ-2019 בחנה 189 אלגוריתמים ומצאה ברובם שיעורי התאמת-שווא גבוהים פי 10 עד 100 בפנים אסייתיות ואפרו-אמריקאיות לעומת פנים של לבנים.

איפה נתקלים בראייה ממוחשבת ביומיום?

בפתיחת טלפון בזיהוי פנים, בחיפוש בתמונות לפי תוכן, במערכות סיוע לנהג ברכב, ובניתוח הדמיה רפואית בבתי חולים ובמרפאות.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו