דלג לתוכן

רשת קונבולוציה (CNN)

יסודות בינה מלאכותית

הגדרה

רשת קונבולוציה היא סוג רשת נוירונים המותאם במיוחד לעיבוד תמונות — סורקת אזורים קטנים בתמונה כדי לזהות דפוסים כמו קצוות, צורות ואובייקטים.

רשת קונבולוציה (CNN — Convolutional Neural Network) היא סוג רשת נוירונים שהתפתחה במיוחד לעיבוד תמונות. במקום להסתכל על כל פיקסל בנפרד, היא סורקת חלונות קטנים (כמו 3x3 פיקסלים) על פני התמונה כולה, ומזהה דפוסים מקומיים — קו, פינה, טקסטורה — ומצרפת אותם בהדרגה לזיהוי אובייקטים שלמים.

הרעיון המקורי מבוסס על ה"ניאוקוגניטרון", מודל שהציע החוקר היפני קונאיהיקו פוקושימה כבר ב-1980, בהשראת אופן פעולת קליפת-המוח החזותית. יאן לה-קון פיתח בהמשך, בסוף שנות ה-80 ותחילת ה-90, את הגרסה שהפכה לסטנדרט המודרני — LeNet-5, שזיהתה ספרות כתובות-ביד על צ'קים בנקאיים.

CNN היו הטכנולוגיה שהובילה את מהפכת הראייה הממוחשבת (ראו AlexNet, 2012), ועדיין נמצאות בבסיס יישומים רבים כמו זיהוי-פנים, רכב אוטונומי, ואבחון רפואי מתמונות — אף שבשנים האחרונות ארכיטקטורות מבוססות-טרנספורמר מתחילות להתחרות בהן גם בתחום הראייה.

בעיה מוקדמת שהגבילה כמה שכבות אפשר לערום ב-CNN הייתה "התפוגגות הגרדיאנט" (Vanishing Gradient) — ככל שהרשת עמוקה יותר, אות-התיקון שמגיע מ-backpropagation נחלש עד שהוא כמעט נעלם בשכבות הראשונות. ב-2015 חוקרי מיקרוסופט בהובלת קאימינג הה פרסמו את ResNet, ארכיטקטורה עם "קפיצות-מקצרות" (Skip Connections) שמעבירות מידע ישירות בין שכבות לא-סמוכות ופתרו את הבעיה — מה שאיפשר לבנות CNN בעלות מאות שכבות, פי כמה עמוקות מכל מה שהיה אפשרי קודם, ולנצח באותה שנה את תחרות ImageNet. הפתרון הזה, יחד עם פונקציית-ההפעלה ReLU (Rectified Linear Unit), הם הסיבה המרכזית לכך שרשתות עמוקות-מאוד הפכו מעשיות בכלל, לא רק ב-CNN אלא כמעט בכל ארכיטקטורת-למידה-עמוקה מודרנית.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו