דלג לתוכן

למידה עמוקה (Deep Learning)

יסודות בינה מלאכותית

🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.

הגדרה

למידה עמוקה (Deep Learning) היא תת-ענף של למידת מכונה המבוסס על רשתות נוירונים מרובות-שכבות, ועומד מאחורי רוב הפריצות המרשימות של AI כיום.

💡 דוגמה

ברשת שמזהה פנים, השכבות הראשונות רואות רק קווים. השכבות האמצעיות מרכיבות מהם עיניים ואף, והשכבות העמוקות מזהות פרצוף שלם.

רמת הסבר:

מה זו למידה עמוקה: למידת-ייצוגים היררכית, ומהפכת 2012

למידה עמוקה (Deep Learning) היא תת-ענף של למידת מכונה (Machine Learning) המבוסס על רשתות נוירונים (Neural Networks) מרובות-שכבות — ועומד מאחורי רוב הפריצות המרשימות ביותר של בינה מלאכותית (AI) בעשור האחרון, מזיהוי-תמונות ועד מודלי שפה גדולים (LLM). המילה "עמוקה" מתייחסת ישירות למספר-השכבות ברשת: בעוד רשת-נוירונים "רדודה" מכילה שכבה נסתרת אחת או שתיים בין הקלט לפלט, רשת עמוקה מכילה עשרות, מאות, ולעיתים אף אלפי שכבות — כל שכבה מעבדת את הפלט של קודמתה ומחלצת ממנו ייצוג מופשט-יותר. הרעיון המרכזי, שנקרא "למידת-ייצוגים היררכית" (Hierarchical Representation Learning): ברשת שמזהה פנים, למשל, השכבות הראשונות לומדות לזהות קווים ומרקמים בסיסיים, שכבות אמצעיות מרכיבות מהם צורות כמו עיניים ואף, ושכבות עמוקות-יותר מרכיבות מהצורות פרצוף שלם — היררכיה שהמערכת בונה בעצמה מתוך דוגמאות, בלי שאיש תכנת במפורש אילו תכונות-ביניים לחפש.

השורשים הרעיוניים של למידה עמוקה קדומים משמעותית מהמודעות הציבורית לתחום: האלגוריתם הראשון שנחשב היום למקדים-של-למידה-עמוקה פורסם כבר ב-1965 על ידי אלכסיי איוואחננקו ולפא, בשיטה שנקראה "שיטת-קיבוץ-נתונים" (Group Method of Data Handling). אבל הפריצה שהפכה למידה עמוקה מהתחום-שולי, שרוב-חוקרי-ה-AI התייחסו אליו בספקנות, לזרם-המרכזי הדומיננטי, קרתה מאוחר הרבה יותר — ב-2012, כשרשת בשם AlexNet ניצחה בפער דרמטי בתחרות זיהוי-התמונות השנתית ImageNet, וצמצמה את שיעור-הטעויות ביחס לשיטות המובילות שקדמו לה בכמעט מחצית. האירוע הזה, שידוע כ"מהפכת-הלמידה-העמוקה", שכנע תוך שנים בודדות את רוב-קהילת-המחקר לעבור לגישה החדשה.

מה אפשר את הקפיצה: חומרה, נתונים וארכיטקטורות (CNN, RNN, טרנספורמר)

שני גורמים טכניים-חיצוניים אפשרו את הקפיצה הזו, מעבר לרעיון-הבסיס עצמו: חומרה וזמינות-נתונים. אימון רשת עמוקה דורש כמות עצומה של חישוב-מקבילי — פעולת-הכפל-והחיבור הבסיסית שממנה בנוי כל אימון-רשת-נוירונים מתאימה במיוחד לחומרה שפותחה במקור למשחקי-מחשב: מעבד-הגרפיקה (GPU — Graphics Processing Unit). כרטיסי-GPU מודרניים מסוגלים לבצע אלפי פעולות-חישוב פשוטות במקביל, בניגוד למעבד-מחשב רגיל (CPU) שמותאם לפעולות-מורכבות-ברצף — הבדל שהפך את אימון-הרשתות-העמוקות מעשי בקנה-מידה שלא היה אפשרי קודם. במקביל, התפוצצות-האינטרנט ורשתות-חברתיות סיפקו לראשונה כמויות-ענק של נתונים-מתויגים (בעיקר תמונות עם כיתוב) שדרושים לאימון רשת עמוקה בהצלחה — שילוב בין רעיון-ותיק, חומרה-חדשה, ונתונים-בשפע, ולא רק פריצת-דרך-אלגוריתמית בודדת.

ארכיטקטורות למידה-עמוקה מתמחות בסוגי-מידע שונים, כל אחת מותאמת למבנה הפנימי של הנתונים שהיא מעבדת. רשתות-קונבולוציה (Convolutional Neural Networks — CNN) מתמחות בעיבוד-תמונות: הן סורקות את התמונה בחלונות-קטנים-חופפים, בדומה לאופן שבו העין האנושית סורקת סצנה, מה שהופך אותן יעילות מאוד בזיהוי-דפוסים-מקומיים כמו קצוות ומרקמים. Mobileye, החברה הישראלית שהקים ב-1999 אמנון שעשוע, פרופסור למדעי-המחשב באוניברסיטה העברית בירושלים, עברה סביב 2014-2015 לבסס את מערכות-הראייה-הממוחשבת שלה לרכב על רשתות-קונבולוציה עמוקות בהשראת הפריצה של AlexNet — מעבר ששעשוע עצמו תיאר בהרצאה באוניברסיטת MIT במרץ 2015, כאחד המהלכים המסחריים המוקדמים שהביאו למידה עמוקה בפועל אל תוך רכבים. רשתות-חוזרות (Recurrent Neural Networks — RNN) ונגזרותיהן, כמו LSTM (זיכרון-לטווח-קצר-ארוך), תוכננו לעיבוד-רצפים כמו טקסט או סדרות-זמן, בעלות "זיכרון" פנימי שמעביר מידע ממילה למילה. מאז 2017, ארכיטקטורת הטרנספורמר (Transformer) — שמנגנון "תשומת-הלב" (Attention) שלה מאפשר לבחון את כל הרצף בבת-אחת במקום ברצף — החליפה במידה רבה את הרשתות-החוזרות כארכיטקטורת-הבחירה למשימות-טקסט, ועומדת מאחורי כל מודלי השפה הגדולים המובילים כיום.

איך מאמנים: ירידת-גרדיאנט, והבעיה שהגבילה עומק

תהליך-האימון של רשת עמוקה מבוסס על שני עקרונות-מתמטיים מרכזיים: "ירידת-גרדיאנט" (Gradient Descent), שיטה שמכווננת בהדרגה את משקלי-הרשת בכיוון שמקטין את שיעור-הטעויות, ו"התפשטות-לאחור" (Backpropagation), האלגוריתם שמחשב בפועל כיצד לשנות כל משקל בודד ברשת כדי להשיג את השיפור הזה. השילוב ביניהם, שהוצג כשיטה מעשית כבר בשנות ה-1980, נשאר עד היום המנגנון הבסיסי שממנו בנוי כמעט כל תהליך-אימון של רשת-נוירונים, כולל המודלים הגדולים ביותר של 2026 — למרות עשרות שנות שכלולים הנדסיים סביבו.

לפני שהפריצה של 2012 קרתה, רשתות-עמוקות-במיוחד היו נחשבות קשות-לאימון-בפועל, בעיקר בגלל תופעה שנקראת "התפוגגות-הגרדיאנט" (Vanishing Gradient): באלגוריתם ההתפשטות-לאחור, האות-שמלמד את השכבות המוקדמות ברשת נחלש והולך ככל שהוא "עובר" דרך יותר שכבות, עד שהשכבות הראשונות כמעט מפסיקות ללמוד בכלל, גם כשהשכבות המאוחרות-יותר עדיין משתפרות. הבעיה הגבילה בפועל את עומק-הרשתות שאפשר היה לאמן בהצלחה, למרות שהרעיון התיאורטי-של-עומק היה ידוע כבר קודם. פתרונות הנדסיים שהתפתחו במהלך השנים — פונקציות-הפעלה חדשות (כמו ReLU, שהחליפו פונקציות ותיקות-יותר שסבלו מהבעיה בצורה חריפה יותר), שיטות-אתחול-משקלים חכמות יותר, ו"חיבורי-דילוג" (Skip Connections) בארכיטקטורות כמו ResNet (2015) שמאפשרים לאות "לעקוף" שכבות שלמות — הם אלה שהפכו אימון-רשתות-עמוקות-באמת (עשרות ומאות שכבות) לישים בפועל, לא רק לרעיון תיאורטי.

למידת-העברה, וגידול הפרמטרים לטריליונים

תרגול נפוץ ומשמעותי כלכלית בעולם הלמידה-העמוקה נקרא "למידת-העברה" (Transfer Learning): במקום לאמן רשת חדשה מאפס — תהליך יקר וזמן-רב — לוקחים רשת שכבר אומנה על משימה כללית וגדולה (למשל זיהוי-אלפי-קטגוריות-שונות בתמונות מתוך מאגר-ImageNet), ומכווננים רק את השכבות האחרונות שלה למשימה הספציפית והצרה-יותר שרוצים לפתור. הגישה הזו עובדת היטב כי השכבות המוקדמות של רשת-ראייה שאומנה על מגוון-תמונות רחב כבר למדו לזהות תכונות-בסיסיות ואוניברסליות למדי — קווים, מרקמים, צורות — שרלוונטיות כמעט לכל משימת-ראייה, לא רק לזו הספציפית שעליה אומנה במקור. אותו עיקרון בדיוק, בהקשר של טקסט ולא תמונות, הוא הבסיס לכך שכוונון עדין (Fine-tuning) של מודל שפה גדול קיים כל-כך יעיל בהשוואה לאימון-מודל-חדש-מאפס.

היקף-הפרמטרים שרשתות עמוקות מודרניות מכילות גדל בקצב דרמטי. בעוד רשתות מוקדמות כמו AlexNet הכילו כ-60 מיליון פרמטרים בלבד — כבר הישג מרשים בזמנו — מודלי-הדגל של 2026 עשויים להכיל מאות מיליארדים עד טריליוני פרמטרים, לרוב בארכיטקטורת "תערובת-מומחים" (Mixture-of-Experts) שמפעילה רק חלק מהפרמטרים בכל שאילתה כדי לחסוך בעלות-חישוב. הגידול הזה לא היה ניתן-לניצול בלי שני התובנות המקבילות שכבר תוארו — חומרת-GPU יעילה יותר ויותר, וכמות-נתונים גדלה יחסית להיקף.

המגבלות: לא הבנה, רגישות לדוגמאות-יריבות, ועלות

חשוב לזכור את מגבלת-היסוד: למידה עמוקה, כמו כל למידת מכונה, מזהה דפוסים סטטיסטיים מהנתונים שהיא רואה, לא "מבינה" משמעות במובן שמקביל להבנה אנושית. רשת עמוקה גם רגישה במיוחד לתופעה שנקראת "דוגמאות-יריבות" (Adversarial Examples) — שינויים זעירים בקלט, לעיתים בלתי-נראים כמעט לעין אנושית, שגורמים לרשת לטעות בביטחון-מלא: תמונה שאדם מזהה בבירור כפנדה עלולה, אחרי שינוי-פיקסלים זעיר-ומחושב-בקפידה, להיות מסווגת על ידי הרשת כ"גיבון" בביטחון גבוה מאוד. התופעה הזו חושפת פער יסודי בין "מה שהרשת בפועל למדה" לבין "מה שהיה נראה אינטואיטיבי שהיא למדה", ומהווה שיקול-אבטחה ממשי במערכות-קריטיות (כמו זיהוי-פנים או רכבים-אוטונומיים) שמסתמכות על למידה עמוקה.

עלות אימון-מודלי-הדגל הגדולים ביותר גדלה בקצב שמעורר דיון ציבורי הולך-וגובר — הן מבחינה כלכלית והן מבחינה סביבתית. אימון מודל בקנה-מידה-מוביל נאמד כיום במאות מיליוני דולרים בחומרה ובזמן-חישוב, וצריכת-האנרגיה הכרוכה בכך מושווית לעיתים לצריכה השנתית של אלפי בתי-אב — עלות שמצטמצמת רק על ידי חלק קטן מהחברות בעולם המסוגלות לגייס משאבים כאלה, ומעלה שאלות עקרוניות על ריכוזיות-הכוח בתחום מרכזי-כל-כך בכלכלה העתידית.

קופסה-שחורה: מגבלת ההסבר, ובינה מלאכותית ניתנת-להסבר

חשוב לזכור גם שלמרות ההצלחות המרשימות, למידה עמוקה עדיין נחשבת ל"קופסה-שחורה" (Black Box) במידה משמעותית: גם החוקרים שבנו רשת מסוימת מתקשים לרוב להסביר במדויק למה היא הגיעה לתשובה ספציפית, כי ה"ידע" שלה מקודד בתוך מיליוני או מיליארדי משקלים מספריים, לא בכללים קריאים-לאדם. תחום-מחקר שלם, "בינה מלאכותית ניתנת-להסבר" (Explainable AI — XAI), עוסק בפיתוח שיטות שמנסות לפתוח את הקופסה השחורה הזו ולו-במקצת — חשיבות מעשית מיוחדת בתחומים רגישים כמו רפואה ומשפט, שם דרישה חוקית או אתית לסיבה-מובנת מאחורי החלטה היא לעיתים לא-פחות חשובה מדיוק-ההחלטה עצמה.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה ההבדל בין למידה עמוקה ללמידת מכונה?

למידה עמוקה היא תת-ענף ספציפי של למידת מכונה שמבוסס על רשתות-נוירונים מרובות-שכבות; לא כל למידת-מכונה היא עמוקה — יש שיטות פשוטות יותר כמו עצי-החלטה.

למה קוראים לזה "עמוקה"?

המילה מתייחסת למספר-השכבות ברשת — רשת עם עשרות או מאות שכבות נחשבת "עמוקה", לעומת רשת "רדודה" עם שכבה אחת או שתיים בלבד.

מה זו "דוגמה-יריבה"?

שינוי זעיר ומחושב-בקפידה בקלט, לעיתים בלתי-נראה לעין אנושית, שגורם לרשת עמוקה לטעות בביטחון-מלא — למשל תמונת-פנדה שמסווגת כ"גיבון".

האם אפשר להבין למה רשת עמוקה הגיעה לתשובה מסוימת?

לרוב לא במלואו — הידע מקודד במיליוני משקלים מספריים, לא בכללים קריאים; תחום שלם, בינה מלאכותית ניתנת-להסבר (XAI), עוסק בפיתוח שיטות להאיר את "הקופסה השחורה" הזו.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו