למידה עמוקה (Deep Learning)
🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.
הגדרה
למידה עמוקה (Deep Learning) היא תת-ענף של למידת מכונה המבוסס על רשתות נוירונים מרובות-שכבות, ועומד מאחורי רוב הפריצות המרשימות של AI כיום.
💡 דוגמה
ברשת שמזהה פנים, השכבות הראשונות רואות רק קווים. השכבות האמצעיות מרכיבות מהם עיניים ואף, והשכבות העמוקות מזהות פרצוף שלם.
מה זו למידה עמוקה: למידת-ייצוגים היררכית, ומהפכת 2012
למידה עמוקה (Deep Learning) היא תת-ענף של למידת מכונה (Machine Learning) המבוסס על רשתות נוירונים (Neural Networks) מרובות-שכבות — ועומד מאחורי רוב הפריצות המרשימות ביותר של בינה מלאכותית (AI) בעשור האחרון, מזיהוי-תמונות ועד מודלי שפה גדולים (LLM). המילה "עמוקה" מתייחסת ישירות למספר-השכבות ברשת: בעוד רשת-נוירונים "רדודה" מכילה שכבה נסתרת אחת או שתיים בין הקלט לפלט, רשת עמוקה מכילה עשרות, מאות, ולעיתים אף אלפי שכבות — כל שכבה מעבדת את הפלט של קודמתה ומחלצת ממנו ייצוג מופשט-יותר. הרעיון המרכזי, שנקרא "למידת-ייצוגים היררכית" (Hierarchical Representation Learning): ברשת שמזהה פנים, למשל, השכבות הראשונות לומדות לזהות קווים ומרקמים בסיסיים, שכבות אמצעיות מרכיבות מהם צורות כמו עיניים ואף, ושכבות עמוקות-יותר מרכיבות מהצורות פרצוף שלם — היררכיה שהמערכת בונה בעצמה מתוך דוגמאות, בלי שאיש תכנת במפורש אילו תכונות-ביניים לחפש.
השורשים הרעיוניים של למידה עמוקה קדומים משמעותית מהמודעות הציבורית לתחום: האלגוריתם הראשון שנחשב היום למקדים-של-למידה-עמוקה פורסם כבר ב-1965 על ידי אלכסיי איוואחננקו ולפא, בשיטה שנקראה "שיטת-קיבוץ-נתונים" (Group Method of Data Handling). אבל הפריצה שהפכה למידה עמוקה מהתחום-שולי, שרוב-חוקרי-ה-AI התייחסו אליו בספקנות, לזרם-המרכזי הדומיננטי, קרתה מאוחר הרבה יותר — ב-2012, כשרשת בשם AlexNet ניצחה בפער דרמטי בתחרות זיהוי-התמונות השנתית ImageNet, וצמצמה את שיעור-הטעויות ביחס לשיטות המובילות שקדמו לה בכמעט מחצית. האירוע הזה, שידוע כ"מהפכת-הלמידה-העמוקה", שכנע תוך שנים בודדות את רוב-קהילת-המחקר לעבור לגישה החדשה.
מה אפשר את הקפיצה: חומרה, נתונים וארכיטקטורות (CNN, RNN, טרנספורמר)
שני גורמים טכניים-חיצוניים אפשרו את הקפיצה הזו, מעבר לרעיון-הבסיס עצמו: חומרה וזמינות-נתונים. אימון רשת עמוקה דורש כמות עצומה של חישוב-מקבילי — פעולת-הכפל-והחיבור הבסיסית שממנה בנוי כל אימון-רשת-נוירונים מתאימה במיוחד לחומרה שפותחה במקור למשחקי-מחשב: מעבד-הגרפיקה (GPU — Graphics Processing Unit). כרטיסי-GPU מודרניים מסוגלים לבצע אלפי פעולות-חישוב פשוטות במקביל, בניגוד למעבד-מחשב רגיל (CPU) שמותאם לפעולות-מורכבות-ברצף — הבדל שהפך את אימון-הרשתות-העמוקות מעשי בקנה-מידה שלא היה אפשרי קודם. במקביל, התפוצצות-האינטרנט ורשתות-חברתיות סיפקו לראשונה כמויות-ענק של נתונים-מתויגים (בעיקר תמונות עם כיתוב) שדרושים לאימון רשת עמוקה בהצלחה — שילוב בין רעיון-ותיק, חומרה-חדשה, ונתונים-בשפע, ולא רק פריצת-דרך-אלגוריתמית בודדת.
ארכיטקטורות למידה-עמוקה מתמחות בסוגי-מידע שונים, כל אחת מותאמת למבנה הפנימי של הנתונים שהיא מעבדת. רשתות-קונבולוציה (Convolutional Neural Networks — CNN) מתמחות בעיבוד-תמונות: הן סורקות את התמונה בחלונות-קטנים-חופפים, בדומה לאופן שבו העין האנושית סורקת סצנה, מה שהופך אותן יעילות מאוד בזיהוי-דפוסים-מקומיים כמו קצוות ומרקמים. Mobileye, החברה הישראלית שהקים ב-1999 אמנון שעשוע, פרופסור למדעי-המחשב באוניברסיטה העברית בירושלים, עברה סביב 2014-2015 לבסס את מערכות-הראייה-הממוחשבת שלה לרכב על רשתות-קונבולוציה עמוקות בהשראת הפריצה של AlexNet — מעבר ששעשוע עצמו תיאר בהרצאה באוניברסיטת MIT במרץ 2015, כאחד המהלכים המסחריים המוקדמים שהביאו למידה עמוקה בפועל אל תוך רכבים. רשתות-חוזרות (Recurrent Neural Networks — RNN) ונגזרותיהן, כמו LSTM (זיכרון-לטווח-קצר-ארוך), תוכננו לעיבוד-רצפים כמו טקסט או סדרות-זמן, בעלות "זיכרון" פנימי שמעביר מידע ממילה למילה. מאז 2017, ארכיטקטורת הטרנספורמר (Transformer) — שמנגנון "תשומת-הלב" (Attention) שלה מאפשר לבחון את כל הרצף בבת-אחת במקום ברצף — החליפה במידה רבה את הרשתות-החוזרות כארכיטקטורת-הבחירה למשימות-טקסט, ועומדת מאחורי כל מודלי השפה הגדולים המובילים כיום.
איך מאמנים: ירידת-גרדיאנט, והבעיה שהגבילה עומק
תהליך-האימון של רשת עמוקה מבוסס על שני עקרונות-מתמטיים מרכזיים: "ירידת-גרדיאנט" (Gradient Descent), שיטה שמכווננת בהדרגה את משקלי-הרשת בכיוון שמקטין את שיעור-הטעויות, ו"התפשטות-לאחור" (Backpropagation), האלגוריתם שמחשב בפועל כיצד לשנות כל משקל בודד ברשת כדי להשיג את השיפור הזה. השילוב ביניהם, שהוצג כשיטה מעשית כבר בשנות ה-1980, נשאר עד היום המנגנון הבסיסי שממנו בנוי כמעט כל תהליך-אימון של רשת-נוירונים, כולל המודלים הגדולים ביותר של 2026 — למרות עשרות שנות שכלולים הנדסיים סביבו.
לפני שהפריצה של 2012 קרתה, רשתות-עמוקות-במיוחד היו נחשבות קשות-לאימון-בפועל, בעיקר בגלל תופעה שנקראת "התפוגגות-הגרדיאנט" (Vanishing Gradient): באלגוריתם ההתפשטות-לאחור, האות-שמלמד את השכבות המוקדמות ברשת נחלש והולך ככל שהוא "עובר" דרך יותר שכבות, עד שהשכבות הראשונות כמעט מפסיקות ללמוד בכלל, גם כשהשכבות המאוחרות-יותר עדיין משתפרות. הבעיה הגבילה בפועל את עומק-הרשתות שאפשר היה לאמן בהצלחה, למרות שהרעיון התיאורטי-של-עומק היה ידוע כבר קודם. פתרונות הנדסיים שהתפתחו במהלך השנים — פונקציות-הפעלה חדשות (כמו ReLU, שהחליפו פונקציות ותיקות-יותר שסבלו מהבעיה בצורה חריפה יותר), שיטות-אתחול-משקלים חכמות יותר, ו"חיבורי-דילוג" (Skip Connections) בארכיטקטורות כמו ResNet (2015) שמאפשרים לאות "לעקוף" שכבות שלמות — הם אלה שהפכו אימון-רשתות-עמוקות-באמת (עשרות ומאות שכבות) לישים בפועל, לא רק לרעיון תיאורטי.
למידת-העברה, וגידול הפרמטרים לטריליונים
תרגול נפוץ ומשמעותי כלכלית בעולם הלמידה-העמוקה נקרא "למידת-העברה" (Transfer Learning): במקום לאמן רשת חדשה מאפס — תהליך יקר וזמן-רב — לוקחים רשת שכבר אומנה על משימה כללית וגדולה (למשל זיהוי-אלפי-קטגוריות-שונות בתמונות מתוך מאגר-ImageNet), ומכווננים רק את השכבות האחרונות שלה למשימה הספציפית והצרה-יותר שרוצים לפתור. הגישה הזו עובדת היטב כי השכבות המוקדמות של רשת-ראייה שאומנה על מגוון-תמונות רחב כבר למדו לזהות תכונות-בסיסיות ואוניברסליות למדי — קווים, מרקמים, צורות — שרלוונטיות כמעט לכל משימת-ראייה, לא רק לזו הספציפית שעליה אומנה במקור. אותו עיקרון בדיוק, בהקשר של טקסט ולא תמונות, הוא הבסיס לכך שכוונון עדין (Fine-tuning) של מודל שפה גדול קיים כל-כך יעיל בהשוואה לאימון-מודל-חדש-מאפס.
היקף-הפרמטרים שרשתות עמוקות מודרניות מכילות גדל בקצב דרמטי. בעוד רשתות מוקדמות כמו AlexNet הכילו כ-60 מיליון פרמטרים בלבד — כבר הישג מרשים בזמנו — מודלי-הדגל של 2026 עשויים להכיל מאות מיליארדים עד טריליוני פרמטרים, לרוב בארכיטקטורת "תערובת-מומחים" (Mixture-of-Experts) שמפעילה רק חלק מהפרמטרים בכל שאילתה כדי לחסוך בעלות-חישוב. הגידול הזה לא היה ניתן-לניצול בלי שני התובנות המקבילות שכבר תוארו — חומרת-GPU יעילה יותר ויותר, וכמות-נתונים גדלה יחסית להיקף.
המגבלות: לא הבנה, רגישות לדוגמאות-יריבות, ועלות
חשוב לזכור את מגבלת-היסוד: למידה עמוקה, כמו כל למידת מכונה, מזהה דפוסים סטטיסטיים מהנתונים שהיא רואה, לא "מבינה" משמעות במובן שמקביל להבנה אנושית. רשת עמוקה גם רגישה במיוחד לתופעה שנקראת "דוגמאות-יריבות" (Adversarial Examples) — שינויים זעירים בקלט, לעיתים בלתי-נראים כמעט לעין אנושית, שגורמים לרשת לטעות בביטחון-מלא: תמונה שאדם מזהה בבירור כפנדה עלולה, אחרי שינוי-פיקסלים זעיר-ומחושב-בקפידה, להיות מסווגת על ידי הרשת כ"גיבון" בביטחון גבוה מאוד. התופעה הזו חושפת פער יסודי בין "מה שהרשת בפועל למדה" לבין "מה שהיה נראה אינטואיטיבי שהיא למדה", ומהווה שיקול-אבטחה ממשי במערכות-קריטיות (כמו זיהוי-פנים או רכבים-אוטונומיים) שמסתמכות על למידה עמוקה.
עלות אימון-מודלי-הדגל הגדולים ביותר גדלה בקצב שמעורר דיון ציבורי הולך-וגובר — הן מבחינה כלכלית והן מבחינה סביבתית. אימון מודל בקנה-מידה-מוביל נאמד כיום במאות מיליוני דולרים בחומרה ובזמן-חישוב, וצריכת-האנרגיה הכרוכה בכך מושווית לעיתים לצריכה השנתית של אלפי בתי-אב — עלות שמצטמצמת רק על ידי חלק קטן מהחברות בעולם המסוגלות לגייס משאבים כאלה, ומעלה שאלות עקרוניות על ריכוזיות-הכוח בתחום מרכזי-כל-כך בכלכלה העתידית.
קופסה-שחורה: מגבלת ההסבר, ובינה מלאכותית ניתנת-להסבר
חשוב לזכור גם שלמרות ההצלחות המרשימות, למידה עמוקה עדיין נחשבת ל"קופסה-שחורה" (Black Box) במידה משמעותית: גם החוקרים שבנו רשת מסוימת מתקשים לרוב להסביר במדויק למה היא הגיעה לתשובה ספציפית, כי ה"ידע" שלה מקודד בתוך מיליוני או מיליארדי משקלים מספריים, לא בכללים קריאים-לאדם. תחום-מחקר שלם, "בינה מלאכותית ניתנת-להסבר" (Explainable AI — XAI), עוסק בפיתוח שיטות שמנסות לפתוח את הקופסה השחורה הזו ולו-במקצת — חשיבות מעשית מיוחדת בתחומים רגישים כמו רפואה ומשפט, שם דרישה חוקית או אתית לסיבה-מובנת מאחורי החלטה היא לעיתים לא-פחות חשובה מדיוק-ההחלטה עצמה.
גרסה פשוטה של הערך, לגיל 12. כל מה שכתוב כאן מופיע גם בערך המלא.
למידה עמוקה היא סוג של למידת מכונה, כלומר דרך שבה מחשב לומד מדוגמאות. היא בנויה על רשתות נוירונים: מבנים מתמטיים שעשויים משכבות של יחידות חישוב קטנות. המילה "עמוקה" מתארת כמה שכבות יש ברשת. ברשת "רדודה" יש שכבה נסתרת אחת או שתיים. ברשת עמוקה יש עשרות, מאות ולפעמים אלפי שכבות.
למה צריך כל כך הרבה שכבות? כל שכבה מקבלת את מה שהשכבה הקודמת מצאה, ובונה ממנו משהו מופשט יותר. ברשת שמזהה פנים, השכבות הראשונות לומדות לזהות קווים ומרקמים. השכבות האמצעיות מרכיבות מהם צורות כמו עיניים ואף. והשכבות העמוקות מרכיבות מהן פרצוף שלם. זה קצת כמו ללמוד לקרוא: קודם אותיות, אחר-כך מילים, ואז משפטים. ההבדל הוא שאף אחד לא אמר לרשת מה לחפש בכל שלב. היא בנתה את הסדר הזה בעצמה, מתוך דוגמאות.
הרעיון עצמו ותיק, אבל הוא התחיל לעבוד בגדול רק ב-2012, כשרשת בשם AlexNet ניצחה בפער גדול בתחרות לזיהוי תמונות. אחד הדברים שעזרו: מעבד גרפי (GPU), חומרה שפותחה במקור למשחקי מחשב. הוא יודע לעשות אלפי חישובים פשוטים באותו זמן, בדיוק מה שאימון של רשת כזאת צריך.
אבל רשת עמוקה לא מבינה מה היא רואה כמו שאנחנו מבינים. אפשר לשנות בתמונה של פנדה נקודות קטנות, בשינוי זעיר שמחושב בקפידה ושאדם כמעט לא רואה, והרשת תגיד בביטחון מלא שזה גיבון. וגם החוקרים שבנו רשת כזאת מתקשים לרוב להסביר למה היא ענתה מה שענתה.
למידה עמוקה עומדת מאחורי רוב ההתקדמות הגדולה בבינה מלאכותית בשנים האחרונות, מזיהוי תמונות ועד מודלי השפה הגדולים.
מה המושג אומר לארגון ולעסק. כל עובדה כאן מופיעה גם בערך המלא.
למידה עמוקה היא תת-ענף של למידת מכונה, המבוסס על רשתות נוירונים מרובות-שכבות. ההבדל המהותי מול שיטות ותיקות: אף אחד לא מגדיר לרשת מראש אילו מאפיינים לחפש. היא בונה אותם בעצמה, שכבה על גבי שכבה, מתוך הדוגמאות. זו הטכנולוגיה שמאחורי רוב הפריצות המרשימות של השנים האחרונות, מזיהוי-תמונות ועד מודלי שפה גדולים.
בארגון זה פוגש אתכם בכל מערכת שמעבדת תמונה, טקסט או רצפים. לכל סוג מידע יש ארכיטקטורה משלו: רשתות-קונבולוציה לתמונות, ומאז 2017 ארכיטקטורת הטרנספורמר לטקסט, שעומדת מאחורי כל מודלי השפה הגדולים המובילים. אימון רשת מאפס יקר ואיטי, ולכן דרך נפוצה היא למידת-העברה: לוקחים רשת שכבר אומנה על משימה כללית וגדולה, ומכווננים רק חלק ממנה למשימה הצרה שלכם. זה עובד כי השכבות המוקדמות כבר למדו תכונות בסיסיות שרלוונטיות כמעט לכל משימה מאותו סוג.
היתרון הוא שאין צורך להגדיר לרשת מראש מה לחפש: היא בונה את המאפיינים בעצמה מתוך הדוגמאות. הגבולות: ראשית, "קופסה שחורה". גם מי שבנה את הרשת מתקשה לרוב להסביר למה הגיעה לתשובה מסוימת, כי הידע שלה מקודד במשקלים מספריים ולא בכללים קריאים. בתחומים כמו רפואה ומשפט, שבהם נדרשת סיבה מובנת להחלטה, זה שיקול מרכזי, ויש תחום מחקר שלם שמנסה להתמודד עם זה. שנית, "דוגמאות-יריבות": שינוי זעיר ומחושב בקלט, כמעט בלתי-נראה, יכול לגרום לרשת לטעות בביטחון מלא. במערכות כמו זיהוי-פנים זה שיקול אבטחה ממשי. שלישית, הרשת מזהה דפוסים ואינה מבינה משמעות. ורביעית, אימון מודלי-הדגל הגדולים דורש משאבים שרק חלק קטן מהחברות בעולם מסוגל לגייס, ולכן כדאי להבין על מי אתם נשענים.
שאלות שכדאי לשאול ספק, צוות או יועץ:
- האם המערכת אומנה מאפס או כווננה מרשת קיימת, ועל אילו נתונים שלנו בוצע הכוונון?
- כשהמערכת טועה או מחליטה החלטה רגישה, איזה הסבר אפשר לקבל, ובאיזו שיטה הוא מופק?
- איך נבדקה העמידות של המערכת מול שינויים זעירים ומכוונים בקלט?
- איזו ארכיטקטורה משמשת כאן, ולמה היא מתאימה לסוג המידע שלנו?
- מי מחזיק את המודל הבסיסי שעליו נבנתה המערכת, ומה קורה לנו אם הוא משתנה?
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
מה ההבדל בין למידה עמוקה ללמידת מכונה?
למידה עמוקה היא תת-ענף ספציפי של למידת מכונה שמבוסס על רשתות-נוירונים מרובות-שכבות; לא כל למידת-מכונה היא עמוקה — יש שיטות פשוטות יותר כמו עצי-החלטה.
למה קוראים לזה "עמוקה"?
המילה מתייחסת למספר-השכבות ברשת — רשת עם עשרות או מאות שכבות נחשבת "עמוקה", לעומת רשת "רדודה" עם שכבה אחת או שתיים בלבד.
מה זו "דוגמה-יריבה"?
שינוי זעיר ומחושב-בקפידה בקלט, לעיתים בלתי-נראה לעין אנושית, שגורם לרשת עמוקה לטעות בביטחון-מלא — למשל תמונת-פנדה שמסווגת כ"גיבון".
האם אפשר להבין למה רשת עמוקה הגיעה לתשובה מסוימת?
לרוב לא במלואו — הידע מקודד במיליוני משקלים מספריים, לא בכללים קריאים; תחום שלם, בינה מלאכותית ניתנת-להסבר (XAI), עוסק בפיתוח שיטות להאיר את "הקופסה השחורה" הזו.