דלג לתוכן

רשת נוירונים (Neural Network)

יסודות בינה מלאכותית

🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.

הגדרה

רשת נוירונים (Neural Network) היא מבנה מתמטי בהשראת המוח האנושי, בנוי משכבות של יחידות חישוב שנקראות נוירונים.

💡 דוגמה

תמונה נכנסת כפיקסלים, עוברת דרך שכבות של "נוירונים" שכל אחד מחשב משהו קטן, ובסוף הרשת אומרת "זה חתול".

רמת הסבר:

מה זו רשת נוירונים: איך נוירון בודד עובד

רשת נוירונים (Neural Network) היא מבנה מתמטי-חישובי בהשראת המוח האנושי, בנוי משכבות של יחידות-חישוב פשוטות שנקראות "נוירונים" (או "נוירונים מלאכותיים" — Artificial Neurons, כדי להבחין מהתא-העצבי-הביולוגי שממנו שאולה המטאפורה). כל נוירון בודד מבצע פעולה פשוטה להפליא: הוא מקבל כמה קלטים מספריים, מכפיל כל אחד מהם ב"משקל" (Weight) — מספר שקובע כמה חשוב הקלט הזה — מסכם את התוצאות, ומעביר את הסכום דרך "פונקציית-הפעלה" (Activation Function) שקובעת אם ובאיזו עוצמה הנוירון "יורה" הלאה לשכבה הבאה. שום נוירון בודד לא "חכם" בשום מובן — הכוח של הרעיון כולו נובע מכך שמחברים מיליוני נוירונים כאלה בשכבות, וכל נוירון בשכבה מסוימת מקבל קלט מכל הנוירונים בשכבה שקדמה לו.

השורשים ההיסטוריים: מקאלוק-פיטס, הפרספטרון, וחורף-ה-AI הראשון

השורשים הרעיוניים של הרשת קודמים משמעותית לעידן-המחשבים המודרני. ב-1943 פרסמו וורן מקאלוק (נוירופיזיולוג) ווולטר פיטס (לוגיקאי) מודל מתמטי ראשון של נוירון מלאכותי — עבודה תיאורטית טהורה, בלי מחשב שיכול היה בכלל להריץ אותה. המימוש המעשי הראשון, שנקרא "פרספטרון" (Perceptron), נבנה על ידי פרנק רוזנבלט ב-1958 — מכונת-חומרה פיזית, לא רק תוכנה — ועורר גל של התלהבות ציבורית ותקציבי-מחקר, כולל כיסוי נלהב בעיתונות של אותה תקופה שהציגה אותה כפריצת-דרך שעומדת לפתור אינטליגנציה-מלאכותית תוך שנים ספורות.

ההתלהבות ההיא ננעלה ב-1969, כשמרווין מינסקי וסימור פייפרט פרסמו את ספרם "Perceptrons", ניתוח מתמטי קפדני שהוכיח מגבלה יסודית: פרספטרון בשכבה בודדת פשוט לא מסוגל לפתור בעיות שאינן "ניתנות-להפרדה-ליניארית" (Linearly Separable) — למשל הפונקציה הלוגית הבסיסית XOR, שקשה להראות שכף-משמעותי מבחינה מתמטית אבל קל להראותה כדוגמה נגדית ברורה. הביקורת הזו — שבדיעבד לא חלה על רשתות רב-שכבתיות, אבל בזמנה נתפסה כמכה קשה לתחום כולו — תרמה משמעותית ל"חורף-AI" הראשון, תקופה ממושכת של ירידה חדה במימון-מחקר וסקפטיות ציבורית שנמשכה למעלה מעשור.

התחייה: התפשטות-לאחור בשנות ה-80, והפריצה של AlexNet ב-2012

התחייה המשמעותית הבאה קרתה בשנות ה-1980, עם אימוץ נרחב יותר של אלגוריתם "התפשטות-לאחור" (Backpropagation) — שיטה שמאפשרת לאמן רשתות רב-שכבתיות ביעילות, על ידי חישוב שיטתי כיצד לתקן כל משקל בודד ברשת כדי לצמצם את שיעור-הטעויות. השיטה עצמה תוארה לראשונה עוד קודם, אך פרסום משפיע מ-1986 בהובלת דייוויד רומלהארט, ג'פרי הינטון ורונלד וויליאמס הוא זה שהפך אותה נפוצה ומעשית בקהילת-המחקר. עם זאת, המחסור בכוח-חישוב ובנתונים-מתויגים באותה תקופה הגביל את ההיקף המעשי של מה שאפשר היה להשיג, וגם התחייה הזו לא הובילה לפריצה-ציבורית-רחבה עד עשורים מאוחרים יותר.

השינוי הדרמטי הבא, שהפך רשתות-נוירונים מתחום-מחקר-מכובד-אך-שולי לזרם-המרכזי הדומיננטי, קרה ב-2012, כשרשת בשם AlexNet ניצחה בפער דרמטי בתחרות-זיהוי-התמונות ImageNet. הפריצה הזו לא נבעה מרעיון-חדש-לגמרי, אלא משילוב של שלושה גורמים שהתבגרו יחד: זמינות-חומרה מתאימה (מעבדי-גרפיקה — GPU — שמותאמים מטבעם לחישוב-מקבילי מסיבי), נתונים-מתויגים בשפע (בזכות התפוצצות-האינטרנט), ושכלולים ארכיטקטוניים שאפשרו לאמן רשתות עמוקות-הרבה-יותר מקודמותיהן. מאז 2012, כמעט כל התקדמות משמעותית ב-AI מבוססת על צאצא כלשהו של אותו רעיון בסיסי — רשת עמוקה (Deep Learning), רשת עם עשרות ומאות שכבות במקום אחת או שתיים בלבד. מעבר למעבדי-הגרפיקה הכלליים ששימשו לאימון, התפתח גם שוק שלם של שבבים ייעודיים להרצת רשת-נוירונים מאומנת: החברה הישראלית Hailo, שנוסדה ב-2017, מפתחת מעבדי-AI ייעודיים שמריצים רשת-נוירונים ישירות במכשיר-הקצה — מצלמה, רכב, ציוד תעשייתי — במקום בענן, והפכה לחברת יוניקורן לפני שנרכשה ב-2026 על ידי ענקית-השבבים Microchip Technology.

מבנה בסיסי, ועד כמה מדויקת המטאפורה "בהשראת המוח"

מבנה-הרשת הבסיסי כולל תמיד שלושה סוגי-שכבות: "שכבת-קלט" (Input Layer) שמקבלת את הנתונים הגולמיים (למשל ערכי-הפיקסלים של תמונה), "שכבות-נסתרות" (Hidden Layers) — אלה שמבצעות את רוב עבודת-החישוב-בפועל, ואינן נגישות-ישירות למשתמש — ו"שכבת-פלט" (Output Layer) שמפיקה את התוצאה הסופית (למשל, ציון-הסתברות לכל קטגוריה אפשרית). "פונקציית-ההפעלה" בכל נוירון קריטית לביצועי-הרשת כולה: פונקציות ותיקות יותר (כמו Sigmoid) סבלו מבעיית "התפוגגות-הגרדיאנט" שהגבילה כמה שכבות אפשר לערום בהצלחה; פונקציית ReLU (ראשי-תיבות של Rectified Linear Unit), פשוטה בהרבה מבחינה חישובית ופתרה חלק ניכר מהבעיה, הפכה לברירת-המחדל ברוב הרשתות המודרניות.

חשוב להבין מה "בהשראת המוח" אומר בפועל, כי המטאפורה מטעה בקלות אם לוקחים אותה יותר-מדי-ברצינות. רשת-נוירונים מלאכותית שאולה מהמוח הביולוגי רק ברמת-מבנה כללי-ביותר — נוירונים מחוברים, כל חיבור בעל "עוצמה" משתנה — אבל שאר הפרטים שונים מהותית: נוירון ביולוגי הוא תא חי מורכב עם מנגנונים כימיים-חשמליים מסועפים, בעוד נוירון מלאכותי הוא פעולת-חיבור-וכפל מתמטית פשוטה; מוח אנושי מכיל כ-86 מיליארד נוירונים המחוברים באופן צפוף-ומורכב-בהרבה מכל רשת-מלאכותית קיימת; ולמידה במוח מתרחשת בתהליכים כימיים-ביולוגיים, לא באלגוריתם התפשטות-לאחור. המטאפורה שימושית כהשראה-ראשונית ולהסבר-אינטואיטיבי, אבל היא לא תיאור-מדעי מדויק של איך המוח באמת עובד.

משפחת הארכיטקטורות, ותיקון היסטורי על מינסקי ופייפרט

רשתות-נוירונים מודרניות מתפצלות לארכיטקטורות ייעודיות רבות, כל אחת מותאמת לסוג-מידע שונה: רשתות-קונבולוציה (CNN) לתמונות, רשתות-חוזרות (RNN) לרצפים כמו טקסט וסדרות-זמן, ומאז 2017 ארכיטקטורת הטרנספורמר (Transformer) — שמנגנון "תשומת-הלב" (Attention) שלה מאפשר לבחון רצף שלם בבת-אחת במקום ברצף — שהפכה לארכיטקטורה הדומיננטית ביותר למשימות-טקסט, ועומדת מאחורי כל מודלי השפה הגדולים המובילים כיום. ההבנה החשובה כאן: "רשת נוירונים" הוא המושג-האב הכללי, ו"טרנספורמר" (וכל שאר הארכיטקטורות הספציפיות) הן מימושים ספציפיים-יותר של אותו רעיון בסיסי, לא קטגוריות נפרדות ובלתי-קשורות.

חשוב לדייק בעובדה היסטורית שלעיתים קרובות מוצגת בפשטנות-יתר: מינסקי ופייפרט עצמם הבינו היטב שרשתות רב-שכבתיות יכולות לפתור את הבעיה שהם הדגימו — הביקורת שלהם התייחסה במפורש לפרספטרון בשכבה-בודדת, לא לרשתות-רב-שכבתיות בכלל. אבל הספר "נקרא-לא-נכון" באופן נרחב בקהילה כהוכחה למגבלה יסודית וכוללת של הגישה כולה, ופרשנות-השגויה הזו, ולא הממצא המדויק עצמו, היא זו שתרמה משמעותית לירידה החדה במימון-מחקר ולעניין הציבורי שאפיינה את החורף-הראשון של AI, ונמשכה כמעט עשור עד שהתפשטות-לאחור הוכיחה בפועל שרשתות-רב-שכבתיות אכן פותרות את הבעיה.

גידול הפרמטרים וחוקי-קנה-מידה, ומשפט-הקירוב-האוניברסלי

היקף-הפרמטרים ברשתות-נוירונים מודרניות — כלומר מספר-המשקלים הכולל שהרשת לומדת ומכווננת — גדל בקצב דרמטי לאורך העשור האחרון: מרשתות מוקדמות בעלות מיליוני פרמטרים בלבד, למודלי-דגל של 2026 שעשויים להכיל מאות מיליארדים עד טריליוני פרמטרים. הגידול הזה הוא הכוח-המניע המרכזי מאחורי "חוקי-קנה-מידה" (Scaling Laws) — ממצא-מחקר שמראה שביצועי-רשת משתפרים בצורה צפויה-למדי ככל שגדלים יחד היקף-הנתונים, גודל-הרשת, וכוח-החישוב-באימון, מגמה שהניעה חלק ניכר ממרוץ-הפיתוח בתעשייה כולה מאז שהתגלתה.

מבחינה תיאורטית-טהורה, קיים משפט מתמטי מרכזי שמסביר למה רשתות-נוירונים בכלל עובדות כפי שהן עובדות: "משפט-הקירוב-האוניברסלי" (Universal Approximation Theorem), שהוכיח ג'ורג' סייבנקו ב-1989, קובע שרשת-נוירונים בעלת שכבה-נסתרת אחת בלבד — כל עוד יש בה מספיק נוירונים — יכולה, באופן עקרוני, לקרב כל פונקציה רציפה לכל רמת-דיוק רצויה. הממצא הזה חשוב, אבל מוגבל: זהו "משפט-קיום" (Existence Theorem) — הוא מבטיח שרשת מתאימה קיימת אי-שם במרחב-האפשרויות, אבל לא אומר דבר על כמה גדולה היא צריכה להיות בפועל, וגם לא איך למצוא את הפרמטרים הנכונים שלה דרך אימון בפועל. במילים אחרות: המשפט מסביר למה הרעיון הבסיסי אמור לעבוד תיאורטית, אבל לא פותר את האתגר ההנדסי-בפועל של איך לבנות ולאמן רשת שמשיגה את זה במציאות — פער שממחיש למה למרות ההוכחה התיאורטית מ-1989, לקח עוד עשרות שנים של פיתוח-הנדסי עד שרשתות-נוירונים הפכו לכלי-עבודה מעשי-באמת בקנה-מידה גדול.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

נוירון ביולוגי מול נוירון מלאכותי
נוירון ביולוגינוירון מלאכותי
מהותתא חי מורכבפעולת חיבור-וכפל מתמטית
כמות במערכת מלאהכ-86 מיליארד במוח האנושימיליונים עד מיליארדים ברשתות מודרניות
מנגנון-למידהתהליכים כימיים-ביולוגייםאלגוריתם התפשטות-לאחור

שאלות נפוצות ❓

האם רשת-נוירונים מלאכותית עובדת כמו המוח האנושי?

רק בהשראה כללית-מאוד — נוירונים מחוברים בעוצמות-משתנות — אבל המנגנון בפועל שונה מהותית: נוירון מלאכותי הוא פעולה מתמטית פשוטה, לא תא חי מורכב, והלמידה מתבצעת באלגוריתם שונה לגמרי מתהליכי-הלמידה הביולוגיים.

מה גרם ל"חורף-AI" הראשון בהקשר של רשתות-נוירונים?

פרשנות-שגויה נפוצה של ספר מ-1969 שהראה שפרספטרון בשכבה-בודדת לא פותר בעיות מסוימות — הביקורת התייחסה רק לשכבה-בודדת, אבל נקראה בטעות כפסילה כוללת של הגישה.

מה ההבדל בין רשת נוירונים לטרנספורמר?

"רשת נוירונים" הוא המושג-הכללי; טרנספורמר הוא ארכיטקטורה ספציפית של רשת-נוירונים, מותאמת במיוחד לעיבוד-רצפים כמו טקסט.

האם משפט-הקירוב-האוניברסלי אומר שרשת קטנה תמיד מספיקה?

לא — הוא רק מוכיח שרשת-מתאימה קיימת תיאורטית, בלי לומר כמה גדולה היא צריכה להיות בפועל או איך למצוא אותה דרך אימון.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו