רשת נוירונים (Neural Network)
🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.
הגדרה
רשת נוירונים (Neural Network) היא מבנה מתמטי בהשראת המוח האנושי, בנוי משכבות של יחידות חישוב שנקראות נוירונים.
💡 דוגמה
תמונה נכנסת כפיקסלים, עוברת דרך שכבות של "נוירונים" שכל אחד מחשב משהו קטן, ובסוף הרשת אומרת "זה חתול".
מה זו רשת נוירונים: איך נוירון בודד עובד
רשת נוירונים (Neural Network) היא מבנה מתמטי-חישובי בהשראת המוח האנושי, בנוי משכבות של יחידות-חישוב פשוטות שנקראות "נוירונים" (או "נוירונים מלאכותיים" — Artificial Neurons, כדי להבחין מהתא-העצבי-הביולוגי שממנו שאולה המטאפורה). כל נוירון בודד מבצע פעולה פשוטה להפליא: הוא מקבל כמה קלטים מספריים, מכפיל כל אחד מהם ב"משקל" (Weight) — מספר שקובע כמה חשוב הקלט הזה — מסכם את התוצאות, ומעביר את הסכום דרך "פונקציית-הפעלה" (Activation Function) שקובעת אם ובאיזו עוצמה הנוירון "יורה" הלאה לשכבה הבאה. שום נוירון בודד לא "חכם" בשום מובן — הכוח של הרעיון כולו נובע מכך שמחברים מיליוני נוירונים כאלה בשכבות, וכל נוירון בשכבה מסוימת מקבל קלט מכל הנוירונים בשכבה שקדמה לו.
השורשים ההיסטוריים: מקאלוק-פיטס, הפרספטרון, וחורף-ה-AI הראשון
השורשים הרעיוניים של הרשת קודמים משמעותית לעידן-המחשבים המודרני. ב-1943 פרסמו וורן מקאלוק (נוירופיזיולוג) ווולטר פיטס (לוגיקאי) מודל מתמטי ראשון של נוירון מלאכותי — עבודה תיאורטית טהורה, בלי מחשב שיכול היה בכלל להריץ אותה. המימוש המעשי הראשון, שנקרא "פרספטרון" (Perceptron), נבנה על ידי פרנק רוזנבלט ב-1958 — מכונת-חומרה פיזית, לא רק תוכנה — ועורר גל של התלהבות ציבורית ותקציבי-מחקר, כולל כיסוי נלהב בעיתונות של אותה תקופה שהציגה אותה כפריצת-דרך שעומדת לפתור אינטליגנציה-מלאכותית תוך שנים ספורות.
ההתלהבות ההיא ננעלה ב-1969, כשמרווין מינסקי וסימור פייפרט פרסמו את ספרם "Perceptrons", ניתוח מתמטי קפדני שהוכיח מגבלה יסודית: פרספטרון בשכבה בודדת פשוט לא מסוגל לפתור בעיות שאינן "ניתנות-להפרדה-ליניארית" (Linearly Separable) — למשל הפונקציה הלוגית הבסיסית XOR, שקשה להראות שכף-משמעותי מבחינה מתמטית אבל קל להראותה כדוגמה נגדית ברורה. הביקורת הזו — שבדיעבד לא חלה על רשתות רב-שכבתיות, אבל בזמנה נתפסה כמכה קשה לתחום כולו — תרמה משמעותית ל"חורף-AI" הראשון, תקופה ממושכת של ירידה חדה במימון-מחקר וסקפטיות ציבורית שנמשכה למעלה מעשור.
התחייה: התפשטות-לאחור בשנות ה-80, והפריצה של AlexNet ב-2012
התחייה המשמעותית הבאה קרתה בשנות ה-1980, עם אימוץ נרחב יותר של אלגוריתם "התפשטות-לאחור" (Backpropagation) — שיטה שמאפשרת לאמן רשתות רב-שכבתיות ביעילות, על ידי חישוב שיטתי כיצד לתקן כל משקל בודד ברשת כדי לצמצם את שיעור-הטעויות. השיטה עצמה תוארה לראשונה עוד קודם, אך פרסום משפיע מ-1986 בהובלת דייוויד רומלהארט, ג'פרי הינטון ורונלד וויליאמס הוא זה שהפך אותה נפוצה ומעשית בקהילת-המחקר. עם זאת, המחסור בכוח-חישוב ובנתונים-מתויגים באותה תקופה הגביל את ההיקף המעשי של מה שאפשר היה להשיג, וגם התחייה הזו לא הובילה לפריצה-ציבורית-רחבה עד עשורים מאוחרים יותר.
השינוי הדרמטי הבא, שהפך רשתות-נוירונים מתחום-מחקר-מכובד-אך-שולי לזרם-המרכזי הדומיננטי, קרה ב-2012, כשרשת בשם AlexNet ניצחה בפער דרמטי בתחרות-זיהוי-התמונות ImageNet. הפריצה הזו לא נבעה מרעיון-חדש-לגמרי, אלא משילוב של שלושה גורמים שהתבגרו יחד: זמינות-חומרה מתאימה (מעבדי-גרפיקה — GPU — שמותאמים מטבעם לחישוב-מקבילי מסיבי), נתונים-מתויגים בשפע (בזכות התפוצצות-האינטרנט), ושכלולים ארכיטקטוניים שאפשרו לאמן רשתות עמוקות-הרבה-יותר מקודמותיהן. מאז 2012, כמעט כל התקדמות משמעותית ב-AI מבוססת על צאצא כלשהו של אותו רעיון בסיסי — רשת עמוקה (Deep Learning), רשת עם עשרות ומאות שכבות במקום אחת או שתיים בלבד. מעבר למעבדי-הגרפיקה הכלליים ששימשו לאימון, התפתח גם שוק שלם של שבבים ייעודיים להרצת רשת-נוירונים מאומנת: החברה הישראלית Hailo, שנוסדה ב-2017, מפתחת מעבדי-AI ייעודיים שמריצים רשת-נוירונים ישירות במכשיר-הקצה — מצלמה, רכב, ציוד תעשייתי — במקום בענן, והפכה לחברת יוניקורן לפני שנרכשה ב-2026 על ידי ענקית-השבבים Microchip Technology.
מבנה בסיסי, ועד כמה מדויקת המטאפורה "בהשראת המוח"
מבנה-הרשת הבסיסי כולל תמיד שלושה סוגי-שכבות: "שכבת-קלט" (Input Layer) שמקבלת את הנתונים הגולמיים (למשל ערכי-הפיקסלים של תמונה), "שכבות-נסתרות" (Hidden Layers) — אלה שמבצעות את רוב עבודת-החישוב-בפועל, ואינן נגישות-ישירות למשתמש — ו"שכבת-פלט" (Output Layer) שמפיקה את התוצאה הסופית (למשל, ציון-הסתברות לכל קטגוריה אפשרית). "פונקציית-ההפעלה" בכל נוירון קריטית לביצועי-הרשת כולה: פונקציות ותיקות יותר (כמו Sigmoid) סבלו מבעיית "התפוגגות-הגרדיאנט" שהגבילה כמה שכבות אפשר לערום בהצלחה; פונקציית ReLU (ראשי-תיבות של Rectified Linear Unit), פשוטה בהרבה מבחינה חישובית ופתרה חלק ניכר מהבעיה, הפכה לברירת-המחדל ברוב הרשתות המודרניות.
חשוב להבין מה "בהשראת המוח" אומר בפועל, כי המטאפורה מטעה בקלות אם לוקחים אותה יותר-מדי-ברצינות. רשת-נוירונים מלאכותית שאולה מהמוח הביולוגי רק ברמת-מבנה כללי-ביותר — נוירונים מחוברים, כל חיבור בעל "עוצמה" משתנה — אבל שאר הפרטים שונים מהותית: נוירון ביולוגי הוא תא חי מורכב עם מנגנונים כימיים-חשמליים מסועפים, בעוד נוירון מלאכותי הוא פעולת-חיבור-וכפל מתמטית פשוטה; מוח אנושי מכיל כ-86 מיליארד נוירונים המחוברים באופן צפוף-ומורכב-בהרבה מכל רשת-מלאכותית קיימת; ולמידה במוח מתרחשת בתהליכים כימיים-ביולוגיים, לא באלגוריתם התפשטות-לאחור. המטאפורה שימושית כהשראה-ראשונית ולהסבר-אינטואיטיבי, אבל היא לא תיאור-מדעי מדויק של איך המוח באמת עובד.
משפחת הארכיטקטורות, ותיקון היסטורי על מינסקי ופייפרט
רשתות-נוירונים מודרניות מתפצלות לארכיטקטורות ייעודיות רבות, כל אחת מותאמת לסוג-מידע שונה: רשתות-קונבולוציה (CNN) לתמונות, רשתות-חוזרות (RNN) לרצפים כמו טקסט וסדרות-זמן, ומאז 2017 ארכיטקטורת הטרנספורמר (Transformer) — שמנגנון "תשומת-הלב" (Attention) שלה מאפשר לבחון רצף שלם בבת-אחת במקום ברצף — שהפכה לארכיטקטורה הדומיננטית ביותר למשימות-טקסט, ועומדת מאחורי כל מודלי השפה הגדולים המובילים כיום. ההבנה החשובה כאן: "רשת נוירונים" הוא המושג-האב הכללי, ו"טרנספורמר" (וכל שאר הארכיטקטורות הספציפיות) הן מימושים ספציפיים-יותר של אותו רעיון בסיסי, לא קטגוריות נפרדות ובלתי-קשורות.
חשוב לדייק בעובדה היסטורית שלעיתים קרובות מוצגת בפשטנות-יתר: מינסקי ופייפרט עצמם הבינו היטב שרשתות רב-שכבתיות יכולות לפתור את הבעיה שהם הדגימו — הביקורת שלהם התייחסה במפורש לפרספטרון בשכבה-בודדת, לא לרשתות-רב-שכבתיות בכלל. אבל הספר "נקרא-לא-נכון" באופן נרחב בקהילה כהוכחה למגבלה יסודית וכוללת של הגישה כולה, ופרשנות-השגויה הזו, ולא הממצא המדויק עצמו, היא זו שתרמה משמעותית לירידה החדה במימון-מחקר ולעניין הציבורי שאפיינה את החורף-הראשון של AI, ונמשכה כמעט עשור עד שהתפשטות-לאחור הוכיחה בפועל שרשתות-רב-שכבתיות אכן פותרות את הבעיה.
גידול הפרמטרים וחוקי-קנה-מידה, ומשפט-הקירוב-האוניברסלי
היקף-הפרמטרים ברשתות-נוירונים מודרניות — כלומר מספר-המשקלים הכולל שהרשת לומדת ומכווננת — גדל בקצב דרמטי לאורך העשור האחרון: מרשתות מוקדמות בעלות מיליוני פרמטרים בלבד, למודלי-דגל של 2026 שעשויים להכיל מאות מיליארדים עד טריליוני פרמטרים. הגידול הזה הוא הכוח-המניע המרכזי מאחורי "חוקי-קנה-מידה" (Scaling Laws) — ממצא-מחקר שמראה שביצועי-רשת משתפרים בצורה צפויה-למדי ככל שגדלים יחד היקף-הנתונים, גודל-הרשת, וכוח-החישוב-באימון, מגמה שהניעה חלק ניכר ממרוץ-הפיתוח בתעשייה כולה מאז שהתגלתה.
מבחינה תיאורטית-טהורה, קיים משפט מתמטי מרכזי שמסביר למה רשתות-נוירונים בכלל עובדות כפי שהן עובדות: "משפט-הקירוב-האוניברסלי" (Universal Approximation Theorem), שהוכיח ג'ורג' סייבנקו ב-1989, קובע שרשת-נוירונים בעלת שכבה-נסתרת אחת בלבד — כל עוד יש בה מספיק נוירונים — יכולה, באופן עקרוני, לקרב כל פונקציה רציפה לכל רמת-דיוק רצויה. הממצא הזה חשוב, אבל מוגבל: זהו "משפט-קיום" (Existence Theorem) — הוא מבטיח שרשת מתאימה קיימת אי-שם במרחב-האפשרויות, אבל לא אומר דבר על כמה גדולה היא צריכה להיות בפועל, וגם לא איך למצוא את הפרמטרים הנכונים שלה דרך אימון בפועל. במילים אחרות: המשפט מסביר למה הרעיון הבסיסי אמור לעבוד תיאורטית, אבל לא פותר את האתגר ההנדסי-בפועל של איך לבנות ולאמן רשת שמשיגה את זה במציאות — פער שממחיש למה למרות ההוכחה התיאורטית מ-1989, לקח עוד עשרות שנים של פיתוח-הנדסי עד שרשתות-נוירונים הפכו לכלי-עבודה מעשי-באמת בקנה-מידה גדול.
גרסה פשוטה של הערך, לגיל 12. כל מה שכתוב כאן מופיע גם בערך המלא.
רשת נוירונים היא מבנה מתמטי שבנוי משכבות של יחידות חישוב קטנות. קוראים להן "נוירונים", כי הרעיון נולד בהשראת תאי העצב במוח.
כל נוירון כזה עושה דבר פשוט מאוד. הוא מקבל כמה מספרים, מכפיל כל אחד מהם ב"משקל" שקובע כמה הוא חשוב, מחבר הכול, ואז מפעיל כלל שמחליט אם ובאיזו עוצמה להעביר את התוצאה הלאה. זה קצת כמו ציון תעודה: המבחן שווה הרבה, שיעורי-הבית שווים פחות, מחברים הכול לציון אחד. כשהרשת לומדת, היא בעצם מתקנת את המשקלים האלה שוב ושוב, עד שהתשובות שלה טובות יותר.
נוירון אחד לבד לא חכם בכלל. הכוח מגיע מזה שמחברים מיליוני נוירונים בשכבות: שכבת קלט שמקבלת את המידע, למשל נקודות הצבע של תמונה, שכבות נסתרות שעושות את רוב העבודה, ושכבת פלט שנותנת את התשובה.
חשוב לא להתבלבל: רשת נוירונים היא לא מוח. נוירון במוח הוא תא חי ומורכב. נוירון ברשת הוא רק חשבון פשוט: כפל, חיבור וכלל אחד. במוח של אדם יש כ-86 מיליארד נוירונים, מחוברים בצורה צפופה ומסובכת הרבה יותר מכל רשת שנבנתה. וגם הדרך שבה המוח לומד שונה לגמרי. המוח הוא השראה, לא העתק.
הרעיון ותיק מאוד. המודל המתמטי הראשון של נוירון מלאכותי פורסם ב-1943, עוד לפני שהיה מחשב שיכול להריץ אותו. אבל רק ב-2012 רשתות כאלה פרצו בגדול, כשהיו סוף-סוף מספיק כוח חישוב ומספיק דוגמאות. היום, מודלי השפה הגדולים המובילים בנויים על סוג מיוחד של רשת נוירונים שנקרא טרנספורמר (Transformer).
מה המושג אומר לארגון ולעסק. כל עובדה כאן מופיעה גם בערך המלא.
רשת נוירונים היא אבן-הבניין שעליה נשען כמעט כל שיפור משמעותי ב-AI מאז 2012. מבחינה עסקית כדאי לחשוב עליה כך: כל מה שהמערכת "יודעת" הוא אוסף עצום של משקלים מספריים, שנקבעו בתהליך אימון ולא נכתבו בידי אדם. אין בתוכה רשימת כללים שאפשר לקרוא.
איפה זה פוגש אתכם: בשפה של ספקים. "טרנספורמר", "רשת-קונבולוציה", "רשת-חוזרת" אינם טכנולוגיות נפרדות אלא סוגים שונים של רשת נוירונים, שכל אחד מותאם לסוג מידע אחר: רשת-קונבולוציה לתמונות, רשת-חוזרת לרצפים כמו טקסט וסדרות-זמן, והטרנספורמר, שהוא הבסיס של כל מודלי השפה הגדולים המובילים. זה פוגש אתכם גם בשאלה איפה הרשת רצה: לצד השרתים בענן התפתח שוק של שבבים ייעודיים שמריצים רשת מאומנת ישירות במכשיר-הקצה, כמו מצלמה, רכב או ציוד תעשייתי.
שלוש תובנות רלוונטיות להחלטות. ראשית, "חוקי קנה-מידה": ביצועי רשת משתפרים בצורה צפויה למדי כשגדלים יחד היקף הנתונים, גודל הרשת וכוח החישוב באימון. מכאן שכדאי לבחון הבטחה ל"מודל גדול יותר" יחד עם השאלה אם גם שאר הרכיבים גדלו איתו. שנית, יש הוכחה מתמטית שרשת מתאימה יכולה עקרונית לקרב כל פונקציה רציפה, כלומר סוג רחב מאוד של קשרים בין קלט לפלט, אבל זו הוכחת קיום בלבד: היא לא אומרת כמה גדולה הרשת צריכה להיות ואיך מאמנים אותה. "אפשרי תיאורטית" אינו "עובד אצלכם". שלישית, מטאפורת המוח מטעה: הדמיון הוא במבנה כללי בלבד, ולכן אין להסיק מהשם שהמערכת חושבת כמו אדם.
ההיסטוריה מוסיפה אזהרה: אחרי ההתלהבות הראשונה מרשתות, קריאה שגויה של ממצא מתמטי מדויק תרמה משמעותית לתקופה ארוכה של קיצוץ במימון. גם היום, ההבדל בין מה שנטען לבין מה שהוכח בפועל עשוי להיות גדול.
שאלות שכדאי לשאול ספק, צוות או יועץ:
- כשמציגים לנו ארכיטקטורה בשם מסוים, איזה סוג של רשת נוירונים היא, ומה בה מותאם דווקא לסוג המידע שלנו?
- האם הרשת המאומנת רצה בענן או ישירות במכשיר, ומה המשמעות מבחינת זמינות ונתונים?
- כשמובטח שיפור ממודל גדול יותר, האם גדלים איתו גם הנתונים וכוח החישוב?
- האם יש רשת מאומנת שמבצעת את המשימה שלנו בפועל, או שמדובר בטיעון שזה "אפשרי עקרונית"?
- אם הרשת טועה, איך אפשר לבדוק מה היא למדה, כשכל הידע שלה הוא משקלים מספריים?
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| נוירון ביולוגי | נוירון מלאכותי | |
|---|---|---|
| מהות | תא חי מורכב | פעולת חיבור-וכפל מתמטית |
| כמות במערכת מלאה | כ-86 מיליארד במוח האנושי | מיליונים עד מיליארדים ברשתות מודרניות |
| מנגנון-למידה | תהליכים כימיים-ביולוגיים | אלגוריתם התפשטות-לאחור |
שאלות נפוצות ❓
האם רשת-נוירונים מלאכותית עובדת כמו המוח האנושי?
רק בהשראה כללית-מאוד — נוירונים מחוברים בעוצמות-משתנות — אבל המנגנון בפועל שונה מהותית: נוירון מלאכותי הוא פעולה מתמטית פשוטה, לא תא חי מורכב, והלמידה מתבצעת באלגוריתם שונה לגמרי מתהליכי-הלמידה הביולוגיים.
מה גרם ל"חורף-AI" הראשון בהקשר של רשתות-נוירונים?
פרשנות-שגויה נפוצה של ספר מ-1969 שהראה שפרספטרון בשכבה-בודדת לא פותר בעיות מסוימות — הביקורת התייחסה רק לשכבה-בודדת, אבל נקראה בטעות כפסילה כוללת של הגישה.
מה ההבדל בין רשת נוירונים לטרנספורמר?
"רשת נוירונים" הוא המושג-הכללי; טרנספורמר הוא ארכיטקטורה ספציפית של רשת-נוירונים, מותאמת במיוחד לעיבוד-רצפים כמו טקסט.
האם משפט-הקירוב-האוניברסלי אומר שרשת קטנה תמיד מספיקה?
לא — הוא רק מוכיח שרשת-מתאימה קיימת תיאורטית, בלי לומר כמה גדולה היא צריכה להיות בפועל או איך למצוא אותה דרך אימון.