דלג לתוכן

שכחה קטסטרופלית (Catastrophic Forgetting)

יסודות בינה מלאכותית

הגדרה

שכחה קטסטרופלית (Catastrophic Forgetting), שנקראת גם הפרעה קטסטרופלית, היא הנטייה של רשת נוירונים לאבד פתאום ובאופן חמור את מה שלמדה קודם, כשמאמנים אותה על מידע חדש.

💡 דוגמה

מי שעבר מתל אביב לחיפה לומד מסלולים חדשים, ועדיין זוכר איך מגיעים לדיזנגוף.

רשת נוירונים שמאמנים רק על המסלולים החדשים עלולה למחוק את הישנים כמעט לגמרי — זו שכחה קטסטרופלית.

לומדים חדש, שוכחים ישן

שכחה קטסטרופלית (Catastrophic Forgetting), שנקראת גם "הפרעה קטסטרופלית" (Catastrophic Interference), היא לפי ויקיפדיה "הנטייה של רשת נוירונים מלאכותית לשכוח באופן פתאומי וחריף מידע שלמדה קודם, כשהיא לומדת מידע חדש". לא מדובר בדעיכה איטית של זיכרון, כמו אצל אדם ששוכח שם של חבר ילדות. מדובר בפגיעה חדה: בניסויים מסוימים, גם אימון מועט על משימה חדשה גרם לפגיעה חריפה ביכולת קודמת.

זה בולט במיוחד כי בני אדם, לפי ויקיפדיה, "בדרך כלל אינם מראים שכחה קטסטרופלית". ילד שלומד חילוק לא שוכח את לוח הכפל. הפער הזה הפך את התופעה לבעיה מרכזית גם למי שמנסה לחקות זיכרון אנושי ברשתות נוירונים, וגם למי שרוצה מערכת AI שממשיכה ללמוד לאורך זמן.

1989: רשת שלמדה לחבר

את המונח טבעו החוקרים מקלוסקי וכהן ב-1989, ורטקליף הביא את הבעיה לתשומת לב נוספת ב-1990. בניסוי הראשון של מקלוסקי וכהן אימנו רשת רגילה, שלומדת בהתפשטות לאחור, על 17 תרגילי חיבור חד-ספרתיים עם הספרה 1, כמו 1+1 ו-9+1, עד שהרשת ענתה על כולם נכון. אחר כך אימנו אותה על 17 תרגילים עם הספרה 2. את התרגילים החדשים הרשת למדה בקלות. אבל כבר אחרי סבב אימון אחד עליהם, היא לא הצליחה עוד לענות נכון על התרגילים הראשונים — ולעיתים קרובות התשובה שלה הייתה קרובה יותר למספר שגוי מאשר לנכון.

בניסוי נוסף, שבו הרשת למדה ברצף שתי רשימות של זוגות פריטים, ניסו החוקרים להקטין את הנזק בדרכים שונות: לשנות את מספר היחידות ברשת, לשנות את קצב הלמידה, לאמן יותר על הרשימה הראשונה ולהקפיא חלק מהמשקולות. לפי ויקיפדיה, אף אחת מהן לא פתרה את הבעיה באופן משביע רצון. המסקנה שלהם: ההפרעה קטסטרופלית כשהלמידה היא בזו אחר זו, אבל לא כשלומדים את שני הדברים יחד.

למה זה קורה

ברשת נוירונים הידע לא שמור ב"מגירה" נפרדת לכל עובדה. הוא מפוזר על פני משקולות רבות, וכל דוגמה משנה הרבה מהן בבת אחת. לפי ויקיפדיה, הסיבה העיקרית לבעיה היא החפיפה הזו בייצוגים: כשהרבה מהמשקולות שבהן "שמור הידע" משתנות, לא סביר שהידע הקודם יישאר שלם. אפשר לדמיין את האימון כתנועה במרחב של כל צירופי המשקולות האפשריים. הרשת מוצאת נקודה שבה היא מזהה את הדפוסים הראשונים, ואז, כשמאמנים אותה על דפוסים חדשים, היא זזה לנקודה שמתאימה רק להם.

זה מקרה קיצוני של מה שנקרא "דילמת היציבות-גמישות": איך לבנות מערכת שרגישה למידע חדש, אבל לא מתפרקת בגללו. ויקיפדיה מציבה את שני הקצוות זה מול זה. טבלת חיפוש פשוטה יציבה לגמרי, אבל לא יודעת להכליל לשום דבר שלא נכתב בה. רשת נוירונים יודעת להכליל לקלטים שלא ראתה — ובדיוק בגלל זה היא רגישה כל כך למידע חדש.

חזרה, חלומות ומשקולות חשובות

הפתרון האינטואיטיבי הוא חזרה (Rehearsal): כשמלמדים משהו חדש, מאמנים שוב גם על חלק מהחומר הישן. רובינס תיאר זאת ב-1995. הבעיה, לפי ויקיפדיה, היא שהנתונים הישנים לא תמיד זמינים. לכן פותחה "חזרה מדומה": הרשת מתאמנת לא על הנתונים המקוריים אלא על ייצוגים שלהם, שהיא מפיקה בעצמה. חלק מהמודלים האלה שאבו השראה מההשערה שבמוח האנושי ההיפוקמפוס והניאוקורטקס הם שתי מערכות זיכרון משלימות, ושזיכרונות "מועברים" ביניהן בתהליכים של הפעלה חוזרת, בין השאר בזמן שינה. בשנים האחרונות חזרה הגישה בגרסה של "חזרה גנרטיבית", שבה מודל גנרטיבי מייצר את הדוגמאות לחזרה.

כיוון אחר הציגו ג'יימס קירקפטריק ושותפיו, במאמר שעלה ל-arXiv בדצמבר 2016 ופורסם ב-PNAS ב-2017, בשיטה בשם EWC (Elastic Weight Consolidation). בתקציר המאמר הם כתבו ש"נחשב באופן רחב" שהשכחה הקטסטרופלית היא "תכונה בלתי נמנעת" של רשתות נוירונים, והראו שאפשר להתגבר עליה "על ידי האטה סלקטיבית של הלמידה במשקולות שחשובות" למשימות הקודמות. הם הדגימו זאת על משימות סיווג שמבוססות על MNIST, מאגר הספרות בכתב יד, ועל רשת שלמדה כמה משחקי אטארי 2600 בזה אחר זה.

גם במודלי שפה גדולים

הבעיה לא נשארה במעבדות של שנות ה-90. כוונון עדין (Fine-tuning) של מודל שפה על תחום צר הוא בדיוק מצב של למידה בזו אחר זו: קודם אימון כללי, ואז אימון ממוקד. מחקר של יון לואו ושותפיו, שהתפרסם ב-arXiv ב-2023, בדק מודלים בגדלים של מיליארד עד 7 מיליארד פרמטרים, שכווננו על משימות בזו אחר זו. המסקנה: שכחה קטסטרופלית "נצפית באופן כללי" במודלים האלה, ובטווח הגדלים שנבדק היא אפילו החמירה ככל שהמודל גדל. החוקרים מצאו גם שכוונון כללי להוראות לפני הכוונון הממוקד עוזר להקטין את השכחה.

מחקר אחר, של דן בידרמן ושותפיו מ-2024, השווה בין כוונון מלא של כל המשקולות לבין LoRA, שיטה שמאמנת רק תוספת קטנה למשקולות. בתחומים שנבדקו, תכנות ומתמטיקה, בהגדרות הנפוצות של דרגה נמוכה, LoRA השיגה תוצאות חלשות משמעותית מכוונון מלא בתחום היעד, אבל שמרה טוב יותר על ביצועי המודל המקורי מחוץ לתחום. שם המאמר מסכם את זה: "LoRA לומדת פחות ושוכחת פחות". לפי המחקר, LoRA מצמצמת שכחה יותר משיטות ריסון נפוצות כמו דעיכת משקולות ונשירה (Dropout).

למה זה חשוב: מודלים שממשיכים ללמוד

שכחה קטסטרופלית היא אחד המכשולים המרכזיים בדרך ל"למידה מתמשכת" (Continual Learning) — היכולת של מודל לרכוש ידע וכישורים חדשים לאורך זמן בלי לשכוח את הישנים. בבלוג של Google Research מנובמבר 2025 תיארו החוקרים את המגבלה של מודלי השפה של היום: הידע שלהם מוגבל למה שנמצא בחלון ההקשר הנוכחי, או למה שלמדו באימון המקדים. הדרך הפשוטה, כתבו, לעדכן את הפרמטרים של המודל ברציפות עם נתונים חדשים, "מובילה לעיתים קרובות" לשכחה קטסטרופלית. באותו פוסט הציגה גוגל גישה מחקרית בשם Nested Learning, שהוצגה בכנס NeurIPS 2025, וארכיטקטורה ניסיונית בשם Hope שנבנתה כהוכחת היתכנות.

לכן כשמודל צריך להתעדכן — למשל כי העולם השתנה, כפי שמתואר בערך על סחיפת מושג — אימון מחדש אינו פעולה פשוטה. מי שמכוונן מודל צריך לבדוק לא רק אם הוא השתפר במשימה החדשה, אלא גם מה הוא איבד בדרך.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש מהדרכים להתמודד עם שכחה קטסטרופלית
חזרהחזרה מדומה או גנרטיביתריסון משקולות (EWC)
הרעיוןמאמנים שוב גם על חלק מהנתונים הישניםמאמנים על דוגמאות שהרשת או מודל גנרטיבי מייצרים במקום הנתונים הישניםמאטים את השינוי במשקולות שחשובות למשימות קודמות
מי הציערובינס, 1995רובינס (1995) ואחרים; בגרסה הגנרטיבית בשנים האחרונותקירקפטריק ושותפיו, 2017
מה זה דורשגישה לנתונים הישנים, שלא תמיד קיימתמנגנון שמייצר ייצוגים טובים מספיק של הידע הקודםהערכה של מידת החשיבות של כל משקולת

שאלות נפוצות ❓

מה ההבדל בין שכחה קטסטרופלית לשכחה רגילה?

בניגוד לדעיכה הדרגתית של זיכרון, שכחה קטסטרופלית היא פגיעה פתאומית וחמורה ביכולת קודמת, שבניסויים מסוימים הופיעה כבר אחרי סבב אימון אחד על משהו חדש. בני אדם בדרך כלל לא שוכחים כך.

האם זה קורה גם במודלי שפה גדולים?

מחקרים מצאו שכחה קטסטרופלית במודלי שפה גדולים כשמכווננים אותם על משימות בזו אחר זו. לכן מי שמכוונן מודל לתחום צר צריך לבדוק שהוא לא איבד יכולות כלליות.

איך אפשר להקטין שכחה קטסטרופלית?

בין השיטות: לחזור גם על נתונים ישנים בזמן האימון, לייצר דוגמאות מדומות של הידע הקודם, להגן על משקולות חשובות (כמו בשיטת EWC), או לאמן רק תוספות קטנות למודל, כמו ב-LoRA, שבמחקר אחד שמרה טוב יותר על יכולות מחוץ לתחום הכוונון.

מה הקשר ללמידה מתמשכת?

למידה מתמשכת היא היכולת לרכוש ידע חדש לאורך זמן בלי לשכוח את הישן. שכחה קטסטרופלית היא אחד הקשיים המרכזיים בדרך לשם: עדכון רציף של משקולות המודל מוביל לעיתים קרובות לשכחה כזו.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו