דלג לתוכן

למידה-מדוגמה-בודדת (Zero/Few-shot)

מודלים ושפה

הגדרה

למידה-מדוגמה-בודדת (Zero/Few-shot) היא יכולת מודל לבצע משימה חדשה שהוא כלל לא אומן עליה, מתוך תיאור או דוגמאות בודדות.

💡 דוגמה

"תמיין את הביקורות לחיובית או שלילית" יכול לעבוד גם בלי דוגמאות. אם מוסיפים שתי דוגמאות של ביקורת ותשובה, הוא מבין בדיוק מה רוצים.

מה זו למידה-מדוגמה-בודדת, והמדרג מפרומפט-ישיר ועד כמה דוגמאות

למידה-מדוגמה-בודדת (Zero/Few-shot) היא היכולת של מודל שפה גדול (LLM) לבצע משימה חדשה שהוא כלל לא אומן עליה באופן ייעודי, מתוך תיאור-מילולי בלבד או מתוך כמה דוגמאות בודדות שמוצגות לו בתוך הפרומפט עצמו — לא מתוך אימון-מחדש בפועל. המונח מקורו בקהילת-המחקר של למידת-מכונה כללית, שם "Few-shot Learning" מתאר יכולת של מערכת ללמוד מקבוצת-דוגמאות קטנה מאוד, בניגוד ללמידה-מונחית מסורתית שדורשת אלפי או מיליוני דוגמאות מתויגות. ההקשר של מודלי-שפה הוסיף לרעיון הזה נדבך חדש: היכולת "ללמוד" מתוך הפרומפט עצמו, בזמן-הרצה, בלי שום עדכון של משקלי-המודל בכלל — תופעה שנקראת "למידה-בתוך-הקשר" (In-context Learning), והיא אחת התכונות המפתיעות ביותר שהתגלו במודלי שפה גדולים.

המדרג הבסיסי מתחיל בפרומפט-ישיר (Zero-shot Prompting) — בקשה פשוטה בלי כל דוגמה נלווית, בהנחה שהמודל "יודע" כבר איך לבצע את המשימה מתוך הידע הכללי שנצבר באימון-המוקדם (Pre-training) שלו. מודלי שפה גדולים מודרניים מסוגלים לבצע היטב מגוון רחב מאוד של משימות בגישה זו בלבד — תרגום, סיכום, מענה-על-שאלות, סיווג-רגשות — בזכות היקף וגיוון הטקסט שהם נחשפו אליו באימון. כשזה לא מספיק, למשל כשהמשימה דורשת פורמט-פלט ספציפי או סגנון-תשובה מסוים, המדרגה הבאה היא למידה-מדוגמה-אחת (One-shot) — הצגת דוגמה יחידה של "קלט ותשובה רצויה" — ולמידה-מדוגמאות-אחדות (Few-shot) — הצגת כמה דוגמאות כאלה, בדרך-כלל בין שתיים לעשר, בתוך אותו פרומפט. המודל "מזהה" את הדפוס מתוך הדוגמאות ומיישם אותו על הקלט החדש, בלי שאף משקל פנימי שלו השתנה בפועל.

התיעוד המשפיע (GPT-3, 2020), והשוני מכוונון עדין

התיעוד המשפיע ביותר של יכולת-הלמידה-הזו הופיע במאמר-המחקר GPT-3 של OpenAI מ-2020, שכותרתו בעצמה — "Language Models are Few-Shot Learners" — הכריזה על הממצא המרכזי: מודל בגודל מספיק מפתח יכולת-למידה-בתוך-הקשר גם בלי אף עדכון-משקלים, פשוט מתוך הצגת דוגמאות בפרומפט. המאמר הראה שביצועים ב-Few-shot משתפרים משמעותית עם גודל-המודל — מודלים קטנים יחסית כמעט לא הפגינו את התכונה, בעוד GPT-3, בגודל 175 מיליארד פרמטרים, השיג ביצועים תחרותיים במשימות רבות רק מכמה דוגמאות בפרומפט, בלי אימון-ייעודי כלל. הממצא הזה היה חלק מרכזי מהתופעה הרחבה יותר שנקראת "יכולות-מתפתחות" (Emergent Abilities) — יכולות שלא היו קיימות במודלים קטנים ו"צצות" רק מעבר לסף-גודל מסוים.

חשוב להבין שהמנגנון הפנימי של Few-shot Prompting שונה מהותית מכוונון עדין (Fine-tuning), גם כשהתוצאה הנראית-לעין דומה. כוונון עדין מעדכן בפועל את המשקלים הפנימיים של המודל, כך שההתנהגות החדשה "נטמעת" בו לצמיתות; למידה-מדוגמאות-אחדות לא נוגעת במודל בכלל — היא רק מוסיפה הקשר זמני לפרומפט הנוכחי, שנעלם ברגע שהשיחה מסתיימת או שהחלון-הקשר (Context Window) מתמלא. זו הסיבה שהגישה הזו זולה ומיידית להפליא בהשוואה לכוונון עדין — אין צורך בתהליך-אימון, בחומרה ייעודית, או במערך-נתונים גדול — אבל גם פחות-עמידה: כל שיחה חדשה חייבת לכלול מחדש את הדוגמאות הרלוונטיות, וההשפעה שלהן מוגבלת לחלון-הקשר הנוכחי בלבד.

כמה דוגמאות צריך, ולמה גם הסדר שלהן קריטי

מספר-הדוגמאות האופטימלי בפרומפט Few-shot אינו קבוע ותלוי מהותית במשימה. יותר מדי דוגמאות עלולות "להטביע" את הפרומפט ולנצל מיותר מ"מכסת" חלון-ההקשר בלי תועלת נוספת משמעותית; מעט מדי דוגמאות עלולות לא לספק למודל מספיק אותות כדי להבין את הדפוס המבוקש. ניסוי-מעשי — בדיקת ביצועים על מדגם-בדיקה קטן עם מספר-דוגמאות משתנה — הוא הדרך המקובלת לאתר את הנקודה האופטימלית, ולעיתים קרובות ההבדל בין 3 דוגמאות ל-8 דוגמאות משמעותי הרבה יותר מההבדל בין 8 ל-20. איכות-הדוגמאות חשובה לפחות כמו כמותן: דוגמאות שמייצגות היטב את מגוון-המקרים שהמודל צפוי להיתקל בהם (כולל מקרי-קצה) עדיפות משמעותית על דוגמאות דומות-מדי זו לזו, גם אם כמותן זהה.

תגלית מטרידה יחסית שהתגלתה במחקר מאוחר יותר היא ש-Few-shot Prompting רגיש מאוד לפרטים שנראים חסרי-חשיבות. מחקר משפיע מ-2021, שכותרתו "Fantastically Ordered Prompts and Where to Find Them", הראה שסדר-הצגת-הדוגמאות בפרומפט — לא רק אילו דוגמאות נבחרו, אלא באיזה סדר בדיוק הן מופיעות — יכול לבדו לקבוע את ההבדל בין ביצועים שמתחרים בשיטות-אימון-מונחות-מלאות לבין ביצועים שלא טובים משמעותית מניחוש אקראי, על אותו מודל בדיוק ואותן דוגמאות בדיוק, רק בסדר שונה. הרגישות הזו הפכה תחום-מחקר בפני עצמו, שמנסה להבין למה מודלים "לומדים" באופן כל-כך שברירי מתוך דוגמאות בהקשר, ולפתח שיטות שיטתיות יותר לבחירת-דוגמאות ולסידורן, במקום להסתמך על ניסוי-וטעייה בלבד.

בחירת-דוגמאות דינמית: השילוב עם RAG

יש למידה-מדוגמאות-אחדות גם קרובת-משפחה שמנצלת אותו רעיון-בסיסי בהקשר שונה לגמרי: אחזור-מוגבר-בייצור (RAG — Retrieval-Augmented Generation) לעיתים משלב "בחירת-דוגמאות דינמית" — במקום דוגמאות-קבועות שנבחרו מראש, המערכת מאתרת אוטומטית את הדוגמאות הרלוונטיות-ביותר למקרה הספציפי הנוכחי מתוך מאגר גדול, ומזינה רק אותן לפרומפט. הגישה הזו משלבת את הגמישות של Few-shot Prompting עם היתרון של RAG — לא צריך לכלול את כל מאגר-הדוגמאות האפשריות בכל שיחה, רק את החלק הרלוונטי ביותר לשאלה הנוכחית, מה שחוסך משמעותית ב"מכסת" חלון-ההקשר.

איך כוונון-הוראות שינה את הצורך, ומעבר לתמונות

המשמעות המעשית של Zero/Few-shot Prompting השתנתה עם התפתחות מודלי-הצ'אט המודרניים. מודל-בסיס גולמי (Base Model), לפני כוונון-הוראות (Instruction Tuning) ו-RLHF (למידת-חיזוק מהעדפות אנושיות), נזקק בדרך-כלל להרבה יותר דוגמאות-Few-shot כדי להבין מה בדיוק מבקשים ממנו — הוא רק ממשיך-טקסט-סטטיסטי, ולא "מבין" הוראה כללית בלי דוגמאות קונקרטיות. מודלים שעברו כוונון-הוראות, כמו כמעט כל מוצר-צרכני מסחרי נכון ל-2026, נעשו טובים משמעותית ב-Zero-shot בלבד — הם אומנו במפורש להבין ולציית להוראות בשפה טבעית, כך שהרבה מהמשימות שדרשו פעם דוגמאות מפורשות נפתרות היום מספיק טוב רק מתיאור-מילולי ברור. המגמה הזו הפחיתה את הצורך המעשי ב-Few-shot Prompting עבור משתמש-קצה רגיל, אבל היא עדיין רלוונטית מאוד למשימות עם פורמט-פלט חריג-במיוחד או דקויות-סגנון שקשה לתאר במילים בצורה שממצה את הכוונה במלואה.

היכולת התרחבה גם מעבר לטקסט טהור, בהתאם להתפתחות מודלים רב-אמצעיים (Multimodal). "למידה-מדוגמאות-חזותית" (Visual Few-shot) מאפשרת להציג למודל כמה זוגות של תמונה-ותיאור-רצוי, ולבקש ממנו ליישם את אותו דפוס על תמונה חדשה — למשל להראות למודל כמה דוגמאות של "תיוג-פגם באיכות-ייצור" בתמונות-מוצר, ולבקש ממנו לזהות פגמים דומים בתמונות חדשות, בלי לאמן מודל-ראייה ייעודי מאפס. הגישה הזו שימושית במיוחד בתחומים שבהם איסוף מערך-נתונים-מתויג גדול יקר או לא-ריאלי, ומדגימה שהרעיון הבסיסי של למידה-בתוך-הקשר לא ייחודי לטקסט — הוא עקרון כללי יותר שמשתרע על-פני סוגי-מידע שונים, כל עוד המודל הבסיסי אומן על אותו סוג-מידע מלכתחילה.

הגבולות: לא מלמד עובדות חדשות

יכולת-הלמידה-הזו לא בלתי-מוגבלת. Zero/Few-shot Prompting לא יכול "ללמד" את המודל עובדה שמעולם לא נחשף אליה באימון-המוקדם, ולא יכול לתקן פערים בסיסיים ביכולות-הליבה שלו — הוא רק מנחה את המודל להשתמש בידע-הקיים בצורה ספציפית יותר. גם כשהתוצאות מרשימות, המודל עדיין עלול להזות (Hallucinate) מידע שגוי בביטחון-מלא, במיוחד אם הדוגמאות שסופקו לא מכסות מספיק את גבולות-המקרה הרלוונטיים. מסיבה זו, גם עבור משימות שבהן Few-shot Prompting נותן תוצאות טובות, מומלץ עדיין לבדוק את הביצועים על מדגם-בדיקה מייצג לפני הסתמכות-ייצור, ולא להניח שהתוצאות המוצלחות על כמה דוגמאות-בדיקה בודדות יתקיימו אוטומטית על כל קלט עתידי.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

ארבע רמות של הבאת-דוגמאות למודל: מ-Zero-shot ועד כוונון עדין
Zero-shotOne-shotFew-shotכוונון עדין
כמה דוגמאותאיןאחתכמה עד עשרמאות עד אלפים
משנה את המודל?לאלאלאכן
עלות ומהירותמיידימיידימיידי, פרומפט ארוך יותרשעות עד ימים

שאלות נפוצות ❓

מה ההבדל בין Few-shot לכוונון עדין?

Few-shot לא נוגע במודל בכלל — רק מוסיף דוגמאות זמניות לפרומפט; כוונון עדין משנה בפועל את המשקלים הפנימיים של המודל לצמיתות.

כמה דוגמאות צריך ב-Few-shot?

אין מספר קבוע — תלוי במשימה, אך לרוב בין 2 ל-10 דוגמאות; יותר מדי דוגמאות עלולות "להטביע" את הפרומפט בלי תועלת נוספת משמעותית.

האם סדר-הדוגמאות משנה?

כן, ולעיתים משמעותית — מחקר מ-2021 הראה שסדר-שונה של אותן דוגמאות בדיוק יכול לשנות ביצועים מרמת-תחרות עם אימון-מלא לרמת-ניחוש-אקראי.

למה מודלי-צ׳אט מודרניים פחות זקוקים ל-Few-shot?

כי הם עברו כוונון-הוראות (Instruction Tuning) שמלמד אותם להבין ולציית להוראות בשפה טבעית ישירות, בלי צורך בדוגמאות מפורשות לרוב המשימות.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו