DreamBooth (התאמה אישית של מודל תמונה)

תמונה, קול ווידאו

הגדרה

DreamBooth היא שיטה להתאמת מודל טקסט־לתמונה לנושא מסוים באמצעות מספר קטן של תמונות ייחוס שלו.

מהי DreamBooth?

DreamBooth היא שיטה להתאמה אישית של מודל טקסט־לתמונה שכבר אומן. המשתמש מספק מספר קטן של תמונות של נושא מסוים — למשל חפץ או בעל חיים — והאימון מעדכן את המודל כך שיוכל לייצר את אותו נושא בהקשרים חדשים. המטרה אינה לאמן מודל מאפס ואינה לאחסן רק עותק של התמונות, אלא לקשור את המאפיינים החזותיים שלהן לדרך חדשה להזכיר את הנושא בפרומפט.

כיצד המודל מזהה את הנושא?

בשיטה המקורית מצרפים מזהה ייחודי למילת המחלקה, למשל מזהה מיוחד לצד המילה כלב. במהלך ההתאמה המודל לומד שהצירוף מציין את הנושא המסוים, בעוד שמילת המחלקה שומרת את הקשר לידע הכללי. לאחר מכן אפשר לבקש את הנושא בזווית, תאורה, תנוחה או סביבה שלא הופיעו בתמונות הייחוס. התוצאה היא הכללה מחושבת, ולכן שמירת הזהות אינה מושלמת בכל פרומפט.

למה נדרש שימור ידע קודם?

התאמה על מעט תמונות עלולה לגרום למודל להתמקד בהן יתר על המידה ולפגוע ביכולתו לייצר דוגמאות מגוונות מן המחלקה. DreamBooth מוסיפה הפסד לשימור הידע הקודם: המודל מייצר דוגמאות של המחלקה ומשתמש בהן במהלך האימון לצד תמונות הנושא. המנגנון נועד לאזן בין לימוד הזהות הפרטית לבין הידע הכללי, אך עוצמתו והגדרות האימון עדיין משפיעות על הגיוון והנאמנות.

מה הקשר ל־LoRA ולבחירת הגדרות?

בתיעוד Diffusers, DreamBooth יכולה לעדכן את המודל המלא או להשתלב עם LoRA, שמאמנת מספר קטן יותר של פרמטרים ושומרת התאמה קומפקטית יותר. אלה אינם שמות לשתי מטרות שונות: DreamBooth מתארת את משימת ההתאמה לנושא, ו־LoRA היא דרך יעילה לבצע עדכון פרמטרים. התיעוד מזהיר שהאימון רגיש לפרמטרים וקל להגיע להתאמת־יתר, ולכן מספר צעדים וקצב למידה אינם בחירה טכנית שולית.

כיצד מעריכים תוצאה ומהם הסיכונים?

יש לבדוק שתי תכונות נפרדות: האם הדמות או החפץ נשמרים, והאם אפשר למקם אותם במצבים מגוונים בלי להעתיק את תמונות האימון. בדיקה על פרומפט יחיד עלולה להסתיר התאמת־יתר, שינוי פנים או אובדן פרטים ייחודיים. תמונות של אנשים מעלות גם שאלות של הסכמה, פרטיות והתחזות; תמונות של יצירות וסגנונות מעלות שאלות זכויות. השלמת האימון אינה הוכחת איכות או הרשאה להשתמש בכל פלט.

שאלות נפוצות ❓

האם מאמנים מודל מאפס?

המחקר מתחיל במודל טקסט־לתמונה מאומן ומתאים אותו.

האם משתמשים רק במילים?

האימון כולל תמונות של הנושא.

האם אפשר לשלב LoRA?

כן; תיעוד Diffusers מספק לכך מימוש מפורש.

האם חייבים לחכות לסוף כדי לראות דוגמאות?

במימוש המתועד אפשר ליצור תמונות בדיקה לאורך האימון.