pix2pix — מודל להמרת-תמונה; צובע שחור-לבן והופך מפה לתמונת-לוויין

תמונה, קול ווידאו

הגדרה

pix2pix הוא מאמר וכלי מ-2016 מאוניברסיטת קליפורניה בברקלי, שהציג רשת יריבה-גנרטיבית מותנית (Conditional GAN) ללימוד "תרגום" כללי בין תמונת-קלט לתמונת-פלט תואמת, כמו הפיכת סקיצה לתמונה ריאליסטית.

pix2pix הוצג בנובמבר 2016 במאמר מאת פיליפ איזולה, ג'ון-יאן ג'ו, טינגהוי ג'ואו ואלכסיי אפרוס מאוניברסיטת קליפורניה בברקלי (הוצג רשמית בכנס CVPR 2017), כגישה כללית לבעיית "תרגום תמונה-לתמונה": איך ללמד רשת להפוך תמונת-קלט אחת, כמו מפת-קווים, לתמונת-פלט תואמת, כמו תצלום — בלי לתכנן ידנית פונקציית-שגיאה נפרדת לכל משימה בנפרד, כפי שהיה מקובל קודם לכן בתחום, לפני המאמר הזה.

בשונה מ-GAN רגיל שמייצר תמונה מרעש אקראי, pix2pix מאומן על זוגות של תמונת-קלט ותמונת-פלט תואמת, ולומד ישירות את ה"מיפוי" ביניהן: המחולל בנוי בארכיטקטורת U-Net, והמבחין — הנקרא PatchGAN — בוחן טלאים-מקומיים בתמונה במקום את התמונה כולה, ומצטרף לרכיב-אובדן נוסף שמודד דמיון ישיר לתמונת-המטרה. הגישה הוכחה כללית מספיק ליישומים מגוונים כמו צביעת-תמונות בשחור-לבן, הפיכת מפות-Google לתצלומי-לוויין, והמרת סקיצות לתצלומים.

התוכנה הנלווית למאמר זכתה, לפי החוקרים עצמם, לאימוץ נרחב בקרב אמנים ומשתמשי-אינטרנט שהשתמשו בה ליצירה וניסוי גם בלי רקע טכני — עדות להצלחת הגישה הכללית שלא דרשה כיוונון-ידני לכל משימה בנפרד. pix2pix נחשב לאחת מנקודות-הציון המוקדמות והמשפיעות ביותר בתחום תמונה-לתמונה, עוד לפני שגישות מבוססות-דיפוזיה הפכו לסטנדרט הרווח בתחום, ועדיין משמש כיום כדוגמת-לימוד נפוצה להסבר עקרונות ה-Conditional GAN.