מהי מטרת השיטה?
פריסת גאוס תלת־ממדית היא שיטה לייצוג סצנה שנצפתה מכמה תמונות, כדי ליצור תמונות מזוויות מצלמה חדשות. היא אינה מתחילה בהכרח מפרומפט ואינה רק מסנן דו־ממדי. תחילה נדרשות תמונות עם תנוחות מצלמה ידועות או מוערכות. מן התצפיות נבנה ייצוג מרחבי, ולאחר מכן מקרינים אותו אל מסך וירטואלי כדי להפיק מבט שלא הופיע בדיוק בקלט.
כיצד מיוצגת הסצנה?
השיטה המקורית מתחילה בענן נקודות דליל שנוצר בתהליך כיול ושחזור מצלמות. כל רכיב גאוסי מחזיק מיקום, גודל וצורה מרחבית, שקיפות ומידע צבע התלוי בכיוון הצפייה. השונות המשותפת האנאיזוטרופית מאפשרת לרכיב להימתח בכיוונים שונים במקום להישאר כדור. במהלך האופטימיזציה המערכת משנה את הפרמטרים ומוסיפה או מסירה רכיבים כדי להתאים טוב יותר לתמונות האימון.
כיצד נוצרת תמונה חדשה?
בעת הרינדור מקרינים את הגאוסים התלת־ממדיים למישור התמונה, מסדרים את תרומתם לפי נראות ומשלבים צבע ושקיפות. האלגוריתם תוכנן לדלג על מרחבים ריקים ולעבוד עם רכיבים מפורשים, ולכן מחברי השיטה דיווחו על רינדור בזמן אמת באיכות גבוהה במערכי הבדיקה שלהם. התמונה המתקבלת מחושבת מן הייצוג המותאם; היא אינה צילום נוסף ואינה חושפת בהכרח צד שמעולם לא נצפה.
מה ההבדל מ־NeRF?
NeRF המקורית מייצגת סצנה באמצעות רשת שמקבלת מיקום תלת־ממדי וכיוון צפייה ומחזירה צפיפות וקרינה, ואז משתמשת ברינדור נפחי לאורך קרני מצלמה. פריסת גאוס משתמשת באוסף רכיבים מרחביים מפורשים שניתנים להקרנה ישירה. שתי המשפחות פותרות סינתזה של מבטים חדשים, אך מבנה הייצוג, תהליך האופטימיזציה ועלות הרינדור שונים. אין להסיק מכך שאחת עדיפה בכל סצנה או חומרה.
מהן המגבלות וכיצד מעריכים?
המחקר המקורי בחן 13 סצנות אמיתיות וסינתטיות ממאגרים מוגדרים והשווה איכות ומהירות לשיטות אחרות. ביצועים תלויים במספר התמונות, בכיסוי הזוויות, בדיוק תנוחות המצלמה, בזיכרון ובכרטיס הגרפי. אזורים שלא נצפו, משטחים שקופים, השתקפויות ותנועה בין צילומי הקלט עלולים ליצור חורים או מריחות. הערכה טובה בוחנת גם איכות מבט חדש, גם זמן אימון ורינדור וגם גודל הייצוג, ולא רק סרטון הדגמה חלק.