Faster R-CNN — מחליף את הצעת-האזורים ב-RPN פנימית; כ-5 תמונות בשנייה

יסודות בינה מלאכותית

הגדרה

Faster R-CNN היא ארכיטקטורת זיהוי-עצמים משנת 2015, שפרסמו שאוצ׳ינג רן, קאימינג הה, רוס גירשיק וג׳יאן סון, ואשר החליפה את שלב הצעת-האזורים החיצוני שהאט את R-CNN ברשת-נוירונים ייעודית המשולבת ישירות בתוך המודל — Region Proposal Network (RPN).

הבעיה: שלב הצעת-האזורים כצוואר-בקבוק

לפי המאמר שהציג את Faster R-CNN, שיטות קודמות כמו SPPnet (2014) ו-Fast R-CNN עצמה כבר קיצרו משמעותית את זמן-הריצה של רשת-הזיהוי, אבל בכך רק חשפו את שלב הצעת-האזורים — שנשען עדיין על אלגוריתם חיצוני כמו Selective Search — כצוואר-הבקבוק החדש שקובע את מהירות המערכת כולה. אלגוריתם הצעת-האזורים לא היה חלק מהרשת הנלמדת, ולכן לא יכול היה להשתפר או להתייעל יחד איתה, ולא רץ על אותו חומרה מואצת (GPU) כמו שאר הרשת.

הפתרון: Region Proposal Network

שאוצ׳ינג רן, קאימינג הה, רוס גירשיק וג׳יאן סון, אז ב-Microsoft Research, פרסמו ב-2015 פתרון שמשלב את הצעת-האזורים לתוך הרשת עצמה: Region Proposal Network (RPN) — רשת-קונבולוציה מלאה, החולקת את מפות-המאפיינים של התמונה כולה עם רשת-הזיהוי, וחוזה בו-זמנית גבולות-עצם ודירוג-״האם יש כאן עצם״ בכל מיקום בתמונה. מכיוון ש-RPN וה-Fast R-CNN שבאה אחריה חולקות את אותם חישובי-קונבולוציה, הצעת-האזורים הופכת, לפי המאמר, כמעט חסרת-עלות — במקום שלב נפרד ואיטי. המאמר עצמו מתאר את הקשר בין שני הרכיבים במונחים שהיו אז פופולריים ברשתות בעלות מנגנוני ״תשומת-לב״ (attention): רכיב ה-RPN מכוון את הרשת המאוחדת ״לאן להסתכל״ בתמונה.

התוצאה: מהירות בזמן-אמת כמעט

המערכת המאוחדת — RPN יחד עם Fast R-CNN, חולקות את אותה רשת-בסיס — השיגה, לפי המאמר, קצב של 5 תמונות בשנייה (כולל כל שלבי העיבוד) על GPU בעת שימוש ברשת VGG-16, תוך שימוש ב-300 הצעות-אזורים בלבד לתמונה, ותוך שמירה על דיוק-זיהוי מוביל על מאגרי-הבנצ׳מרק PASCAL VOC 2007, PASCAL VOC 2012 ו-MS COCO. זו הייתה קפיצת-מהירות ניכרת ביחס לשיטות הדו-שלביות שקדמו לה, בלי לוותר על הדיוק שאפיין אותן. השם ״קרוב לזמן-אמת״ (Towards Real-Time Object Detection) שבכותרת המאמר עצמו משקף בדיוק את מיקומו של Faster R-CNN בציר שבין הדיוק הגבוה של R-CNN המקורי לבין המהירות שדרשו יישומים מעשיים.

ניצחון בתחרויות 2015

לפי המאמר המקורי, Faster R-CNN ורשת-ה-RPN שלה שימשו בסיס לזוכות-המקום-הראשון במספר מסלולים בתחרויות ILSVRC ו-COCO של 2015 גם יחד. בתחרות ILSVRC2015 עצמה, קבוצת MSRA זכתה במשימת זיהוי-העצמים עם ציון mAP של 0.620741, לפי טבלת-התוצאות הרשמית של התחרות — התוצאה הגבוהה ביותר שנרשמה שם באותה שנה, וניצחון כפול שנרשם על שמה של MSRA באותה שנה גם במשימת-הסיווג, באמצעות ResNet.

רכיב-בסיס לדורות הבאים

המבנה שהציג Faster R-CNN — רשת-בסיס משותפת שממנה נגזרים גם הצעת-האזורים וגם הסיווג — הפך לבסיס הסטנדרטי לדור הבא של ארכיטקטורות זיהוי-עצמים ומיצוי-מופעים. שנתיים אחר-כך, ב-2017, קאימינג הה ורוס גירשיק, שניים מארבעת מחברי Faster R-CNN, הרחיבו אותו ל-Mask R-CNN, בהוספת ענף נוסף לחיזוי מסכת-פיקסלים לכל עצם. גם רשת-הבסיס עצמה התפתחה: בעוד המאמר המקורי הדגים את השיטה בעיקר עם VGG-16, גרסאות מאוחרות יותר של Faster R-CNN ושל Mask R-CNN עברו להשתמש ב-ResNet כרשת-בסיס.

מיקומו של Faster R-CNN היום

Faster R-CNN נותר עד היום אחת מארכיטקטורות-הייחוס המרכזיות בגישה הדו-שלבית לזיהוי-עצמים — זו שמפרידה בין הצעת-אזורים לסיווג, אך מבצעת את שתיהן בתוך רשת אחת משותפת. הוא משמש בסיס נפוץ למחקר ולפרויקטים תעשייתיים כאחד, ומהווה נקודת-השוואה קבועה מול גישות חד-שלביות מאוחרות יותר כמו YOLO, שמוותרות על שלב הצעת-האזורים הנפרד לגמרי לטובת מהירות גבוהה עוד יותר, במחיר אפשרי של דיוק. השם עצמו — Faster R-CNN, כלומר ״R-CNN מהיר יותר״ — משקף את מה שהוביל את כל השרשרת: כל דור בסדרת ה-R-CNN נולד כתגובה ישירה לצוואר-הבקבוק המרכזי של קודמו.

שאלות נפוצות ❓

במה Faster R-CNN שונה מ-R-CNN המקורי?

Faster R-CNN מחליף את שלב הצעת-האזורים החיצוני והאיטי (Selective Search) ברשת-נוירונים פנימית, Region Proposal Network, שחולקת חישובים עם רשת-הסיווג — מה שמייתר את הצורך באלגוריתם חיצוני נפרד.

מי פיתח את Faster R-CNN?

שאוצ׳ינג רן, קאימינג הה, רוס גירשיק וג׳יאן סון, אז ב-Microsoft Research, פרסמו אותו ב-2015.

כמה מהיר Faster R-CNN?

לפי המאמר המקורי, המערכת המלאה (RPN יחד עם Fast R-CNN) רצה בקצב של כ-5 תמונות בשנייה על GPU, בעת שימוש ברשת VGG-16 ו-300 הצעות-אזורים בלבד לתמונה.

איך Faster R-CNN קשור ל-Mask R-CNN?

Mask R-CNN, שפורסם ב-2017 על-ידי קאימינג הה ורוס גירשיק (שניים ממחברי Faster R-CNN), מרחיב את אותה ארכיטקטורה בדיוק בהוספת ענף נוסף שחוזה מסכת-פיקסלים לכל עצם, לא רק תיבת-תיחום וסיווג.