VGG הוא מודל רשת-קונבולוציה עמוקה, שפרסמו ב-2014 קארן סימוניאן ואנדרו זיסרמן, חוקרי קבוצת המחקר Visual Geometry Group (VGG — מכאן שם המודל) במחלקה להנדסה של אוניברסיטת אוקספורד, במאמר "Very Deep Convolutional Networks for Large-Scale Image Recognition". השאלה שהמאמר בדק הייתה פשוטה למראה אך משמעותית מאוד להמשך התחום כולו: מה קורה כשמעמיקים רשת-קונבולוציה ככל האפשר, תוך שימוש עקבי אך ורק בשכבות-פילטר קטנות מאוד בגודל 3x3 פיקסלים, במקום בפילטרים גדולים יותר שהיו נפוצים בארכיטקטורות שקדמו לו?
התשובה הייתה: דיוק גבוה משמעותית, גם בלי טריקים ארכיטקטוניים מורכבים או יצירתיים במיוחד. VGG הראה בבירור ששימוש עקבי בפילטרים קטנים, בערימה עמוקה של שכבות רבות (16 או 19 שכבות משוקללות בגרסאות הנפוצות VGG-16 ו-VGG-19), משיג ביצועים טובים יותר מארכיטקטורות מוקדמות יותר עם פחות שכבות ופילטרים גדולים יותר — תוך שמירה על עיצוב אחיד, סימטרי ופשוט יחסית להבנה וליישום בפועל, בהשוואה לארכיטקטורות מתחרות מורכבות ומסועפות הרבה יותר שהתפרסמו סביב אותה תקופה בדיוק.
בתחרות ImageNet 2014 השיג VGG מקום ראשון במשימת איתור-מיקום (localization) ומקום שני בלבד במשימת סיווג-תמונה — אחרי GoogLeNet, ארכיטקטורה מתחרה מאותה שנה בדיוק שהשתמשה במבנה-הסתעפויות מורכב הרבה יותר ובמספר פרמטרים קטן יותר. למרות שלא ניצח במשימת הסיווג עצמה, הפשטות והעקביות הבולטות של VGG הפכו אותו לפופולרי במיוחד כרכיב-בסיס (backbone) בתוך מערכות אחרות רבות בתעשייה ובאקדמיה כאחד, ולנקודת-ייחוס סטנדרטית שכל ארכיטקטורת ראייה-ממוחשבת חדשה נבחנת מולה, גם שנים רבות אחרי פרסומו המקורי.
המחיר של הפשטות הזאת הוא גודל ניכר: VGG-16 מכיל כ-138 מיליון פרמטרים, הרבה יותר מארכיטקטורות מאוחרות ויעילות יותר כמו ResNet, שמשיגות דיוק דומה או אף טוב יותר בפחות פרמטרים משמעותית, בזכות חידושים ארכיטקטוניים כמו קישורי-שארית שמייעלים את זרימת המידע ברשת. עדיין, VGG נותר כלי נפוץ במיוחד בהוראה ובמחקר בזכות פשטותו ובהירותו הרבה, ומשמש גם כיום כרשת-בסיס בתוך יישומי ראייה-ממוחשבת רבים, כולל בתחום העברת-סגנון (style transfer) לתמונות ובחילוץ-מאפיינים לצרכי השוואת-תמונות ואחזור-תמונות דומות ממאגרים גדולים.