פיליפ ("פיל") גייג' היה, נכון ל-1994, מהנדס-תוכנה בקולורדו ספרינגס, ארה"ב, בעל תואר-ראשון במדעי-המחשב מאוניברסיטת קולורדו, ומתכנת מקצועי מאז 1983. מלבד עובדה זו ופרסום-המפתח שלו, לא נותר עליו תיעוד ציבורי נרחב — שלא כמו רוב הדמויות האחרות בקטגוריה הזו, הוא לא המשיך לקריירה-מחקרית או ציבורית בתחום ה-AI.
ב-1994 פרסם גייג' במגזין The C Users Journal (ופורסם גם ב-Dr. Dobb's Journal) מאמר בשם "A New Algorithm for Data Compression", שבו תיאר את אלגוריתם קידוד-זוגות-הבתים (Byte Pair Encoding, BPE). זוהי שיטת-דחיסה כללית וללא-אובדן: האלגוריתם מאתר את הזוג הנפוץ ביותר של בתים סמוכים בקובץ נתונים כלשהו, ומחליף את כל המופעים שלו בבית בודד שלא היה בשימוש — וחוזר על התהליך שוב ושוב. המאמר המקורי עוסק כולו בדחיסת-קבצים כללית (כמו קובצי-הפעלה בינאריים) ואינו מזכיר כלל טקסט, שפה או עיבוד-שפה-טבעית — התחום שבו BPE מוכר כיום כלל לא היה קיים עדיין באותה צורה.
כ-20 שנה לאחר מכן, ב-2015, פרסמו ריקו סנריך, בארי הדואו ואלכסנדרה בירץ' מאמר בשם "Neural Machine Translation of Rare Words with Subword Units", שבו הציעו להתאים גרסה שונה-במקצת של אלגוריתם ה-BPE של גייג' למשימה שונה לגמרי: פירוק מילים נדירות בתרגום-מכונה-נוירוני ל"תת-מילים" (subword units) קטנות ונפוצות יותר. השינוי המרכזי: במקום לחפש דחיסה-מרבית של קובץ, המטרה הפכה לבניית אוצר-מילים קבוע וסביר-בגודלו של יחידות-טקסט (טוקנים) שמודל-שפה יכול לעבוד איתן.
גרסה מותאמת זו של BPE הפכה מאז לאחת משיטות-הטוקניזציה (tokenization) הנפוצות ביותר במודלי-שפה גדולים מודרניים — כולל ב-GPT ובמודלים דומים — אך חשוב להדגיש: גייג' עצמו לא המציא את השיטה עבור עיבוד-שפה, ולא היה מעורב באופן כלשהו בהתאמתה למטרה זו. תרומתו המקורית הייתה כלי-דחיסה-כללי גרידא; ההתאמה למודלי-שפה היא הישג נפרד לגמרי של חוקרים אחרים, כעשרים שנה מאוחר יותר.