רישוי נתוני-אימון הוא הצד העסקי של השאלה מאיפה מגיעים הנתונים שמודל מתאמן עליהם. עבור מפתחת המודל זהו סעיף עלות; עבור בעל התוכן — מוציא לאור, ארכיון, פורום או ספריית תמונות — זהו ערוץ הכנסה שלא היה קיים קודם. הערך הזה מתאר את המנגנון, לא את העסקאות עצמן.
בפועל פועלות היום שלוש שכבות. הראשונה היא הסכם דו-צדדי: משא-ומתן ישיר בין חברה אחת לבעל-תוכן אחד, על היקף, תקופה ומחיר. זה מה שהתחיל את השוק, אבל הוא מתאים רק לבעלי-תוכן גדולים מספיק כדי שיהיה למי לפנות אליהם.
השכבה השנייה מנסה לפתור בדיוק את זה, באמצעות תקן קריא-למכונה שמאפשר לכל אתר להצהיר על תנאי הרישוי שלו בלי משא-ומתן. RSL (Really Simple Licensing) הוא תקן פתוח כזה: הוא נוסף לקובץ robots.txt או לעמוד עצמו, ומציין אילו שימושים מותרים — למשל אימון מודל — ובאיזה מודל תשלום, ייחוס בלבד, תשלום לפי זחילה או תשלום לפי הרצה. המבנה שאול מעולם המוזיקה, שבו גופי-גבייה מרכזיים מתווכים בין יוצרים רבים למשתמשים רבים. מפרט RSL 1.0 פורסם בדצמבר 2025, ולפי ניתוח ב-Columbia Journalism Review אף חברת AI גדולה לא התחייבה עדיין לכבד את התקן.
השכבה השלישית יושבת בתשתית עצמה. ביולי 2025 הציגה Cloudflare מנגנון בשם pay per crawl, שאותו היא מתארת כניסוי ראשון שלה בתחום ומפעילה בבטא פרטית: אתר קובע מחיר אחיד לכל בקשה, זחלן שאינו מציג כוונת-תשלום מקבל תשובת HTTP 402 ובה המחיר המבוקש, ו-Cloudflare משמשת סוחר-הרשומה שגובה את הכסף. נכון להודעה, המנגנון אינו פתוח לכול.
לרישוי יש גם השלכה על פתיחות. נתונים שנרכשו ברישיון אסורים בדרך כלל בהפצה מחדש — וזו אחת הסיבות שהגדרת הקוד-הפתוח ל-AI הסתפקה בדרישה למידע מפורט על הנתונים במקום לנתונים עצמם.