דלג לתוכן

The Pile — מאגר טקסט פתוח לאימון מודלי שפה, מ-22 מקורות

מודלים ושפה

הגדרה

The Pile הוא מאגר טקסט באנגלית שפורסם לציבור, בנפח של כ-825 GiB, שבנתה קהילת המחקר EleutherAI ופרסמה ב-31 בדצמבר 2020 כדי לאמן מודלי שפה גדולים — ושהפך גם למוקד של מחלוקת על זכויות יוצרים.

💡 דוגמה

חוקרת באוניברסיטה רוצה לבדוק על מה בדיוק התאמן מודל שפה פתוח.

אם המודל אומן על The Pile, היא יכולה לקרוא במאמר שמתעד את המאגר מאילו 22 מקורות הוא בנוי, וכמה משקל קיבל כל מקור.

מאגר פתוח לאימון מודלי שפה

The Pile (בעברית: "הערימה") הוא מאגר טקסט באנגלית שנבנה במיוחד כדי לאמן מודלי שפה גדולים. את המאגר בנתה EleutherAI, קהילת מחקר של מתנדבים שקמה ב-2020, והמאמר שמתאר אותו פורסם ב-31 בדצמבר 2020. לפי המאמר, נפחו 825 GiB (יחידת נפח בינארית; בוויקיפדיה הוא מוצג כ-886 ג'יגה-בייט), והוא מורכב מ-22 מאגרי משנה. בין כותבי המאמר היו ליאו גאו, סטלה בידרמן, סיד בלאק וקונור ליהי. הרקע הוא הבעיה שהמחברים תיארו: לדבריהם, רוב מודלי השפה הגדולים של אותה תקופה לקחו את רוב הנתונים שלהם, או את כולם, מ-Common Crawl, ארכיון גולמי של דפי אינטרנט. הרעיון של The Pile היה לערבב הרבה מאגרים קטנים יותר ואיכותיים, ממקורות שונים, כדי שהמודל ילמד ידע רחב יותר. המאגר פורסם לציבור, יחד עם הקוד שבנה אותו, וכל אחד יכול היה להוריד אותו ולבדוק מה יש בו.

מה יש בתוך הערימה

לפי המאמר, הצוות בנה 14 מאגרים חדשים וגם גרסה מסוננת חדשה של Common Crawl, ושילב לצדם מאגרים קיימים. לכל חלק נקבע משקל בתערובת האימון, והמשקל הגדול ביותר, 18.11%, ניתן ל-Pile-CC, הגרסה המסוננת של Common Crawl. אחריו באים מאמרים רפואיים מלאים מ-PubMed Central, ספרים מ-Books3, דפי אינטרנט שקושרו מפוסטים ב-Reddit שקיבלו הצבעות חיוביות (OpenWebText2), מאמרים מדעיים מ-arXiv וקוד מ-GitHub. לצדם יש מקורות קטנים ומגוונים: פסקי דין מבתי משפט בארצות הברית, שאלות ותשובות מ-Stack Exchange, פטנטים, ויקיפדיה באנגלית, ספרים קלאסיים מפרויקט גוטנברג, כתוביות של סרטים, תרגילי מתמטיקה, פרוטוקולים של הפרלמנט האירופי, דיונים מ-Hacker News, כתוביות של סרטוני YouTube ואפילו מיילים של עובדי חברת אנרון. המאגר לא נותן לכל החלקים משקל שווה: מקורות שנחשבו איכותיים במיוחד מופיעים בו יותר מפעם אחת, וויקיפדיה, למשל, נקראת עד שלוש פעמים בכל מעבר על המאגר. בניסויים של המחברים, מודלים בגודל של GPT-2 שאומנו על The Pile השתפרו משמעותית, בכל אחד מחלקי המאגר, לעומת מודלים שאומנו על Common Crawl גולמי. הם גם הראו ש-GPT-2 ו-GPT-3 מתקשים בחלק מהחלקים, למשל בכתיבה אקדמית.

המאגר שעליו נבנו המודלים הפתוחים

The Pile היה הבסיס של המודלים הפתוחים ש-EleutherAI עצמה שחררה. לפי דף המודל ב-Hugging Face, GPT-J אומן על The Pile, ודף המודל מזהיר שהמאגר ידוע כמכיל ניבולי פה ושפה פוגענית. גם Pythia, סדרה של מודלים ש-EleutherAI בנתה כדי לחקור איך מודלי שפה לומדים, אומנה על The Pile: בכל אחת מגרסאות הנתונים של הסדרה (The Pile המקורי וגרסה שהוסרו ממנה כפילויות), כל הגדלים ראו בדיוק את אותם נתונים ובאותו סדר, כך שחוקרים יכולים להשוות ביניהם. אבל השימוש לא נעצר באקדמיה. לפי תחקיר של Proof News ו-Wired מיולי 2024, Apple, Nvidia ו-Salesforce תיארו במאמרים ובפרסומים שלהן שימוש ב-The Pile לאימון מודלים, וכך גם Bloomberg ו-Databricks; אנת'רופיק אישרה לתחקיר שהשתמשה בו לאימון Claude. לפי דוח של מכון קרנגי מאפריל 2024, מודלי השפה הגדולים הפתוחים של אותה תקופה נשענו בעיקר על שני מאגרים: Common Crawl ו-The Pile. כך הפך מאגר של קהילת מתנדבים לחלק מהתשתית של התעשייה כולה.

מה המחברים עצמם כתבו על הבעיות

המאמר המקורי לא הסתיר את הבעיות. המחברים כתבו שבגלל המקורות המגוונים, המאגר עלול להכיל תוכן פוגעני, מיני או מעליב, ובדקו את שיעור הניבולים בכל חלק בנפרד. הם גם הקדישו פרק לשאלת ההסכמה: הם הבחינו בין מידע שזמין לציבור, מידע שנאסף בהתאם לתנאי השימוש של האתר, ומידע שהכותבים עצמם הסכימו שישמש למחקר. הם תיעדו שחלק מהמאגרים נאספו בלי הסכמת הכותבים ובלי התאמה לתנאי השימוש, וכתבו שכולם מאגרים נפוצים שכבר מסתובבים ברשת, חוץ ממאגר כתוביות YouTube, שהצוות בנה בעצמו לפרויקט. על Books3 ועל כתוביות הסרטים כתבו שהשימוש תואם את תנאי האתר שמארח אותם, אבל הוסיפו שזה מטעה במידה מסוימת, כי האתר עצמו לא קיבל רשות מבעלי הזכויות לפרסם אותם. המחברים טענו שהשימוש שלהם בחומר מוגן חוקי לפי דיני זכויות היוצרים בארצות הברית, בין היתר כי הוא לא מסחרי. השאלה הזאת חזרה בהמשך, בתביעות ובתחקירים.

Books3: הספרים שהגיעו מאתר פיראטי

אחד החלקים שעמדו במרכז המחלוקת על זכויות יוצרים הוא Books3. לפי Wired, החוקר העצמאי שון פרסר בנה אותו בקיץ 2020, כשניסה לשחזר את נתוני האימון של GPT-3. לפי המאמר של The Pile, הספרים הגיעו מעותק של התוכן של Bibliotik, אתר שיתוף קבצים פרטי, ולפי Gizmodo האוסף כלל 196,640 ספרים. לפי Gizmodo, Meta כתבה במאמר על מודל LLaMA הראשון שהשתמשה ב-Books3 מתוך The Pile. בקיץ 2023 שלח ארגון זכויות היוצרים הדני Rights Alliance דרישות הסרה לאתרים שאירחו את Books3, והאתר The Eye הסיר אותו. לפי Gizmodo, הארגון מצא באוסף כ-150 כותרים של חברות שהוא מייצג. פרסר אמר ל-Gizmodo שבלי מאגרים כמו Books3, רק חברות של מיליארדי דולרים יוכלו לבנות מודלים כמו ChatGPT. Books3 הוסר מהגרסה הרשמית של The Pile, אבל לפי The Verge, באוגוסט 2024 תבעו שלושה סופרים את אנת'רופיק בטענה שאימנה את Claude על The Pile ועל Books3, ושהגרסה המקורית עדיין זמינה ברשת. התביעה התרחבה מעבר ל-Books3: לפי ויקיפדיה, ביוני 2025 קבע בית המשפט שאימון המודלים על עותקים דיגיטליים של הספרים היה שימוש הוגן, אבל ששמירה של יותר משבעה מיליון עותקים פיראטיים בספרייה מרכזית אינה שימוש הוגן. בספטמבר 2025 הסכימה אנת'רופיק לפשרה של 1.5 מיליארד דולר, וביולי 2026 אישר בית המשפט את הפשרה סופית. לפי אתר הפשרה, נכון לתחילת אוקטובר 2026 התשלומים הראשונים לסופרים צפויים לצאת עד 15 בנובמבר 2026.

כתוביות YouTube, ומה שנשאר מהמאגר

ביולי 2024 פרסמו Proof News ו-Wired תחקיר על חלק קטן במאגר: כתוביות YouTube. לפי התחקיר, הוא כולל כתוביות של 173,536 סרטונים מיותר מ-48,000 ערוצים, בהם ערוצי לימוד כמו Khan Academy ו-MIT, וערוצים של יוצרים גדולים. חלק מהיוצרים אמרו לתחקיר שאיש לא ביקש את רשותם. התחקיר גם דיווח שבאותה עת The Pile כבר הוסר מאתר ההורדה הרשמי שלו, אבל עדיין היה זמין בשירותי שיתוף קבצים. הערך על EleutherAI מספר על הקהילה שבנתה את המאגר, וכאן חשוב רק המשך הסיפור של המאגר עצמו: ביוני 2025 שחררה EleutherAI, עם שותפים, את Common Pile v0.1, מאגר בנפח 8 טרה-בייט שלפי יוצריו כולל טקסטים ברישיונות פתוחים וטקסטים שבנחלת הכלל. היוצרים כתבו שזיהוי הרישיון של כל יצירה קשה במיוחד, ושנאלצו להתייעץ עם מומחים משפטיים. לפי EleutherAI, שני מודלים בני שבעה מיליארד פרמטרים שאומנו עליו מגיעים לביצועים דומים לאלה של מודלים מובילים שאומנו בתנאים דומים על טקסט ללא רישיון. סטלה בידרמן, המנהלת של EleutherAI, כתבה שלדעתה אין הצדקה לרעיון הנפוץ שטקסט ללא רישיון הוא מה שמניע את הביצועים.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שבעה מתוך 22 החלקים של The Pile: ששת החלקים עם משקל האימון הגדול ביותר, וכתוביות YouTube (לפי מאמר המקור)
מה יש בומשקלו בתערובת האימון
Pile-CCדפי אינטרנט מסוננים מ-Common Crawl18.11%
PubMed Centralמאמרים רפואיים וביולוגיים מלאים14.40%
Books3ספרים מאוסף שמקורו באתר פיראטי12.07%
OpenWebText2דפי אינטרנט שקושרו מ-Reddit10.01%
ArXivמאמרים מדעיים, בעיקר במתמטיקה, מדעי המחשב ופיזיקה8.96%
GitHubקוד פתוח7.59%
YouTube Subtitlesכתוביות של סרטוני YouTube0.60%

שאלות נפוצות ❓

מה זה The Pile במשפט אחד?

מאגר טקסט באנגלית שפורסם לציבור, בנפח של כ-825 GiB, ש-EleutherAI בנתה מ-22 מקורות שונים ופרסמה בסוף 2020 כדי שכל אחד יוכל לאמן מודל שפה גדול.

אילו מודלים אומנו עליו?

המודלים הפתוחים של EleutherAI, כמו GPT-J וסדרת Pythia. לפי תחקיר של Proof News ו-Wired, גם Apple, Nvidia, Salesforce, Bloomberg ו-Databricks השתמשו בו, ואנת'רופיק אישרה שהשתמשה בו לאימון Claude.

למה הוא שנוי במחלוקת?

בגלל חלקים שנאספו בלי רשות בעלי הזכויות: בעיקר Books3, אוסף ספרים שמקורו באתר פיראטי, וכתוביות של יותר מ-170 אלף סרטוני YouTube. Books3 הוסר מהגרסה הרשמית. ב-2024 הוגשה תביעה נגד אנת'רופיק שהזכירה גם אותו; היא הסתיימה בפשרה של 1.5 מיליארד דולר, שאושרה סופית ביולי 2026.

אפשר עדיין להוריד אותו?

לפי תחקיר Wired מיולי 2024, באותה עת הוא כבר הוסר מאתר ההורדה הרשמי, אבל עדיין היה זמין בשירותי שיתוף קבצים. כחלופה, EleutherAI שחררה ב-2025 את Common Pile v0.1, שלפי יוצריו כולל טקסטים ברישיונות פתוחים וטקסטים שבנחלת הכלל.

מה ההבדל בין The Pile ל-Common Crawl?

Common Crawl הוא ארכיון גולמי של דפי אינטרנט. The Pile משתמש בגרסה מסוננת שלו כחלק אחד, זה שקיבל את המשקל הגדול ביותר, ומוסיף לו מקורות רבים אחרים, כמו מאמרים מדעיים, ספרים, קוד ופסקי דין.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו