Common Crawl
הגדרה
Common Crawl הוא ארכיון חינמי של מיליארדי דפי אינטרנט, שמפרסמת עמותה אמריקאית שנוסדה ב-2007 — ואחד המקורות החשובים לטקסט שעליו מאמנים מודלי שפה גדולים.
💡 דוגמה
סטודנטית שרוצה לאמן מודל שפה קטן לא צריכה לסרוק את כל האינטרנט בעצמה.
היא מורידה חלק מהארכיון של Common Crawl, שכבר מכיל מיליארדי דפים — כמו שעשו, למשל, מפתחי GPT-3.
ארכיון של האינטרנט, פתוח לכולם
Common Crawl היא עמותה אמריקאית ללא מטרות רווח, שנוסדה ב-2007 בידי גיל אלבז. היא שולחת תוכנה אוטומטית, "זחלן" (crawler), שעוברת בין אתרים ושומרת עותק של הדפים, ומפרסמת את התוצאה לכל מי שרוצה, בחינם. לפי אתר העמותה, הארכיון מכיל יותר מ-300 מיליארד דפים, ובכל חודש נסרקים כמה מיליארדי דפים נוספים. המידע מאוחסן בשירות הענן של אמזון, והגישה אליו חינמית, אף שמי שמעבד אותו בענן משלם על כוח המחשוב. המטרה המוצהרת, לפי שאלות הנפוצות באתר, היא שכל אחד, ולא רק חברות גדולות, יוכל לחקור את הרשת. לפי ויקיפדיה, Common Crawl תוכנן לספק יותר נתונים, טריים יותר ונוחים יותר לניתוח, מאשר ארכיון האינטרנט המוכר Wayback Machine.
מה יש בתוך סריקה אחת
הארכיון מתפרסם בסריקות. הסריקה של ספטמבר 2026, למשל, נאספה בין 4 ל-17 בספטמבר, וכוללת לפי העמותה 2.17 מיליארד דפים — 361.4 TiB (יחידת נפח בינארית) של תוכן לא דחוס, מ-40.4 מיליון שמות מארחים השייכים ל-33.2 מיליון דומיינים רשומים. 587.2 מיליון מהכתובות לא נסרקו באף סריקה קודמת. כל סריקה מתפרסמת בשלוש צורות: הדפים הגולמיים כפי שנשמרו, נתונים על הדפים, וטקסט שחולץ מהם. בעלי אתרים יכולים לחסום את הזחלן, שנקרא CCBot, בקובץ ההוראות לזחלנים של האתר (robots.txt), והעמותה מזהירה שיש זחלנים שמתחזים ל-CCBot. באפריל 2026 החלה העמותה, כניסוי, להפיץ סריקה גם דרך Hugging Face, לצד האחסון הרגיל באמזון.
הדלק של מודלי השפה
לפי ויקיפדיה, במשך שנים השתמשו בארכיון בעיקר חוקרים וכמה חברות הזנק, וזה השתנה בשנות ה-2020, כשחברות AI התחילו לאמן עליו מודלי שפה גדולים. המקרה המתועד ביותר הוא GPT-3 של OpenAI. במאמר מ-2020 כתבו מפתחיו שהשתמשו בגרסה מסוננת של Common Crawl, שהכילה 410 מיליארד טוקנים, ושלדוגמאות ממנה הוקצה משקל של 60% בתערובת האימון. החוקרים גם הסבירו למה סיננו: לדבריהם, גרסאות לא מסוננות או מסוננות קלות של הארכיון נוטות להיות באיכות נמוכה יותר ממאגרים שנאספו בקפידה. במאמר שפורסם ב-2024 בכנס האקדמי FAccT כתב החוקר סטפן באק שהארכיון משמש לעתים כה קרובות, ובחלק כה גדול מנתוני האימון, שלדבריו ניתן לטעון שהפך לאבן בניין יסודית בפיתוח מודלי שפה. הערך על נתוני אימון מסביר את התפקיד הכללי של נתונים כאלה, והערך על היקף מערכי האימון מציג את המספרים לאורך השנים.
מהגולמי למסונן
כמו שמפתחי GPT-3 הסבירו, את הארכיון מסננים לפני האימון. לפי ויקיפדיה, ארגונים רבים לוקחים את הנתונים הגולמיים ומזקקים מהם מאגרים נקיים יותר, למשל C4, ש-Google בנתה ב-2019 כדי לאמן את מודלי T5, או FineWeb של Hugging Face. לפי דף המאגר, FineWeb מכיל יותר מ-18.5 טריליון טוקנים של טקסט אנגלי מנוקה, שנבנה מסריקות Common Crawl החל מ-2013, אחרי ניקוי, סינון והסרת כפילויות. הסינון הזה הוא לא עניין טכני בלבד. מחקר שהוצג ב-2021 בכנס ACL מצא בארכיון כמות משמעותית של תוכן לא רצוי, כולל דברי שטנה ותוכן מיני בוטה — גם אחרי סינון. באק כתב שמפתחי מודלים רבים השתמשו בארכיון באופן בעייתי — למשל סיננו תוכן מזיק בטכניקות אוטומטיות בסיסיות, בלי הקפדה ובלי שקיפות לגבי אופן הסינון. מנגד, הוא כתב שהארכיון הפתוח הפך את הבינה המלאכותית היוצרת לשקופה יותר לביקורת, ואפשר מחקר ופיתוח של מודלי שפה גם מחוץ לחברות ה-AI המובילות ועתירות המשאבים.
מי מממן את זה
לפי ויקיפדיה, עד 2023 מומנה העמותה כמעט רק על ידי קרן משפחת אלבז. ב-2023 התחילו להגיע תרומות מתעשיית ה-AI: אנת'רופיק ו-OpenAI תרמו כל אחת 250 אלף דולר. באותה שנה, לפי ויקיפדיה, הגיעו לעמותה הבקשות הראשונות להסיר מידע, והזחלן שלה נחסם ביותר ויותר אתרים. בספטמבר 2025 ציינה העמותה שהיא פועלת כבר 18 שנה, שמעולם לא גבתה תשלום על הגישה לנתונים, ושהם צוטטו ביותר מ-10,000 מאמרים מחקריים. היא גם כתבה שבכל חודש היא סורקת כמה מיליארדי דפים חדשים מתוך "חזית" של יותר מטריליון כתובות שהיא מכירה.
המחלוקת עם המו"לים
ככל שהארכיון הפך לחומר גלם לבינה מלאכותית, גברה ההתנגדות של עיתונים ובעלי תוכן. לפי ויקיפדיה, בנובמבר 2025 פרסם העיתונאי אלכס רייזנר תחקיר במגזין The Atlantic, שלפיו העמותה הטעתה מו"לים כשטענה שהיא מכבדת חומות תשלום (paywall) ושהיא מסירה תכנים לבקשתם; לפי התחקיר, כלי החיפוש באתר הראה שאתרים כאלה הוסרו, בזמן שהתוכן שלהם עדיין נכלל בסריקות. העמותה דחתה את הטענות: בתגובה רשמית כתבה שהזחלן שלה אינו עוקף חומות תשלום ואינו נכנס לאתרים עם סיסמה, שהיא מכבדת את robots.txt, ושמאחר שקובצי הארכיון אינם ניתנים לעריכה, היא מסירה או מסננת כתובות מהסריקות הבאות ומהכלים הציבוריים. עוד קודם לכן, בספטמבר 2025, התחילה העמותה לפרסם רשימה של כל בקשות ההסרה המשפטיות שקיבלה. ביוני 2026 דרש ארגון המו"לים האמריקאי Digital Content Next, לפי Search Engine Journal, שהעמותה תפסיק לאסוף, לשמור ולשתף תוכן מוגן של המו"לים החברים בו, כולל תוכן שמאחורי חומת תשלום, ושתסיר תוכן כזה שכבר נאסף. המנהל של העמותה, ריץ' סקרנטה, סירב להגיב למכתב.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
האם Common Crawl הוא כל האינטרנט?
לא. זה אוסף של דפים שהזחלן של העמותה הצליח להגיע אליהם ושלא נחסמו בפניו. כל סריקה חודשית מכילה כמה מיליארדי דפים, ואתרים רבים חוסמים את הזחלן או נמצאים מאחורי סיסמה.
מי משתמש בו?
חוקרים בתחומים רבים, ובשנות ה-2020 גם חברות שמאמנות מודלי שפה. במאמר על GPT-3, למשל, הוקצה לגרסה מסוננת של הארכיון משקל של 60% בתערובת האימון.
איך מונעים מ-Common Crawl לאסוף את האתר שלי?
חוסמים את הזחלן שלו, CCBot, בקובץ robots.txt של האתר. העמותה ממליצה על הדרך הזאת, ומפרסמת גם רשימה של בקשות הסרה משפטיות שקיבלה.
מה ההבדל בין Common Crawl ל-C4 או ל-FineWeb?
Common Crawl הוא הארכיון הגולמי. C4 ו-FineWeb הם מאגרים שגוגל ו-Hugging Face בנו ממנו אחרי ניקוי, סינון והסרת כפילויות, כדי שיתאימו לאימון מודלים.
האם השימוש בו חוקי?
זו שאלה פתוחה ושנויה במחלוקת, ואין לה תשובה אחת: היא תלויה בשאלה אם מדובר באיסוף, בהפצה או באימון מודל, ובחוק של כל מדינה. העמותה רואה בעצמה ארכיון פתוח, ואילו מו"לים טוענים שתוכן מוגן, כולל תוכן שמאחורי חומת תשלום, לא היה צריך להיאסף ולהימסר לחברות AI. הערך על זכויות יוצרים ובינה מלאכותית מרחיב על הוויכוח.