כריית טקסט (Text Mining)

מודלים ושפה

הגדרה

כריית טקסט היא תחום שמטרתו חילוץ דפוסים, מגמות ותובנות ממאגרי-טקסט גדולים ולא-מובנים, באמצעות שילוב של עיבוד-שפה-טבעית וכריית-נתונים סטטיסטית — המונח נטבע כבר ב-1995.

מה זו כריית-טקסט, ולמה זה שם שאול מ"כריית-נתונים"

כריית-טקסט היא המאמץ הכללי לחלץ באופן שיטתי דפוסים, מגמות וידע מובנה ממאגרים גדולים של טקסט לא-מובנה — ביקורות-לקוחות, מאמרים מדעיים, ארכיוני-חדשות, דוא"ל, מסמכים משפטיים — בעזרת שילוב של עיבוד-שפה-טבעית והטכניקות הסטטיסטיות שפותחו במקור עבור "כריית-נתונים" על מסדי-נתונים טבלאיים ומובנים. השם שאול במכוון: כריית-נתונים הניחה שהמידע כבר יושב בפורמט נקי דמוי-גיליון; כריית-טקסט קיימת בדיוק כי רוב הטקסט האמיתי בעולם לא כזה, ודורש שלב-חילוץ משלו לפני שאפשר בכלל להפעיל עליו את שיטות-החיפוש-אחר-דפוסים הסטטיסטיות של כריית-הנתונים.

1995: המונח נטבע, במחקר עם שורשים ישראליים

המונח הספציפי ניתן לאיתור למאמר מוגדר: "Knowledge Discovery in Textual Databases (KDT)", שהציגו רונן פלדמן וידו דגן בקונפרנס ה-KDD (גילוי-ידע וכריית-נתונים) הראשון-אי-פעם, באוגוסט 1995. המאמר טען במפורש שרוב מחקר "גילוי-הידע" הקיים הניח מסדי-נתונים מובנים, בעוד רוב הולך-וגדל של המידע האמיתי קיים רק כטקסט חופשי ולא-מובנה — והציע להתאים את שיטות-גילוי-הדפוסים של KDD בדיוק למקרה הלא-מובנה הזה. בזמן הפרסום היו שני החוקרים קשורים לאוניברסיטת בר-אילן (פלדמן עבר לאוניברסיטה העברית בירושלים רק שנים רבות מאוחר יותר, בהמשך דרכו); שניהם המשיכו לפעול במחקר עיבוד-שפה בישראל שנים רבות אחר-כך — תרומה אקדמית ישראלית מוקדמת לתחום שהפך מאוחר יותר לענק מסחרי עולמי.

1999: הבחנה חשובה בין "כריית-טקסט" ל"אחזור-מידע"

כמה שנים אחר-כך, ב-1999, פרסמה מרטי הרסט (אוניברסיטת ברקלי) מאמר משפיע, "Untangling Text Data Mining", שקבע הבחנה שהתחום עדיין נשען עליה: אחזור-מידע (כמו מנוע-חיפוש) עוזר לאדם למצוא טקסט שכבר מכיל את המידע שהוא מחפש, בעוד כריית-טקסט אמיתית שואפת לחשוף דפוסים וקשרים שלא היו ידועים מראש ושאף מסמך בודד לא אומר במפורש — למשל, לשים-לב ששני מאמרים רפואיים, שאף אחד מהם לא מזכיר את השני, מרמזים יחד על אינטראקציה-תרופתית שאף אחד מהם לא מדווח עליה בנפרד. ההבחנה הזו — בין מציאת מה שכתוב במפורש לבין גילוי מה שמשתמע רק מצירוף של הרבה מסמכים — הפכה לדרך מקובלת להפריד בין שני תחומים קרובים אך שונים.

מרכיבים בתוך כריית-הטקסט: משימות-משנה מוכרות

בפועל, כריית-טקסט פחות היא טכניקה בודדת ויותר שם-מטרייה שמכסה כמה משימות-משנה ספציפיות יותר, שלכמה מהן יש ערך-משלהן באתר הזה: חילוץ-מידע (שליפת עובדות מובנות כמו שמות, תאריכים וקשרים מתוך טקסט חופשי, קרוב מאוד לזיהוי-ישויות); סיווג וקיבוץ מסמכים (מיון אוטומטי של מסמכים לפי נושא או סנטימנט); וסיכום-טקסט. מה שמאחד את כל אלה תחת שם-תחום אחד הוא המטרה המשותפת — הפיכת כמויות גדולות של טקסט לא-מובנה למידע מובנה וניתן-לניתוח — ולא איזה אלגוריתם בודד משותף.

יישומים: ביו-אינפורמטיקה, מודיעין-עסקי ופטנטים

כריית-טקסט מצאה כמה מהיישומים המסחריים והמדעיים המוקדמים הגדולים שלה מחוץ ל-NLP הכללי: בביו-אינפורמטיקה, שם היא משמשת לחילוץ אוטומטי של אזכורי-גנים, חלבונים והאינטראקציות ביניהם מתוך הכמות העצומה וההולכת-וגדלה של מאמרי-מחקר ביו-רפואיים, מהר יותר מכל צוות של קוראים אנושיים; במודיעין-עסקי, כריית דוא"ל-לקוחות, תמלולי-מוקד ופוסטים ברשתות-חברתיות לזיהוי תלונות חוזרות או מגמות מתפתחות; ובניתוח-פטנטים, שם חברות כורות בקנה-מידה גדול את בקשות-הפטנטים של מתחרים כדי לעקוב אחר מגמות-טכנולוגיה וסיכוני-הפרה פוטנציאליים.

כריית-טקסט בעידן ה-LLM

מודלי-שפה גדולים שינו משמעותית את ארגז-הכלים המעשי של כריית-הטקסט: משימות שדרשו בעבר בניית צינור-סטטיסטי ייעודי ואימונו עבור כל מטרת-חילוץ ספציפית אפשר כיום לעיתים קרובות לבצע רק בעזרת פרומפט מנוסח-היטב למודל-שפה כללי, לפחות עבור עבודה בקנה-מידה בינוני שאינה רגישה-לזמן. בקנה-מידה גדול מאוד — מיליוני מסמכים, תקציבי-זמן-תגובה או עלות מוגבלים — צינורות כריית-טקסט ייעודיים המבוססים על מודלים קטנים ומתמחים נשארים בדרך-כלל מעשיים יותר מהזרמת כל מסמך דרך מודל-ענק כללי, כך שהשיטות הסטטיסטיות והנוירוניות-הקלות הקלאסיות של התחום לא נעלמו, גם ככל שמודלי-שפה גדולים תופסים נתח גדל והולך מעבודת כריית-הטקסט האקספלורטיבית והקטנה-בקנה-מידה.

שאלות נפוצות ❓

מי טבע את המונח "כריית טקסט", ומתי?

רונן פלדמן וידו דגן, במאמר "Knowledge Discovery in Textual Databases", בקונפרנס ה-KDD הראשון ב-1995 — שניהם היו אז קשורים לאוניברסיטת בר-אילן.

מה ההבדל בין כריית-טקסט לאחזור-מידע (חיפוש)?

אחזור-מידע (כמו מנוע-חיפוש) עוזר למצוא מסמך שכבר מכיל את המידע שמחפשים; כריית-טקסט שואפת לחשוף דפוסים או קשרים שאף מסמך בודד לא אומר במפורש, אלא רק כאשר בוחנים הרבה מסמכים יחד.

אילו משימות-משנה נחשבות "כריית-טקסט"?

בין השאר חילוץ-מידע, זיהוי-ישויות, סיווג וקיבוץ מסמכים, וסיכום-טקסט — כריית-טקסט הוא שם-מטרייה למשימות האלה יחד, לא טכניקה בודדת אחת.

האם LLM כלליים החליפו את כלי כריית-הטקסט הקלאסיים?

חלקית — למשימות בקנה-מידה בינוני אפשר היום להשתמש בפרומפט ל-LLM כללי, אבל בקנה-מידה גדול מאוד (מיליוני מסמכים) צינורות ייעודיים עדיין יעילים ומעשיים יותר.