מה זה, ומי בנה אותו
סמנטיק סקולר הוא כלי חיפוש ותגלית אקדמי חינמי, שהושק בפומבי ב-2 בנובמבר 2015 בידי Allen Institute for Artificial Intelligence (AI2) — המכון הבלתי-תלוי שהקים פול אלן (ראו הערך הנפרד Allen Institute for AI). במעמד ההשקה, בהובלת המנכ"ל דאז אורן עציוני (Oren Etzioni), כלל המנוע כשלושה מיליון מאמרים במדעי-המחשב בלבד, עם תוכנית-הרחבה הדרגתית לתחומים נוספים; היום הוא מכסה את כל תחומי-המדע. כפי שניסח עציוני בהודעת-ההשקה, "אף אחד לא מסוגל לעמוד בקצב הגידול-הנפיץ של הספרות המדעית... כעת חוקרים יכולים להתחיל לענות על השאלות האלה תוך שניות". לפי מאמר המתאר את תשתית-הנתונים הפתוחה של הפרויקט, נכון ל-2023 כלל הגרף למעלה מ-200 מיליון מאמרים, 80 מיליון מחברים ו-2.4 מיליארד קשרי-ציטוט — מה שהפרויקט מכנה "גרף-הספרות-המדעית הפתוח הגדול ביותר שנבנה עד כה".
גרף-הציטוטים: לא רק חיפוש-מילות-מפתח
בניגוד למנוע-חיפוש רגיל שמתבסס על התאמת-מילים, סמנטיק סקולר בונה גרף-קשרים מלא בין מאמרים, מחברים וציטוטים, על-ידי חילוץ אוטומטי של טקסט מובנה מתוך קובצי-PDF וזיהוי-ישויות באמצעות עיבוד-שפה-טבעית. הגרף הזה זמין גם דרך API פומבי וחינמי — Semantic Scholar Academic Graph (S2AG) — שמאפשר לחוקרים ולמפתחי-כלים אחרים (כמו Elicit, SciSpace ו-Consensus) לבנות מעליו שירותי-תגלית משלהם, בלי לבנות מאפס תשתית-חילוץ-ציטוטים.
TLDR: תקציר-משפט-אחד למאמר שלם
מאז 16 בנובמבר 2020 מציג סמנטיק סקולר תחת כל מאמר במדעי-המחשב (ומאז גם בביולוגיה וברפואה, עבור כמעט 60 מיליון מאמרים) תקציר-AI בן משפט אחד — TLDR — שנוצר במודל-שפה שאומן בשיטה בשם CATTS, המנצלת את כותרת-המאמר כאות-אימון נוסף כדי להתמודד עם המחסור בדוגמאות-תקציר מתויגות. לפי בדיקה של MIT Technology Review, המודל דוחס מאמר בן כ-5,000 מילה לתקציר בן כ-21 מילים בלבד — יחס-דחיסה של כ-238 ל-1, לעומת כ-36.5 ל-1 בשיטת-הדחיסה המובילה הבאה שנבדקה מולו — ובודקים אנושיים דירגו את התקצירים שלו כאינפורמטיביים ומדויקים יותר משיטות קודמות.
ציטוט מול "ציטוט משפיע": לא כל אזכור שווה
בעיה ידועה במדעומטריקה (Scientometrics) היא שספירת-ציטוטים גולמית מתייחסת אותו-הדבר לאזכור-אגב ולהמשך-מחקר של ממש. סמנטיק סקולר מפעיל מסווג מבוסס-למידת-מכונה שמסמן ציטוט כ"משפיע-מאוד" (Highly Influential) על-סמך האופן שבו הוא מופיע בטקסט המלא של המאמר המצטט — למשל אם הוא מוזכר לפחות שלוש פעמים במשפט שאין בו אזכור של עבודה אחרת, אם המשפט המצטט כולל ביטויים כמו "מבוסס על" או "בהשראת", או אם יש בו הפניה לטבלה או לאיור המשווים ישירות לעבודה המצוטטת. לפי ה-FAQ הרשמי של הכלי, הסיווג תלוי בגישה לטקסט המלא של המאמר המצטט — כך שמאמרים משפיעים-בפועל עלולים להישאר לא-מסומנים כאלה פשוט משום שהטקסט המלא שלהם אינו נגיש למנוע.
למה זה חשוב דווקא לניווט בספרות-המחקר של הבינה-המלאכותית
קצב-הפרסום בבינה מלאכותית — בעיקר דרך arXiv (ראו הערך הנפרד) ותרבות-ה-preprint — הפך זה-מכבר לבלתי-ניתן-למעקב ידני; אלפי מאמרים חדשים מתפרסמים מדי שבוע רק בתת-התחום של מודלי-שפה. הכלים של סמנטיק סקולר — Semantic Reader, שמציג כרטיסי-הקשר מוטמעים לכל ציטוט תוך כדי קריאה, ו-Research Feeds, מערכת-המלצות שלומדת מהספרייה האישית של החוקר — נבנו במפורש כדי להתמודד עם העומס הזה. סמנטיק סקולר הוא רק אחד ממוצרי-AI2, שגם בונה מודלי-שפה פתוחים משלה (ראו הערך הנפרד Allen Institute for AI); אבל בניגוד לאלה, הוא אינו מודל שמייצר תוכן חדש, אלא כלי-תשתית שמארגן ומדרג את מה שכבר פורסם.
מגבלות: לא מחליף ביקורת-עמיתים, ולא מכסה הכול
בניגוד ל-OpenReview (ראו הערך הנפרד), סמנטיק סקולר אינו כלי-ביקורת — הוא לא מבצע ביקורת-עמיתים ואינו מחליט מה מתקבל לכנס או לכתב-עת; הוא רק מארגן, מסכם ומדרג מאמרים שכבר פורסמו, בין אם עברו ביקורת-עמיתים ובין אם לא (למשל מאמרי-arXiv בטרם-ביקורת). איכות התקצירים והדירוג-לפי-השפעה משתנה בין תחומים ותלויה בזמינות-טקסט-מלא, וכלים מתחרים עדיין עדיפים לחלק מהמשתמשים בזכות כיסוי רחב-יותר של תחומים לא-מדעיים; אבל בניגוד לרוב המתחרים, סמנטיק סקולר חינמי ופתוח-API במלואו, ואינו מסתתר מאחורי חיץ-תשלום.