גרף ידע (Knowledge Graph)

יסודות בינה מלאכותית

הגדרה

גרף ידע (Knowledge Graph) הוא מבנה-נתונים שמייצג עובדות כרשת של "ישויות" (אנשים, מקומות, מושגים) המחוברות ביניהן בקשרים בעלי-משמעות, ומאפשר למערכות AI לחפש ולהסיק ביניהן.

גרף ידע (Knowledge Graph) הוא צורת-ייצוג של מידע כרשת: "ישויות" (Entities) — אנשים, מקומות, ארגונים, מושגים — מיוצגות כנקודות, והקשרים ביניהן מיוצגים כקווים מתויגים שנושאים משמעות משלהם, למשל "נולד ב-" או "מייסד של". השילוב הזה — ישות, קשר, ישות — נקרא "שלשה" (Triple), ואוסף גדול של שלשות כאלה בונה רשת ענקית של עובדות מקושרות. בניגוד לטקסט חופשי, שבו מחשב צריך "לנחש" מה משמעות המילים, גרף-ידע מציג עובדות בצורה מפורשת שקל למחשב לשאול עליה שאלות, ולעקוב אחרי שרשראות-היקש בין עובדות מרוחקות.

המונח "גרף ידע" נטבע כבר בשנות ה-70 של המאה ה-20 במחקר בלשני-חישובי מוקדם, אך נותר שולי יחסית עד שגוגל אימצה אותו ב-16 במאי 2012, בפוסט רשמי בבלוג שכותרתו "Introducing the Knowledge Graph: things, not strings" — הצהרה שסימנה מעבר של מנוע-החיפוש מהתאמת-מחרוזות-טקסט להבנת "דברים" אמיתיים שעומדים מאחורי החיפוש. הפוסט הזה הפך את המונח לנפוץ במיוחד בתעשייה, אף שלא כלל הגדרה טכנית פורמלית — ולמעשה, מאמר אקדמי מ-2016 ציין שלמונח עדיין אין הגדרה מוסכמת אחת בקהילת-המחקר, חרף השימוש הנרחב בו.

גרפי-ידע בנויים לרוב על גבי אונטולוגיה — הגדרה פורמלית מראש של אילו סוגי-ישויות ואילו סוגי-קשרים מותרים ברשת, כדי לשמור על עקביות בין כל הנתונים שמתווספים אליה עם הזמן. הם דוגמה מעשית מרכזית לתחום הרחב יותר של ייצוג ידע, אבל בניגוד לשיטות סימבוליות ישנות יותר שנבנו בעיקר ביד, גרפי-ידע מודרניים בקנה-המידה של גוגל או ויקיפדיה מכילים כמות עצומה של שלשות, ומעודכנים ברציפות מתוך מקורות רבים ומגוונים — לא נבנים פעם אחת בלבד על ידי מומחה-תחום יחיד, אלא נשענים גם על חילוץ-מידע אוטומטי מטקסטים חופשיים.

בעידן מודלי-השפה הגדולים, גרפי-ידע חוזרים לתשומת-לב כתשלים למגבלות של אחזור-מוגבר-בייצור (RAG) המבוסס-וקטורים בלבד: RAG וקטורי מוצא קטעי-טקסט הדומים סמנטית לשאלה, אבל מתקשה בשאלות שדורשות שרשור כמה עובדות יחד כדי להגיע לתשובה. גישה המכונה GraphRAG, שפיתחה מיקרוסופט ופרסמה ב-2024, משלבת גרף-ידע לתוך תהליך ה-RAG כדי לענות על שאלות מורכבות יותר, שדורשות מעקב אחרי כמה קשרים ברצף — למשל "מי עבד עם מי, ובאיזה פרויקט" — לא רק חיפוש-דמיון פשוט בין משפט לשאלה. השילוב הזה ממחיש איך שני עולמות שנראו נפרדים — ייצוג-ידע סימבולי ותיק ומודלי-שפה סטטיסטיים חדשים — מתחילים להשלים זה את זה במקום להחליף זה את זה.