WordNet — מאגר מילים באנגלית שמקשר בין משמעויות, מאוניברסיטת פרינסטון
הגדרה
WordNet הוא מאגר מילוני ממוחשב של השפה האנגלית, שנולד ב-1985 באוניברסיטת פרינסטון: הוא מקבץ מילים נרדפות לקבוצות של משמעות אחת ומקשר ביניהן בקשרים כמו "סוג של" ו"חלק של" — ומשמש בעיקר לניתוח טקסט אוטומטי ולבינה מלאכותית.
💡 דוגמה
המילה dog באנגלית היא בדרך כלל כלב, אבל לפעמים גם נקניקייה.
ב-WordNet כל משמעות יושבת בקבוצה נפרדת, עם הגדרה משלה — וכך תוכנה מקבלת את כל המשמעויות האפשריות, ואלגוריתם נוסף נעזר בהקשר כדי לבחור ביניהן.
מילון שבנוי כמו רשת
WordNet הוא מאגר מילים ממוחשב של השפה האנגלית. במקום לסדר מילים לפי האלף-בית, כמו במילון, הוא מקבץ שמות עצם, פעלים, תארים ותארי פועל לקבוצות של מילים נרדפות, שכל אחת מהן מבטאת מושג אחד. הקבוצות האלה נקראות synsets (קיצור של "קבוצות נרדפים"), ולכל אחת יש הגדרה קצרה, ולרוב גם משפט לדוגמה. לפי אתר הפרויקט באוניברסיטת פרינסטון, יש במאגר 117 אלף קבוצות כאלה, והן מחוברות זו לזו בקשרים של משמעות. התוצאה היא רשת שאפשר לטייל בה: מכל מושג אפשר לעבור למושג רחב יותר, צר יותר או קשור. לפי ויקיפדיה, הפרויקט החל ב-1985 במעבדה למדעי הקוגניציה בפרינסטון, בהובלת הפסיכולוג ג'ורג' מילר, ובהמשך הובילה אותו כריסטיאן פלבאום. הוא מומן תחילה על ידי המשרד למחקר ימי של ארצות הברית (ONR), ובהמשך גם על ידי סוכנויות ממשלתיות אחרות, כמו DARPA והקרן הלאומית למדע. המאגר והכלים שלו חינמיים להורדה.
איך זה עובד: "סוג של", "חלק של" ו"הפך של"
הקשר החשוב ביותר ב-WordNet הוא "סוג של". לפי אתר הפרויקט, הוא מוביל מקבוצה כללית כמו "רהיט" אל "מיטה", ומשם אל "מיטת קומותיים". הקשר הזה עובר הלאה: אם כורסה היא סוג של כיסא וכיסא הוא סוג של רהיט, אז כורסה היא סוג של רהיט. כל ההיררכיות של שמות העצם מגיעות בסוף לשורש אחד: "ישות". המאגר גם מבחין בין סוג לבין פרט מסוים, כך שכורסה היא סוג של כיסא, אבל ברק אובמה הוא מקרה פרטי של נשיא. קשר אחר הוא "חלק של": לכיסא יש משענת, מושב ורגליים, וגם כורסה, שהיא סוג של כיסא, יורשת את הרגליים. בפעלים, WordNet מסדר דרגות של אופן, כמו "לתקשר", "לדבר" ו"ללחוש", ומסמן פעלים שאחד גורר את השני: מי שקונה בהכרח משלם, אבל מי שמשלם לא בהכרח קונה. תארים מאורגנים סביב זוגות של הפכים, כמו "רטוב" ו"יבש", ולכל קוטב מחוברות מילים דומות. כך נראית ההפרדה בין משמעויות בפועל: בספריית NLTK, החיפוש של המילה dog מחזיר, לצד הכלב, גם משמעויות כמו נקניקייה, אדם בזוי ואפילו הפועל "לרדוף".
השורשים בפסיכולוגיה של הזיכרון
WordNet לא נולד כפרויקט של בינה מלאכותית אלא של מדעי הקוגניציה. לפי ויקיפדיה, המטרה הראשונה הייתה לבנות מאגר שמתאים לתיאוריות על הזיכרון הסמנטי של בני אדם, שפותחו בסוף שנות ה-60. בניסויים מאותה תקופה, ששיטותיהם והתיאוריה שמאחוריהם זכו גם לביקורת, נמצא שאנשים מאמתים מהר יותר שכנרית יכולה לשיר, כי כנרית היא ציפור שיר, מאשר שכנרית יכולה לעוף, תכונה שנמצאת ברמה הכללית יותר של "ציפור". הרעיון של מושגים שמסודרים בשכבות, מהכללי אל הפרטי, הוא בדיוק המבנה של WordNet. מילר תיאר את המאגר במאמר שפרסם ב-1995 בכתב העת Communications of the ACM, ובשנת 2006 קיבלו הוא ופלבאום את פרס אנטוניו זמפולי על עבודתם על WordNet. אתר הפרויקט מדגיש את ההבדל מתזאורוס: לפי האתר, בתזאורוס הקיבוץ אינו עוקב אחרי דפוס מפורש מלבד דמיון במשמעות, ואילו WordNet מקשר בין משמעויות מסוימות של מילים, ומסמן במפורש איזה סוג של קשר יש ביניהן.
כלי עבודה של עיבוד השפה
לפי ויקיפדיה, השימוש העיקרי ב-WordNet הוא בניתוח טקסט אוטומטי ובבינה מלאכותית. הוא שימש לזיהוי המשמעות הנכונה של מילה בהקשר, לאחזור מידע, לסיווג טקסטים, לסיכום אוטומטי ולתרגום מכונה. לפי ויקיפדיה, הוא משאב נפוץ במיוחד למשימה הזאת. שימוש נפוץ אחר הוא מדידה של הדמיון בין מילים: אחת השיטות סופרת כמה צעדים צריך לעשות ברשת כדי לעבור ממשמעות אחת לאחרת, מתוך הנחה שככל ששתי משמעויות קרובות יותר ברשת, כך הן קרובות יותר במשמעות. שיטות כאלה זמינות, למשל, בספריית NLTK לשפת Python. WordNet נבנה בידי בני אדם, משמעות אחר משמעות. בניגוד לו, שיטות מבוססות למידה, כמו word2vec, לומדות ייצוגים של מילים מתוך כמויות גדולות של טקסט. הערך על עיבוד שפה טבעית מסביר את התחום כולו.
השלד של ImageNet
שימוש בולט ב-WordNet מחוץ לעולם הטקסט הוא ImageNet, בתחום הראייה הממוחשבת. במאמר מ-2009 שבו הוצג ImageNet, תיארו פיי-פיי לי ועמיתיה מפרינסטון את המאגר החדש כמערך תמונות שנבנה על השלד של WordNet. לפי המאמר, יש ב-WordNet כ-80 אלף קבוצות של שמות עצם, והמטרה הייתה לאכלס את רובן בתמונות, בממוצע 500 עד 1,000 תמונות לקבוצה. כך ירש ImageNet את ההיררכיה של WordNet: כל קטגוריה של תמונות היא מושג מתוך רשת המילים. המאגר הזה הפך מאוחר יותר לזירה שבה הוכח כוחה של הלמידה העמוקה, כפי שמסופר בערך על ImageNet. אבל הירושה הזאת כללה גם בעיות. במחקר מ-2019 על קטגוריות האנשים ב-ImageNet מנו החוקרים שלושה גורמים שעלולים לגרום להתנהגות בעייתית של מערכות ראייה ממוחשבת, והראשון שבהם הוא אוצר המושגים הקפוא של WordNet.
המגבלות
לפי ויקיפדיה, המגבלה שנדונה הכי הרבה היא שהקשרים של WordNet מתאימים יותר למושגים מוחשיים מאשר למופשטים: קל לקבוע שעץ מחט הוא סוג של עץ ועץ הוא סוג של צמח, אבל קשה לסדר כך רגשות כמו פחד או אושר. ביקורת נוספת היא שהמאגר מבחין בין משמעויות בצורה דקה מדי, וזה מקשה על מערכות לבחור את המשמעות הנכונה, בדיוק כמו שבני אדם לא תמיד מסכימים ביניהם במשימה כזאת. WordNet גם לא כולל מידע על מקור המילים או על ההגייה שלהן, ומכסה בעיקר מילים יומיומיות ולא מונחים מקצועיים. יש מי שמכנים אותו אונטולוגיה, אבל לפי ויקיפדיה זו טענה שיוצריו עצמם לא טוענים, ושימוש בו כאונטולוגיה דורש תיקונים. הוא גם כולל מילים פוגעניות, ומי שמשתמש בו צריך לזהות אותן בעצמו.
אחרי פרינסטון: גרסה פתוחה וגרסה עברית
נכון לסוף ספטמבר 2026, אתר הפרויקט בפרינסטון מודיע ש-WordNet של פרינסטון כבר לא מפותח, אבל המאגר וכל הכלים עדיין זמינים להורדה. לפי האתר, בגלל מחסור בכוח אדם אין תוכניות לגרסאות נוספות. האתר מפנה לשני גופים קהילתיים שממשיכים את העבודה: Open English Wordnet, גרסה פתוחה שנגזרה מ-WordNet של פרינסטון ומתפרסמת ברישיון CC BY 4.0, ומונה לפי האתר שלה, בבדיקה ב-4 באוקטובר 2026, 120,068 קבוצות; והאגודה הבינלאומית Global WordNet Association, שמחברת בין מאגרים כאלה בשפות רבות. אחד מהם נבנה בישראל: באוניברסיטת חיפה בנו נועם אורדן, איריס איל, מרגלית זבלודובסקי ושולי וינטנר WordNet לעברית, שמקושר ל-WordNet האנגלי, בשיתוף צוות ממכון מחקר בטרנטו שבאיטליה ובמימון משרד המדע.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| תזאורוס | WordNet | |
|---|---|---|
| מה מקושר | צורות של מילים | משמעויות מסוימות של מילים |
| מילה עם כמה משמעויות | אין הפרדה מפורשת בין המשמעויות | כל משמעות נמצאת בקבוצה נפרדת |
| סוג הקשר בין מילים | אין דפוס מפורש מלבד דמיון במשמעות | מסומן: סוג של, חלק של, הפך של ועוד |
שאלות נפוצות ❓
מה זה synset?
קבוצה של מילים נרדפות שמבטאות מושג אחד, עם הגדרה קצרה ולרוב גם משפט לדוגמה. מילה שיש לה כמה משמעויות מופיעה בכמה קבוצות כאלה, אחת לכל משמעות.
מי יצר את WordNet ומתי?
הפרויקט החל ב-1985 במעבדה למדעי הקוגניציה באוניברסיטת פרינסטון, בהובלת הפסיכולוג ג'ורג' מילר, ובהמשך הובילה אותו כריסטיאן פלבאום.
מה הקשר בין WordNet ל-ImageNet?
ImageNet נבנה על השלד של WordNet: כל קטגוריה של תמונות בו היא מושג מתוך רשת המילים, והמטרה המקורית הייתה למלא את רוב קבוצות שמות העצם של WordNet בתמונות.
האם WordNet עדיין מתעדכן?
WordNet של פרינסטון כבר לא מפותח, אבל הוא זמין להורדה. גרסה קהילתית פתוחה, Open English Wordnet, ממשיכה להתעדכן.
יש WordNet בעברית?
כן. חוקרים מאוניברסיטת חיפה בנו WordNet עברי שמקושר ל-WordNet האנגלי, בשיתוף צוות מטרנטו שבאיטליה.