עמותה שהמדינה הקימה, לא סטארט-אפ
האיגוד הישראלי לטכנולוגיות שפת אנוש אינו חברה מסחרית אלא עמותה רשומה ללא-מטרות-רווח. רשות החדשנות ומשרד הדיגיטל הלאומי אישרו את הקמתו בספטמבר 2020, והקצו לו מימון של 7.5 מיליון שקלים לשלוש שנים. בין הגופים שהצטרפו אליו כבר בשלב ההקמה: רפאל, ג'ינג'ר סופטוור, מלינגו, אודיוקודס, אינטל, וואלה, ynet ובנק הפועלים. אביב זאבי, סמנכ"ל תשתית טכנולוגית ברשות החדשנות, הסביר אז שהאיגוד נועד לתת לתעשייה עצמה להוביל את הגדרת הצרכים ולסייע בסגירת פערים טכנולוגיים.
הבעיה שהובילה להקמה: עברית וערבית מקבלות שירות ירוד
בהודעה הרשמית על ההקמה נכתב שהאיגוד קם לאור "איכות נמוכה ובלתי מספקת של זיהוי השפות עברית וערבית במערכות ממוחשבות מסוגים שונים, בהשוואה לזיהוי הדיבור בשפות אחרות". ההסבר שניתן היה ששתי השפות שמיות ולכן מאתגרות יותר לניתוח ממוחשב. ההיגיון הכלכלי שמאחורי המבנה פשוט לא פחות: אף חברה בודדת אינה ממהרת לממן לבדה תשתית-יסוד שגם מתחרותיה ייהנו ממנה, ולכן הבנייה נעשית פעם אחת ובמשותף, במקום שכל אחת תחזור עליה בנפרד.
המשאבים הפתוחים: עצי-תחביר בעברית ובערבית
חלק מתוצרי הארגון מתפרסמים לציבור הרחב בחינם. שלושת המאגרים הפתוחים הם עץ-תחביר לעברית בת-זמננו ובו 5,000 משפטים שנדגמו מערכי ויקיפדיה בשבעה תחומי-תוכן — ובהם ביוגרפיה, אירועים, מקומות, בריאות, משפט ופיננסים; עץ-תחביר נוסף ובו 2,500 משפטים מפרוטוקולים של הכנסת; ומאגר מורפולוגיה לערבית ובו 2,000 משפטים. "עץ-תחביר" הוא אוסף משפטים שנותחו ידנית לפי המבנה הדקדוקי שלהם. לצד הנתונים עצמם משוחררים גם סקריפטים ומודלים מאומנים.
מודל-החברוּת: המאגרים הגדולים שמורים לחברי-האיגוד
לצד המשאבים הפתוחים פועל הארגון במודל מעורב: המאגרים הגדולים באמת נגישים רק לגופים שהצטרפו כחברים ומשתתפים בנטל. בהם עץ-תחביר לעברית ובו 48 אלף משפטים ממקורות מגוונים — חדשות, ויקיפדיה, פרוטוקולים ממשלתיים וחומרי-הסברה; קורפוסים לזיהוי ישויות-בעל-שם המשתרעים על יותר מ-123 אלף פסקאות בשתי השפות; מאגר מורפולוגיה ערבית רחב יותר; ותמלולי ערבית פלסטינית מדוברת בהיקף 93 אלף אסימונים, שנלקחו מקטעי וידאו.
קורפרנס וישויות-בעל-שם — ולמה זה משנה לכל כלי-AI בעברית
אחד המאגרים הפתוחים החדשים יותר עוסק בקורפרנס: הקישור בין אזכורים שונים באותו טקסט לאותו גורם עצמו, למשל בין שם פרטי, כינוי-גוף ותואר שכולם מתייחסים לאדם אחד. המאגר כולל 910 מסמכים, 28,141 אשכולות ו-121,067 אזכורים מסומנים. במקביל מפרסם הארגון מודלים לזיהוי ישויות-בעל-שם בעברית ובערבית באתר Hugging Face. חומרים כאלה הם חומר-הגלם שעליו מאמנים ואותו מודדים: בלעדיהם קשה אפילו לקבוע באופן אובייקטיבי עד כמה מודל נתון מבין עברית נכון, ולא רק מייצר טקסט שנשמע סביר.