למה עברית צריכה מבחנים משלה
הערכת מודלי שפה בעברית היא התחום שעוסק בשאלה איך בודקים, באופן שאפשר לחזור עליו, עד כמה מודל שפה מבין עברית ומייצר אותה. הבעיה שבגללה התחום קיים מתוארת בפוסט של Hugging Face ממאי 2024, שהשיק את לוח ההשוואה הפתוח למודלי שפה בעברית: עברית נחשבת שפה דלת-משאבים, ולוחות ההשוואה הקיימים חסרים מבחנים שמשקפים את תכונותיה. עברית היא שפה עשירה מורפולוגית — מילים נבנות משורשים ומתבניות, עם תחיליות, סופיות ותוספות באמצע המילה — ולכן משורש אחד נגזרות צורות תקינות רבות. לפי אותו פוסט, שיטות טוקניזציה שתוכננו לשפות פשוטות יותר מבחינה מורפולוגית פחות יעילות בעברית, ומודלים קיימים עלולים להתקשות בדקויות שלה. גם מאמר HeQ משנת 2023 מצביע על פער: מבחני עיבוד השפה הקיימים בעברית התמקדו בעיקר במשימות מורפו-תחביריות, כמו פירוק מילה לרכיביה, והזניחו את הממד הסמנטי — השאלה אם המודל הבין את המשמעות.
לוח ההשוואה הפתוח: ארבע משימות
לוח ההשוואה הפתוח למודלי שפה בעברית (Hebrew LLM Leaderboard) הושק ב-5 במאי 2024 ב-Hugging Face, בחסות מפא"ת במשרד הביטחון והתוכנית הלאומית לעיבוד שפה בעברית ובערבית, בשיתוף דיקטה ו-Webiks, ובייעוץ מדעי של פרופ' רעות צרפתי מאוניברסיטת בר-אילן. הלוח בודק ארבע משימות: מענה על שאלות מתוך טקסט, על בסיס חלק המבחן של מערך HeQ; זיהוי סנטימנט — חיובי, שלילי או ניטרלי; פתרון כינויי גוף במשפטים דו-משמעיים, על בסיס תרגום לעברית של מבחן וינוגרד (Winograd Schema Challenge) מאת ד"ר ורד שוורץ; ותרגום בין אנגלית לעברית, על בסיס קורפוס מקביל של הרצאות TED. המבחנים מוצגים למודל במתכונת של כמה דוגמאות פתורות בתוך ההנחיה (Few-shot), מודלים שמוגשים ללוח נפרסים אוטומטית, וההרצה מנוהלת בספריית lighteval. לפי מאמר DictaLM 2.0, חלק המבחן של HeQ שבו משתמשים כולל 1,436 פריטים, ומבחן הסנטימנט נשען על 3,000 משפטים שבחרה בלשנית מקצועית מתוך מערך רחב יותר, משום שרבים מהמשפטים בו היו דו-משמעיים. בבדיקה ב-27.9.2026 הלוח עדיין הופיע כפעיל ב-Hugging Face.
HeQ: כשגם מדד הציון צריך להשתנות
HeQ הוא מערך הבנת הנקרא בעברית שפורסם בדצמבר 2023 בקובץ Findings of EMNLP 2023, מאת עמיר כהן, הילה מרחב, יואב גולדברג ורעות צרפתי. הוא כולל 30,147 זוגות של שאלה ותשובה שנגזרו מערכים בוויקיפדיה העברית ומכתבות חדשות טכנולוגיה ישראליות. הממצא המעניין בו אינו רק הנתונים אלא המדידה עצמה: לפי המחברים, בגלל המורפולוגיה של העברית הגבולות של תשובה בתוך הטקסט אינם חד-משמעיים — וזה יוצר חוסר עקביות בתיוג ומחלוקות בין מתייגים. המחברים מראים שמדדי הציון המקובלים באנגלית, F1 והתאמה מדויקת (Exact Match), אינם מתאימים לעברית ולשפות עשירות מורפולוגית אחרות, ומציעים מדד משופר. ממצא נוסף שלהם: המתאם בין ביצועי מודלים במשימות מורפו-תחביריות לבין ביצועיהם בהבנת הנקרא נמוך, כלומר מודל שמצטיין בניתוח מילים עלול לא להצטיין בהבנת משמעות. לכן ציון של מודל על HeQ תלוי גם באיזה מדד חושב.
מעבר לבחירה מרובה: סיכום, תרגום ושופט אנושי
חלק מהיכולות שמעניינות משתמשים — סיכום מסמך, ניסוח תשובה חופשית — קשות למדידה אוטומטית. מאמר DictaLM 2.0 מ-2024, שבו הציגה דיקטה את מודל השפה העברי שלה, מדגים שלוש שיטות שונות זו לצד זו. הראשונה היא הערכה אוטומטית במתכונת Few-shot על מבחנים שנאספו ונבדקו בידי אדם — אותן ארבע משימות של לוח ההשוואה. השנייה היא שיפוט אנושי עיוור: מעריכים קיבלו 1,000 משפטים שתורגמו מאנגלית לעברית, פעם בידי המודל ופעם בידי Google Translate, בלי לדעת מי תרגם מה, ובחרו את התרגום הטוב יותר. השלישית היא שימוש במודל אחר כשופט: 75 כתבות חדשות בעברית עם סיכומים שכתבו בני אדם, סוכמו בידי כמה מודלים, ו-GPT-4 דירג את הסיכומים. יש לשים לב שאלה תוצאות שפרסם מפתח המודל על המודל שלו. מערך נפרד, HeSum, נבנה במיוחד לסיכום מופשט בעברית: 10,000 זוגות של כתבה וסיכום מאתרי חדשות עבריים, שנכתבו בידי אנשי מקצוע. לפי מחבריו, מודלי שפה מתקדמים נתקלים בו בקשיים ייחודיים, בין השאר בגלל המורפולוגיה של העברית.
טוקניזציה: אותו טקסט, מחיר אחר
חלק מהפער בין עברית לאנגלית נוצר עוד לפני שהמודל עונה, בשלב הטוקניזציה — פירוק הטקסט ליחידות שהמודל מעבד. מחקר של אלכסנדר פטרוב ושותפיו, שהוצג ב-NeurIPS 2023, הראה שאותו טקסט, מתורגם לשפות שונות, עשוי להתפרק למספר טוקנים שונה מאוד — בחלק מהמקרים פער של עד פי 15. לפי המחברים, הפער הזה פוגע בדוברי חלק מהשפות בשלושה אופנים: בעלות השימוש בשירותים מסחריים, שמתומחרים לפי טוקן; בזמן העיבוד ובזמן התגובה; ובכמות התוכן שאפשר להכניס להקשר של המודל. מאמר DictaLM 2.0 מביא דוגמה עברית: הטוקנייזר של Mistral, שעליו נבנה המודל, פירק מילה עברית ל-5.81 טוקנים בממוצע, כלומר בערך טוקן לכל אות. הוספה של 1,000 טוקנים ייעודיים לעברית הקטינה את היחס ביותר ממחצית, ומעבר לכך התועלת מכל תוספת פחתה בחדות. המשמעות להערכה: השוואה בין מודלים בעברית צריכה למדוד גם כמה טוקנים צורכת המשימה בעברית, ולא רק אם התשובה נכונה.
תרגום מבחנים והטיה תרבותית
דרך מקובלת להעריך מודלים בשפות רבות היא לתרגם מבחן אנגלי מוכר, כמו MMLU. המחקר שהציג את Global MMLU, מערך של Cohere Labs, מראה את מגבלות הדרך הזו: לפי מחבריו, 28% משאלות MMLU דורשות ידע רגיש-תרבותית, ומתוך השאלות שדורשות ידע גאוגרפי, 84.9% עוסקות בצפון אמריקה או באירופה. דירוג המודלים משתנה כשמודדים אותם רק על השאלות הרגישות-תרבותית, ולכן הסתמכות עיוורת על MMLU מתורגם מעוותת את התמונה. Global MMLU מכסה 42 שפות, ובהן עברית, שמסווגת בו כשפה בינונית-משאבים. לפי כרטיס מערך הנתונים, הוא משלב תרגום מכונה עם תרגומים מקצועיים ותיקונים של מתנדבים, ובכל שפה מסומנות 2,850 שאלות כרגישות-תרבותית או כבלתי-תלויות-תרבות. גם יצרנים מודים בהטיה הזו: בתיעוד של AI21, משפחת Jamba, שאליה שייכת גם Jamba2, תומכת רשמית בתשע שפות ובהן עברית, אך באותו עמוד, תחת הכותרת "הטיה מערבית ואנגלית", נכתב שהמודלים אומנו בעיקר על טקסט באנגלית מהאינטרנט ומתאימים ביותר לעיבוד טקסט באנגלית.
איך לקרוא ציון בעברית
מהמקורות האלה עולות כמה שאלות שכדאי לשאול על כל טענה שמודל "טוב בעברית". על איזה מערך נבדק המודל, ובאיזו גרסה — HeQ, מבחן מתורגם או מבחן פנימי של החברה? באיזה מדד חושב הציון, בהתחשב בכך שמחברי HeQ הראו שהמדדים האנגליים הרגילים אינם מתאימים לעברית? מי הריץ את הבדיקה — המפתח על המודל שלו, כמו בתוצאות של DictaLM 2.0, או גוף חיצוני? מתי היא נערכה, ועל איזו גרסה של המודל? והאם השאלות היו עלולות להופיע בנתוני האימון, בעיה שנדונה בערך זיהום אמות-מידה? גם "תמיכה רשמית בעברית" ברשימת השפות של יצרן איננה מדידה של איכות. יוזמי לוח ההשוואה העברי כתבו שהם מקווים שהלוח יעודד את הקהילה הטכנולוגית בישראל לזהות ולסגור פערים בטכנולוגיית השפה העברית, ולא ישמש רק כלי דירוג. ולמי שבוחר מודל למשימה מסוימת, מדריכי הבחירה של היצרנים עצמם, המתוארים בערך בחירת מודל למשימה, ממליצים לבדוק מודלים על דוגמאות אמיתיות מהמשימה ולא להסתפק במבחן כללי.