השפעת מודלי-שפה על השפה האנושית (LLM Influence on Human Language)

AI בחברה

הגדרה

תופעה שנמדדה במאגרי טקסט ודיבור גדולים: מילים וסגנון האופייניים למודלי שפה מופיעים בשכיחות גוברת בכתיבה ובדיבור של בני אדם.

איך בכלל מודדים דבר כזה

אי אפשר לשאול טקסט אם נכתב בעזרת מודל שפה, אבל אפשר לספור מילים. חוקרים סרקו יותר מחמישה עשר מיליון תקצירים של מאמרים רפואיים ממאגר PubMed מן השנים 2010 עד 2024, וחיפשו מילים שהשכיחות שלהן קפצה בבת אחת. השיטה הזאת, שכונתה "אוצר מילים עודף", איתרה זינוק חד בשכיחותן של מילות סגנון מסוימות — שינוי גדול יותר מזה שחולל אירוע כמו מגפת הקורונה בכתיבה המדעית.

המספרים שהתקבלו

לפי אותו מחקר, שהתפרסם בכתב העת Science Advances ביולי 2025, לפחות 13.5 אחוזים מן התקצירים משנת 2024 עברו עיבוד בעזרת מודל שפה. השיעור נבדל בין תחומים, מדינות וכתבי עת, ובחלק מן המאגרים הגיע ל-40 אחוזים. מחקר אחר, שבחן 950,965 מאמרים שפורסמו בין ינואר 2020 לפברואר 2024, מצא סימנים לתוכן שעבר עיבוד כזה בעד 17.5 אחוזים ממאמרי מדעי המחשב, ובעד 6.3 אחוזים ממאמרי המתמטיקה ומכתבי העת של קבוצת Nature.

לא רק בכתיבה — גם בדיבור

התופעה אינה מוגבלת לטקסט ערוך. טיוטת-מחקר שפורסמה ב-2024 ב-arXiv, וטרם עברה שיפוט עמיתים, בחנה 737,083 שעות של שיחה מתוך 824,634 פרקי פודקאסט, וסיננה מהם דיבור לא מתוכנן. מילים שמודלי שפה נוטים להעדיף — ובהן delve (להעמיק), showcase (להציג לראווה), boast (להתהדר), intricacies (דקויות) ו-meticulous (קפדני) — עלו בשכיחותן בדיבור ספונטני, ועלייתן נקשרה בניתוח סטטיסטי למועד השקתו של ChatGPT. במילים אחרות, לא רק מה שאנשים מקלידים השתנה, אלא גם מה שהם אומרים בקול. שני המחקרים האחרים שהערך נשען עליהם פורסמו בכתב-העת Science Advances ועברו שיפוט עמיתים; זה לא.

ניסוי שמראה איך המילה עוברת

מדידה במאגר גדול מראה מתאם, לא סיבה. כדי לבדוק את הקשר עצמו ערכו החוקרים ניסוי מתוכנן מראש עם 496 משתתפים, ובו נמצא ששיחה קצרה עם צ'אטבוט הספיקה כדי שהמשתתפים יאמצו את המילים שלו כשלהם — והשימוש בהן שרד גם אחרי משימה מסיחה שהופרדה מן השיחה. עם זאת, כל המדידות האלה הן אומדנים על מאגר שלם, ולא הכרעה על טקסט בודד: אי אפשר להסיק מהן שמאמר מסוים נכתב במכונה.

למה זה נוגע לשפות קטנות, ולעברית

החוקרים עצמם מציינים חשש שאינו טכני אלא תרבותי: אם בני אדם מפנימים את דפוסי הלשון של מודלים, השפה עלולה להיעשות אחידה יותר, והשפעה תרבותית נרחבת מתרכזת בידי מספר קטן של ספקים. המדידות שנסקרו כאן נערכו על מאגרים ענקיים — מיליוני תקצירים מדעיים ומאות אלפי פרקי פודקאסט — ואף אחת מהן לא בחנה את העברית, ולכן השאלה אם התהליך מתרחש גם בה נותרת פתוחה. מה שידוע הוא שהמצע שונה: מצבן של שפות שנוכחותן ברשת דלה מול כלי הבינה המלאכותית, ומה זה עושה לאיכות הכלים שהן מקבלות, נדון בערך הפער הלשוני הדיגיטלי. אם ובאיזו מידה עוברת ההשפעה גם לכיוון ההפוך — מן הכלים אל הדוברים — היא שאלה פתוחה לגבי העברית.

שאלות נפוצות ❓

איך אפשר לדעת שמודלי שפה משפיעים על השפה שלנו?

בשיטת "אוצר מילים עודף": סופרים את שכיחותן של מילים במאגרים ענקיים לאורך שנים ומחפשים קפיצות פתאומיות. בתקצירים רפואיים ממאגר PubMed נמצא זינוק חד בשכיחותן של מילות סגנון מסוימות, גדול מזה שחוללה מגפת הקורונה.

כמה מן הכתיבה המדעית נכתבת היום בעזרת מודל שפה?

לפי מחקר שפורסם ב-Science Advances ביולי 2025, לפחות 13.5 אחוזים מתקצירי 2024 שנבדקו עברו עיבוד כזה, ובחלק מן המאגרים עד 40 אחוזים. מחקר אחר מצא עד 17.5 אחוזים במאמרי מדעי המחשב.

האם זה נוגע גם לדיבור, לא רק לכתיבה?

כן, לפי טיוטת-מחקר מ-2024 שטרם עברה שיפוט עמיתים. היא בחנה 737,083 שעות שיחה מתוך 824,634 פרקי פודקאסט ומצאה עלייה בשכיחותן של מילים שמודלים נוטים להעדיף, ובהן delve ו-meticulous, גם בדיבור לא מתוכנן.

האם אפשר לזהות שטקסט מסוים נכתב בעזרת מודל?

לא מן המחקרים האלה. הם מודדים שכיחות מילים על פני מאגר שלם ומספקים אומדן סטטיסטי, ולא הכרעה על טקסט בודד. מסקנה על מאמר אחד אינה נגזרת מהם.