קידוד מיקום (Positional Encoding)
הגדרה
קידוד מיקום הוא טכניקה שמוסיפה למודל מידע על סדר המילים במשפט — נחוץ כי מנגנון הקשב, בניגוד לקריאה אנושית, לא "יודע" מיקום מטבעו.
בעוד שרשת נשנית קוראת מילה-אחר-מילה וכך "יודעת" סדר באופן טבעי, מנגנון הקשב בטרנספורמר מעבד את כל המילים בבת אחת ומקבילית — ומאבד את המידע על מי הופיעה לפני מי.
קידוד-מיקום פותר את זה: מוסיף לכל מילה "חותמת" מספרית שמייצגת את מיקומה ברצף, כך שהמודל יכול להבחין בין "הכלב נשך את החתול" ל"החתול נשך את הכלב" — אותן מילים, סדר שונה, משמעות שונה. השיטה המקורית מ-2017 השתמשה בפונקציות גל קבועות-מראש; מאז פותחו גרסאות נוספות.
המשמעות המעשית בולטת בדוגמה הפוכה: בלי קידוד-מיקום כלשהו, המודל היה מתייחס ל"הכלב נשך את החתול" ול"החתול נשך את הכלב" כאילו הן קלט זהה לגמרי — אותן מילים, אותו "תיק" של קשב, בלי שום דרך להבחין מי-עשה-מה-למי. קידוד-המיקום הוא בדיוק מה שמונע את ההתבלבלות הזו.
גרסה מודרנית ופופולרית במיוחד, קידוד-מיקום סיבובי (RoPE — Rotary Position Encoding), הוצגה ב-2021 ואומצה על-ידי משפחות מודלים בעלי-משקלים-פתוחים בולטות, בהן Llama של Meta ומודלי Mistral. יתרונה המרכזי: הסתגלות טובה יותר לחלונות-הקשר הארוכים-מאוד שהפכו סטנדרט במודלי 2025-2026, לעומת מגבלות ידועות בשיטה המקורית מ-2017 כשהרצף ארוך במיוחד — נקודה שהפכה קריטית ככל שחלונות-ההקשר גדלו מאלפי טוקנים בודדים למיליוני טוקנים.
גישה חלופית, "הטמעות-מיקום נלמדות" (Learned Positional Embeddings), משמשת למשל ב-BERT — במקום נוסחה מתמטית קבועה-מראש, המודל לומד בעצמו, מתוך האימון, את הייצוג האופטימלי לכל מיקום. לכל גישה יתרונות וחסרונות: השיטה הנלמדת גמישה יותר בתוך טווח-האימון המקורי, אך מתקשה יותר להכליל למיקומים ארוכים מכל מה שראתה בפועל באימון — בעוד ששיטות מתמטיות קבועות-מראש כמו RoPE נועדו מלכתחילה להתמודד טוב יותר עם מיקומים שהמודל מעולם לא ראה בזמן האימון עצמו.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות