דלג לתוכן

קידוד מיקום (Positional Encoding)

מודלים ושפה

הגדרה

קידוד מיקום הוא טכניקה שמוסיפה למודל מידע על סדר המילים במשפט — נחוץ כי מנגנון הקשב, בניגוד לקריאה אנושית, לא "יודע" מיקום מטבעו.

בעוד שרשת נשנית קוראת מילה-אחר-מילה וכך "יודעת" סדר באופן טבעי, מנגנון הקשב בטרנספורמר מעבד את כל המילים בבת אחת ומקבילית — ומאבד את המידע על מי הופיעה לפני מי.

קידוד-מיקום פותר את זה: מוסיף לכל מילה "חותמת" מספרית שמייצגת את מיקומה ברצף, כך שהמודל יכול להבחין בין "הכלב נשך את החתול" ל"החתול נשך את הכלב" — אותן מילים, סדר שונה, משמעות שונה. השיטה המקורית מ-2017 השתמשה בפונקציות גל קבועות-מראש; מאז פותחו גרסאות נוספות.

המשמעות המעשית בולטת בדוגמה הפוכה: בלי קידוד-מיקום כלשהו, המודל היה מתייחס ל"הכלב נשך את החתול" ול"החתול נשך את הכלב" כאילו הן קלט זהה לגמרי — אותן מילים, אותו "תיק" של קשב, בלי שום דרך להבחין מי-עשה-מה-למי. קידוד-המיקום הוא בדיוק מה שמונע את ההתבלבלות הזו.

גרסה מודרנית ופופולרית במיוחד, קידוד-מיקום סיבובי (RoPE — Rotary Position Encoding), הוצגה ב-2021 ואומצה על-ידי משפחות מודלים בעלי-משקלים-פתוחים בולטות, בהן Llama של Meta ומודלי Mistral. יתרונה המרכזי: הסתגלות טובה יותר לחלונות-הקשר הארוכים-מאוד שהפכו סטנדרט במודלי 2025-2026, לעומת מגבלות ידועות בשיטה המקורית מ-2017 כשהרצף ארוך במיוחד — נקודה שהפכה קריטית ככל שחלונות-ההקשר גדלו מאלפי טוקנים בודדים למיליוני טוקנים.

גישה חלופית, "הטמעות-מיקום נלמדות" (Learned Positional Embeddings), משמשת למשל ב-BERT — במקום נוסחה מתמטית קבועה-מראש, המודל לומד בעצמו, מתוך האימון, את הייצוג האופטימלי לכל מיקום. לכל גישה יתרונות וחסרונות: השיטה הנלמדת גמישה יותר בתוך טווח-האימון המקורי, אך מתקשה יותר להכליל למיקומים ארוכים מכל מה שראתה בפועל באימון — בעוד ששיטות מתמטיות קבועות-מראש כמו RoPE נועדו מלכתחילה להתמודד טוב יותר עם מיקומים שהמודל מעולם לא ראה בזמן האימון עצמו.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו