LoRA (התאמה-נמוכת-דרגה)
הגדרה
LoRA היא שיטה חסכונית לכוונון-עדין של מודל גדול — במקום לעדכן את כל מיליארדי הפרמטרים, מוסיפה רק "תוספת" קטנה ומאומנת, ומקפיאה את שאר המודל.
כוונון-עדין מלא דורש עדכון (ואחסון עותק) של כל פרמטרי המודל — יקר מאוד למודלים ענקיים. התאמה-נמוכת-דרגה (LoRA — Low-Rank Adaptation), שהוצגה במאמר של Microsoft מ-2021, מקפיאה את המודל המקורי לגמרי, ומוסיפה לו רק שכבות-קטנות-חדשות שמאומנות בנפרד.
הטריק המתמטי מאחורי השיטה: השכבות החדשות מיוצגות כמכפלה של שתי מטריצות קטנות במקום מטריצה גדולה אחת — כך שמספר הפרמטרים הנוספים לאימון קטן פי אלפים ממספר הפרמטרים המקוריים של המודל.
להמחשת סדר-הגודל: כוונון LoRA טיפוסי עשוי לאמן רק כמה מיליוני פרמטרים חדשים, לעומת עשרות או מאות מיליארדי הפרמטרים המקוריים של מודל-שפה גדול — יחס של פחות מ-1% מגודל המודל המקורי במקרים רבים. המשמעות המעשית: אפשר לשמור עותקי-LoRA קלים-משקל רבים (אחד לכל משימה ייעודית — שירות-לקוחות, כתיבה משפטית, כתיבת-קוד) לצד מודל-בסיס יחיד, במקום עותק שלם ויקר-אחסון של כל המודל עבור כל משימה בנפרד.
כך אפשר להתאים מודל ענק למשימה ספציפית תוך אימון (ואחסון) רק אחוז זעיר מהפרמטרים המקוריים — מה שהופך כוונון-עדין למעשי גם בלי משאבי-חישוב של חברת-ענק, ונכון ל-2026 הוא השיטה הנפוצה ביותר לכוונון מודלים בעלי-משקלים-פתוחים בקהילת הקוד-הפתוח.
שילוב פופולרי נוסף, QLoRA (2023), מוסיף כימות (ראו הערך) של המודל-המוקפא עצמו לתמונה — כך שאפשר לכוונן מודלים בני עשרות מיליארדי פרמטרים אפילו על כרטיס-מסך יחיד ברמת-צרכן, שילוב שהנגיש כוונון-מודלים-גדולים לקהל רחב בהרבה מבעבר, כולל חוקרים עצמאיים ומפתחים בודדים. עבור ארגונים גדולים, היתרון המעשי הנוסף הוא ניהול: אפשר לתחזק ספרייה שלמה של התאמות-LoRA ייעודיות, אחת לכל מוצר או לקוח, בלי להכפיל את עלות-האחסון של המודל הבסיסי בכל פעם מחדש.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות