דלג לתוכן

בינה מלאכותית חוקתית (Constitutional AI)

מודלים ושפה

הגדרה

בינה מלאכותית חוקתית היא שיטת אימון שבה המודל עצמו מבקר ומתקן את תשובותיו לפי סט עקרונות כתובים ("חוקה") — פחות תלויה בדירוג אנושי ידני מאשר RLHF רגיל.

תרשים זרימה של ארבעה כרטיסים מימין לשמאל עם חצים כתומים שמאלה, עם אייקונים של זכוכית מגדלת ועיפרון; האחרון מודגש במסגרת כחולה. מעליהם כרטיס מסמך עם אייקון מגילה, שממנו חץ כתום מקווקו יורד לכרטיס הביקורת; למטה פס הערה. הטקסט בתמונה: בינה מלאכותית חוקתית (Constitutional AI) | החוקה | עקרונות כתובים, למשל: היה מועיל, אך אל תסייע לפגיעה | המודל עונה | המודל מבקר את תשובתו מול החוקה | המודל מתקן את התשובה | אימון מחדש על הגרסאות המתוקנות | פחות תלות בדירוג אנושי ידני, והעקרונות גלויים לבחינה ציבורית
בבינה מלאכותית חוקתית המודל מבקר את תשובותיו מול רשימת עקרונות כתובים ("חוקה"), מתקן אותן, ואז מאמנים אותו מחדש על הגרסאות המתוקנות. כך יש פחות תלות בדירוג אנושי ידני, והעקרונות גלויים לבחינה ציבורית.תרשים מקורי של Wiki-AI · לחצו על התרשים להגדלה

במקום להסתמך רק על אנשים שמדרגים תשובות, מודל מאומן לבחון את התשובות שלו-עצמו מול רשימת עקרונות מוגדרים מראש (כמו "היה מועיל, אך אל תסייע לפגיעה"), ולתקן אותן בהתאם.

הגישה פורסמה במאמר מ-2022 של Anthropic (החברה שמאחורי Claude) שכותרתו מתארת בדיוק את הרעיון: "אי-פגיעה מתוך משוב-AI". השיטה כוללת שני שלבים — המודל מבקר את התשובות שלו-עצמו מול ה"חוקה", ואז מאמנים אותו מחדש על גרסאות מתוקנות של אותן תשובות.

היתרון המרכזי לעומת למידת-חיזוק מהעדפות אנושיות (RLHF — Reinforcement Learning from Human Feedback) רגילה: פחות תלות בכמות עצומה של דירוגים אנושיים ידניים, ותהליך שקוף יותר — העקרונות עצמם כתובים וניתנים לבחינה ציבורית, לא "טעם" סמוי של קבוצת מדרגים אנושיים.

היקף ה"חוקה" עצמה גדל משמעותית עם הזמן: לפי דיווחים, המסמך שמנחה את קלוד גדל מכ-2,700 מילה ב-2023 לכ-23,000 מילה ביוני 2026 — גידול שמשקף בעיקר את הצורך המצטבר לכסות מצבי-קצה חדשים שהתגלו עם הזמן (כמו בטיחות-קטינים ושימושים-כפולים בטכנולוגיה), לא שינוי בעיקרון הבסיסי עצמו. גם היקף הפרסום גדל בהתאם: אנתרופיק ממשיכה לפרסם באופן פומבי גרסאות מעודכנות של העקרונות המנחים, כחלק ממדיניות-שקיפות שנמשכת משנת ההשקה של השיטה ועד היום.

מקורות-ההשראה לעקרונות המקוריים כללו, למשל, סעיפים מתוך ההכרזה לכל באי עולם בדבר זכויות האדם של האו"ם, ותקנוני-שימוש של חברות טכנולוגיה אחרות — לא ניסוח שהומצא מאפס, אלא ליקוט וסינתזה של עקרונות-אתיים קיימים שכבר זכו להסכמה רחבה בעולם האמיתי, ולא רק בתוך חברת ה-AI עצמה. גישה זו מבחינה בין השיטה עצמה (איך המודל לומד) לבין תוכן-העקרונות הספציפי (מה בדיוק כתוב ב"חוקה") — כך שחברות אחרות יכולות, עקרונית, לאמץ את שיטת-האימון בלי לאמץ בהכרח את אותו סט-עקרונות מדויק שבחרה אנתרופיק. המסמך שממלא תפקיד מקביל אצל OpenAI — מפרט-המודל (Model Spec), שטיוטתו הראשונה פורסמה ב-8 במאי 2024 — בנוי אחרת: הוא מדרג כל הוראה לפי דרגת-סמכות, מדרגת השורש (Root), שאינה ניתנת לעקיפה בהודעת-מערכת, בידי מפתח או בידי משתמש, ועד דרגת ההנחיה, שאפשר לעקוף גם במרומז. גם הוא פומבי, והוקדש לנחלת-הכלל ברישיון CC0.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו