בינה מלאכותית חוקתית (Constitutional AI)
הגדרה
בינה מלאכותית חוקתית היא שיטת אימון שבה המודל עצמו מבקר ומתקן את תשובותיו לפי סט עקרונות כתובים ("חוקה") — פחות תלויה בדירוג אנושי ידני מאשר RLHF רגיל.

במקום להסתמך רק על אנשים שמדרגים תשובות, מודל מאומן לבחון את התשובות שלו-עצמו מול רשימת עקרונות מוגדרים מראש (כמו "היה מועיל, אך אל תסייע לפגיעה"), ולתקן אותן בהתאם.
הגישה פורסמה במאמר מ-2022 של Anthropic (החברה שמאחורי Claude) שכותרתו מתארת בדיוק את הרעיון: "אי-פגיעה מתוך משוב-AI". השיטה כוללת שני שלבים — המודל מבקר את התשובות שלו-עצמו מול ה"חוקה", ואז מאמנים אותו מחדש על גרסאות מתוקנות של אותן תשובות.
היתרון המרכזי לעומת למידת-חיזוק מהעדפות אנושיות (RLHF — Reinforcement Learning from Human Feedback) רגילה: פחות תלות בכמות עצומה של דירוגים אנושיים ידניים, ותהליך שקוף יותר — העקרונות עצמם כתובים וניתנים לבחינה ציבורית, לא "טעם" סמוי של קבוצת מדרגים אנושיים.
היקף ה"חוקה" עצמה גדל משמעותית עם הזמן: לפי דיווחים, המסמך שמנחה את קלוד גדל מכ-2,700 מילה ב-2023 לכ-23,000 מילה ביוני 2026 — גידול שמשקף בעיקר את הצורך המצטבר לכסות מצבי-קצה חדשים שהתגלו עם הזמן (כמו בטיחות-קטינים ושימושים-כפולים בטכנולוגיה), לא שינוי בעיקרון הבסיסי עצמו. גם היקף הפרסום גדל בהתאם: אנתרופיק ממשיכה לפרסם באופן פומבי גרסאות מעודכנות של העקרונות המנחים, כחלק ממדיניות-שקיפות שנמשכת משנת ההשקה של השיטה ועד היום.
מקורות-ההשראה לעקרונות המקוריים כללו, למשל, סעיפים מתוך ההכרזה לכל באי עולם בדבר זכויות האדם של האו"ם, ותקנוני-שימוש של חברות טכנולוגיה אחרות — לא ניסוח שהומצא מאפס, אלא ליקוט וסינתזה של עקרונות-אתיים קיימים שכבר זכו להסכמה רחבה בעולם האמיתי, ולא רק בתוך חברת ה-AI עצמה. גישה זו מבחינה בין השיטה עצמה (איך המודל לומד) לבין תוכן-העקרונות הספציפי (מה בדיוק כתוב ב"חוקה") — כך שחברות אחרות יכולות, עקרונית, לאמץ את שיטת-האימון בלי לאמץ בהכרח את אותו סט-עקרונות מדויק שבחרה אנתרופיק. המסמך שממלא תפקיד מקביל אצל OpenAI — מפרט-המודל (Model Spec), שטיוטתו הראשונה פורסמה ב-8 במאי 2024 — בנוי אחרת: הוא מדרג כל הוראה לפי דרגת-סמכות, מדרגת השורש (Root), שאינה ניתנת לעקיפה בהודעת-מערכת, בידי מפתח או בידי משתמש, ועד דרגת ההנחיה, שאפשר לעקוף גם במרומז. גם הוא פומבי, והוקדש לנחלת-הכלל ברישיון CC0.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות