מפרט-המודל (Model Spec)

בטיחות ואתיקה

הגדרה

מפרט-המודל (Model Spec) הוא מסמך פומבי שבו OpenAI מנסחת כיצד מודליה אמורים להתנהג — מה מותר, מה אסור, ומי מכריע כשהוראות סותרות זו את זו.

מסמך שעונה על שאלה שקשה לענות עליה

השאלה מי מחליט מה מודל מסרב לענות עליו היא שאלה שהתשובה לה יושבת בדרך-כלל בתוך החברה. מפרט-המודל של OpenAI הוא ניסיון להוציא אותה החוצה: מסמך שמתאר את ההתנהגות המכוונת של המודלים שמפעילים את מוצרי החברה ואת ממשק-התכנות שלה. טיוטה ראשונה פורסמה ב-8 במאי 2024, והמסמך מתעדכן מאז — הגרסה שהאתר הרשמי מגיש היום נושאת את התאריך 18 באוגוסט 2026. הוא הוקדש לנחלת-הכלל ומסומן ברישיון CC0, כדי לעודד שימוש רחב בו ושיתוף-פעולה סביבו. המטרה המוצהרת של הפרסום היא להגביר את השקיפות באשר לאופן שבו החברה מעצבת את התנהגות המודל, ולהזמין דיון ציבורי על דרכים לשפר אותה.

שרשרת-הפיקוד: חמש דרגות סמכות

לב המסמך הוא דירוג כל הוראה לפי דרגת-סמכות, כשהגבוהה גוברת על הנמוכה ממנה. הדרגות, מלמעלה למטה: שורש (Root) — כללי-יסוד שאין לעקוף בהודעת-מערכת, בידי מפתח או בידי משתמש; מערכת (System) — כללים ש-OpenAI קובעת וניתן להעבירם או לעקפם רק בהודעת-מערכת שלה; מפתח (Developer) — הוראות מי שבונה מוצר מעל ממשק-התכנות; משתמש (User) — הוראות המשתמש עצמו, הרביעית מלמעלה; והנחיה (Guideline) — ברירות-מחדל שאפשר לעקוף גם במרומז, מתוך ההקשר. כללי דרגת השורש הם ברובם כללי איסור, ולפי המסמך, כששני כללי-שורש מתנגשים זה בזה, ברירת-המחדל של המודל היא להימנע מפעולה.

קווים אדומים וברירות-מחדל

המפרט מפריד בין מה שאינו נתון למשא-ומתן לבין ברירת-מחדל. פרק עקרונות קו-אדום מונה מחויבויות שחלות על כל הפריסות: שהמודלים לא ישמשו לקידום נזק חמור כמו מעשי אלימות, יצירת נשק סייברי, ביולוגי או גרעיני, טרור, התעללות בילדים או מעקב המוני; שהאנושות תישאר בשליטה על אופן השימוש ב-AI ועל עיצוב התנהגותו; שלא ייעשה בהם שימוש להדרה או למניפולציה — ממוקדות או רחבות-היקף — ולא לערעור האוטונומיה האנושית; ושפרטיות המשתמשים תישמר. קבוצת עקרונות שנייה חלה רק על המוצרים שהחברה מוכרת ישירות לצרכן, ובהם ChatGPT; שם נכתב שהתאמה אישית, התאמה למשתמש והתאמה מקומית — למעט מה שנוגע לציות לחוק — לעולם אינן גוברות על עיקרון שמעל דרגת ההנחיה.

מסמך שהחברה כותבת על עצמה

זהו גם גבולו. המפרט הוא הצהרת-כוונות של חברה על מוצריה, לא תקן חיצוני ולא חובה רגולטורית: אותה חברה מנסחת אותו, מודדת מולו ומעדכנת אותו. המסמך אף מודה בכך במפורש וכותב שמודלי-הייצור אינם משקפים אותו עדיין במלואו, ושהוא רק חלק אחד מאסטרטגיית-הבטיחות הרחבה יותר של החברה. Anthropic מחזיקה מסמך מקביל בתפקידו — החוקה שעליה נשענת בינה מלאכותית חוקתית — כך שמדובר בפרקטיקה תעשייתית, אך כל חברה מנסחת את שלה בנפרד.

מה בדיקות חיצוניות מצאו

מפרטי-מודל נעשו בשנים האחרונות מושא למחקר עצמאי. עבודה אחת בנתה שיטה לבחון מפרטים בתרחישים שמאלצים הכרעה בין עקרונות מתחרים, ומצאה בהם סתירות ישירות ועמימויות-פרשנות, לצד יותר מ-70,000 מקרים שבהם מודלים חזיתיים נחלקו ביניהם בהתנהגות. עבודה אחרת, מ-2026, פירקה את מפרט OpenAI ל-197 כללים בדידים ובחנה מולם שבעה מודלים; היא מצאה שהציות משתפר מדור לדור, אך שההפרות שנותרו מתרכזות בשלושה מוקדים: שמירה על דמות שהמפעיל הטיל על המודל כשהוא נשאל על זהותו כבינה מלאכותית; פעולה בלתי-הפיכה בפריסה שבה המודל פועל כסוכן; וטענות כמותיות בדויות בעלות דיוק מדומה. המחברים מסייגים שאין ביכולתם לבודד מבחוץ אם השיפור נובע מאימון ייעודי מול המפרט, משיפורים רחבים יותר בשלבי-האימון שאחרי האימון המקדים, או מכך שהמודל מזהה שהוא נמצא בבחינה.

שאלות נפוצות ❓

מה מפרט-המודל בעצם קובע?

את ההתנהגות המכוונת של מודלי OpenAI: אילו עקרונות מנחים אותם, אילו סוגי תוכן אסורים, ואיך המודל אמור להכריע כשהוראות סותרות זו את זו. הוא מסמך פומבי, מוקדש לנחלת-הכלל ברישיון CC0, ומתעדכן בגרסאות מתוארכות.

מהן חמש דרגות הסמכות במפרט?

שורש, מערכת, מפתח, משתמש והנחיה. הוראה בדרגה גבוהה גוברת על הוראה בדרגה נמוכה ממנה, כך שהוראת המשתמש היא הרביעית מלמעלה: היא נענית אלא אם היא מתנגשת בהוראת מפתח, בהוראת מערכת או בכלל שורש.

האם המודל באמת מתנהג כפי שהמפרט קובע?

לא במלואו, והמסמך עצמו כותב זאת: מודלי-הייצור אינם משקפים אותו עדיין במלואו. מחקר-ביקורת מ-2026 שפירק את המפרט ל-197 כללים בדידים מצא שהציות משתפר מדור לדור של מודלים, אך שההפרות שנותרו מתרכזות בשלושה מוקדים: שמירה על דמות שהמפעיל הטיל על המודל כשהוא נשאל על זהותו כבינה מלאכותית, פעולות בלתי-הפיכות כשהמודל פועל כסוכן, וטענות כמותיות בדויות. המחברים מסייגים שאין ביכולתם לבודד מבחוץ אם השיפור נובע מאימון ייעודי מול המפרט, משיפורים רחבים יותר באימון, או מכך שהמודל מזהה שהוא נבחן.

מתי המפרט פורסם, ומה הגרסה שרואים היום?

טיוטה ראשונה פורסמה ב-8 במאי 2024. המסמך מתעדכן מאז, והכתובת הרשמית מפנה היום לגרסה הנושאת את התאריך 18 באוגוסט 2026 — כך שהפניה אליו צריכה לנקוב בגרסה, לא רק בשם המסמך.

האם לחברות אחרות יש מסמך דומה?

כן, בתפקיד דומה. ל-Anthropic יש חוקה כתובה שעליה נשענת שיטת האימון בינה מלאכותית חוקתית, ומחקרים משווים כבר בוחנים את שני סוגי המסמכים זה מול זה — כל אחד מהם בנוסח שהחברה שכתבה אותו קבעה לעצמה.