מסמך שעונה על שאלה שקשה לענות עליה
השאלה מי מחליט מה מודל מסרב לענות עליו היא שאלה שהתשובה לה יושבת בדרך-כלל בתוך החברה. מפרט-המודל של OpenAI הוא ניסיון להוציא אותה החוצה: מסמך שמתאר את ההתנהגות המכוונת של המודלים שמפעילים את מוצרי החברה ואת ממשק-התכנות שלה. טיוטה ראשונה פורסמה ב-8 במאי 2024, והמסמך מתעדכן מאז — הגרסה שהאתר הרשמי מגיש היום נושאת את התאריך 18 באוגוסט 2026. הוא הוקדש לנחלת-הכלל ומסומן ברישיון CC0, כדי לעודד שימוש רחב בו ושיתוף-פעולה סביבו. המטרה המוצהרת של הפרסום היא להגביר את השקיפות באשר לאופן שבו החברה מעצבת את התנהגות המודל, ולהזמין דיון ציבורי על דרכים לשפר אותה.
שרשרת-הפיקוד: חמש דרגות סמכות
לב המסמך הוא דירוג כל הוראה לפי דרגת-סמכות, כשהגבוהה גוברת על הנמוכה ממנה. הדרגות, מלמעלה למטה: שורש (Root) — כללי-יסוד שאין לעקוף בהודעת-מערכת, בידי מפתח או בידי משתמש; מערכת (System) — כללים ש-OpenAI קובעת וניתן להעבירם או לעקפם רק בהודעת-מערכת שלה; מפתח (Developer) — הוראות מי שבונה מוצר מעל ממשק-התכנות; משתמש (User) — הוראות המשתמש עצמו, הרביעית מלמעלה; והנחיה (Guideline) — ברירות-מחדל שאפשר לעקוף גם במרומז, מתוך ההקשר. כללי דרגת השורש הם ברובם כללי איסור, ולפי המסמך, כששני כללי-שורש מתנגשים זה בזה, ברירת-המחדל של המודל היא להימנע מפעולה.
קווים אדומים וברירות-מחדל
המפרט מפריד בין מה שאינו נתון למשא-ומתן לבין ברירת-מחדל. פרק עקרונות קו-אדום מונה מחויבויות שחלות על כל הפריסות: שהמודלים לא ישמשו לקידום נזק חמור כמו מעשי אלימות, יצירת נשק סייברי, ביולוגי או גרעיני, טרור, התעללות בילדים או מעקב המוני; שהאנושות תישאר בשליטה על אופן השימוש ב-AI ועל עיצוב התנהגותו; שלא ייעשה בהם שימוש להדרה או למניפולציה — ממוקדות או רחבות-היקף — ולא לערעור האוטונומיה האנושית; ושפרטיות המשתמשים תישמר. קבוצת עקרונות שנייה חלה רק על המוצרים שהחברה מוכרת ישירות לצרכן, ובהם ChatGPT; שם נכתב שהתאמה אישית, התאמה למשתמש והתאמה מקומית — למעט מה שנוגע לציות לחוק — לעולם אינן גוברות על עיקרון שמעל דרגת ההנחיה.
מסמך שהחברה כותבת על עצמה
זהו גם גבולו. המפרט הוא הצהרת-כוונות של חברה על מוצריה, לא תקן חיצוני ולא חובה רגולטורית: אותה חברה מנסחת אותו, מודדת מולו ומעדכנת אותו. המסמך אף מודה בכך במפורש וכותב שמודלי-הייצור אינם משקפים אותו עדיין במלואו, ושהוא רק חלק אחד מאסטרטגיית-הבטיחות הרחבה יותר של החברה. Anthropic מחזיקה מסמך מקביל בתפקידו — החוקה שעליה נשענת בינה מלאכותית חוקתית — כך שמדובר בפרקטיקה תעשייתית, אך כל חברה מנסחת את שלה בנפרד.
מה בדיקות חיצוניות מצאו
מפרטי-מודל נעשו בשנים האחרונות מושא למחקר עצמאי. עבודה אחת בנתה שיטה לבחון מפרטים בתרחישים שמאלצים הכרעה בין עקרונות מתחרים, ומצאה בהם סתירות ישירות ועמימויות-פרשנות, לצד יותר מ-70,000 מקרים שבהם מודלים חזיתיים נחלקו ביניהם בהתנהגות. עבודה אחרת, מ-2026, פירקה את מפרט OpenAI ל-197 כללים בדידים ובחנה מולם שבעה מודלים; היא מצאה שהציות משתפר מדור לדור, אך שההפרות שנותרו מתרכזות בשלושה מוקדים: שמירה על דמות שהמפעיל הטיל על המודל כשהוא נשאל על זהותו כבינה מלאכותית; פעולה בלתי-הפיכה בפריסה שבה המודל פועל כסוכן; וטענות כמותיות בדויות בעלות דיוק מדומה. המחברים מסייגים שאין ביכולתם לבודד מבחוץ אם השיפור נובע מאימון ייעודי מול המפרט, משיפורים רחבים יותר בשלבי-האימון שאחרי האימון המקדים, או מכך שהמודל מזהה שהוא נמצא בבחינה.