הגדרת הקוד-הפתוח ל-AI (OSAID)

עולם המוצר והעסקים

הגדרה

הגדרת הקוד-הפתוח ל-AI (OSAID) היא ההגדרה הרשמית שפרסם ארגון OSI באוקטובר 2024, הקובעת אילו תנאים הופכים מערכת בינה מלאכותית ל'קוד פתוח' — ארבע חירויות ושלושה רכיבים.

מה ההגדרה קובעת, ומתי פורסמה

ב-28 באוקטובר 2024 פרסם ארגון ה-Open Source Initiative (OSI) — אותו ארגון שמנהל את ההגדרה המקובלת ל'קוד פתוח' בעולם התוכנה — את גרסה 1.0 של הגדרת הקוד-הפתוח ל-AI. עד אז לא הייתה הכרעה רשמית מהי מערכת בינה מלאכותית פתוחה, וכל חברה קראה לעצמה 'פתוחה' לפי קריטריון משלה. לפי סטפנו מאפולי, המנהל הביצועי של הארגון, גיבוש ההגדרה נמשך שנתיים ונשען על התייעצות עם מומחים ברחבי העולם. מאז קיימת נקודת-ייחוס אחת שאפשר לבחון מולה כל הצהרה על פתיחות.

ארבע החירויות

בלב ההגדרה עומדות ארבע חירויות, שנגזרו מהגדרת התוכנה החופשית: להשתמש במערכת לכל מטרה ובלי לבקש רשות; לחקור כיצד היא פועלת ולבחון את רכיביה; לשנות אותה לכל מטרה, לרבות שינוי הפלט שלה; ולשתף אותה עם אחרים, עם שינויים או בלעדיהם, לכל מטרה. ההגדרה מדגישה שהחירויות חלות באותה מידה על מערכת שלמה ועל רכיב בודד בתוכה — מודל, משקלים או פרמטרים — כדי שלא יהיה אפשר להצהיר על פתיחות ברמת המערכת ולהשאיר רכיב מרכזי סגור.

שלושת הרכיבים שחייבים להיות זמינים

תנאי מוקדם למימוש ארבע החירויות הוא גישה למה שההגדרה מכנה 'הצורה המועדפת לביצוע שינויים'. במערכות למידת-מכונה היא מורכבת משלושה רכיבים שחייבים להתקיים יחד: קוד המקור המלא לאימון המערכת ולהרצתה, תחת רישיון מאושר בידי OSI; פרמטרי המודל, ובהם המשקלים, תחת תנאים מאושרים בידי OSI; ומידע על הנתונים — תיאור מפורט די הצורך של נתוני האימון, כך שאדם מיומן יוכל לבנות בעזרתו מערכת שוות-ערך במהותה. החלוקה הזו מפרידה בין שלושה דברים שבשיח היומיומי מתערבבים — הקוד, המשקלים והנתונים — ומאפשרת לומר על מודל מסוים בדיוק איזה מהם פורסם ואיזה לא.

למה מידע על הנתונים, ולא הנתונים עצמם

הנקודה השנויה במחלוקת ביותר היא דווקא האחרונה. חלק ניכר מנתוני האימון אינו ניתן להפצה מחדש מסיבות משפטיות, ולכן ההגדרה מחליפה מסירה של נתונים בדרישת שקיפות. היא מחייבת תיאור מלא של כל הנתונים ששימשו לאימון — לרבות נתונים שאי-אפשר לשתף — ובכלל זה מקורם, היקפם ומאפייניהם, איך נאספו ונבחרו, נהלי התיוג ושיטות העיבוד והסינון. נוסף על כך נדרשות שתי רשימות: נתוני האימון הזמינים לציבור ואיפה להשיגם, ונתונים שאפשר להשיג מצדדים שלישיים, גם אם בתשלום.

מה זה אומר על מודלים שמכנים את עצמם פתוחים

חלק מהמודלים המכונים היום 'פתוחים' אינם עומדים בהגדרה, משום שהם מפרסמים משקלים בלבד. OSI מקדישה לכך עמוד נפרד ובו היא מונה את מה שחסר: קוד האימון; מערך האימון עצמו, כשהדבר אפשרי מבחינה משפטית; וכשהפצתו אינה אפשרית משפטית — שקיפות מלאה על הרכב הנתונים במקומו. בלעדיהם, לדבריה, אי-אפשר לשחזר את המודל, לאתר היכן נכנסה הטיה, או לתרום לו מעבר לכוונון-עדין שטחי. עם פרסום ההגדרה אמר החוקר העצמאי סיימון וילסון לאתר The Verge: "עכשיו, כשיש בידינו הגדרה איתנה, אולי נוכל להתעמת בתקיפות רבה יותר עם חברות שעוסקות ב-open washing — הלבנת-פתיחוּת — ומצהירות שעבודתן היא קוד פתוח כשלמעשה אינה כזו".

מה ההגדרה אינה עושה

OSAID אינה חוק ואינה רישיון, אלא תקן וולונטרי שאפשר לאמץ או לדחות. מטא, שמודלי Llama שלה אינם עומדים בה — הן בשל הגבלה על שימוש מסחרי בהיקף גדול והן משום שנתוני האימון אינם נגישים — מסרה ל-The Verge באמצעות דוברת שהיא חולקת על ההגדרה, ושאין הגדרה יחידה אחת לקוד-פתוח ב-AI. ההגדרה גם אינה עוסקת בשאלה למה חברה בוחרת מלכתחילה לשחרר מודל לציבור; זו שאלה אסטרטגית, והיא נדונה בערך הפיכת המשלים לסחורה.

שאלות נפוצות ❓

מתי בדיוק פורסמה ההגדרה, ומי פרסם אותה?

ארגון ה-Open Source Initiative (OSI) פרסם את גרסה 1.0 ב-28 באוקטובר 2024. זהו הארגון שמנהל גם את ההגדרה המקובלת ל'קוד פתוח' בעולם התוכנה. לפי סטפנו מאפולי, המנהל הביצועי שלו, העבודה על ההגדרה נמשכה שנתיים וכללה התייעצות עם מומחים ברחבי העולם.

מהן ארבע החירויות שההגדרה דורשת?

להשתמש במערכת לכל מטרה ובלי לבקש רשות; לחקור כיצד היא פועלת ולבחון את רכיביה; לשנות אותה לכל מטרה, לרבות שינוי הפלט; ולשתף אותה עם אחרים, עם שינויים או בלעדיהם, לכל מטרה. תנאי מוקדם למימושן הוא גישה ל'צורה המועדפת לביצוע שינויים' — הקוד, הפרמטרים והמידע על הנתונים.

האם מודל שפרסם את המשקלים שלו נחשב קוד פתוח לפי ההגדרה?

לא. משקלים פתוחים הם רק אחד משלושת הרכיבים. OSI מקדישה לכך עמוד נפרד ומסבירה שבלי קוד האימון ובלי שקיפות על הרכב הנתונים אי-אפשר לשחזר את המודל, לאתר היכן נכנסה הטיה, או לתרום לו מעבר לכוונון-עדין שטחי.

למה ההגדרה מסתפקת במידע על הנתונים במקום בנתונים עצמם?

משום שחלק ניכר מנתוני האימון אינו ניתן להפצה מחדש מסיבות משפטיות. במקום זאת ההגדרה דורשת תיאור מפורט די הצורך — כולל של נתונים שאי-אפשר לשתף — כך שאדם מיומן יוכל לבנות בעזרתו מערכת שוות-ערך במהותה. זו הנקודה השנויה במחלוקת ביותר בהגדרה כולה.

האם ההגדרה מחייבת מישהו מבחינה משפטית?

לא. היא אינה חוק ואינה רישיון, אלא תקן וולונטרי שאפשר לאמץ או לדחות. מטא, למשל, מסרה ל-The Verge באמצעות דוברת שהיא חולקת על ההגדרה ושאין הגדרה יחידה אחת לקוד-פתוח ב-AI. ערכה של ההגדרה הוא בכך שהיא נותנת נקודת-ייחוס אחת שאפשר למדוד מולה הצהרות.