בטיחות ואתיקה
השאלות שמעבר ל"איך זה עובד" — האם אפשר לסמוך על מערכת AI, למי היא עלולה להזיק, ואיך מגנים מפני שימוש לרעה.
מה תמצאו כאן תשובה עליו
אם מודל למד מכל מה שכתוב באינטרנט, האם הוא ירש משם גם דעות קדומות — ואיך אפשר בכלל לגלות את זה?
מי מחליט מה מודל מסרב לענות עליו, ואיך בודקים שההגבלות האלה באמת מחזיקות?
כמה באמת צריך לדאוג, ומה ההבדל בין נזק שכבר קורה היום לבין תרחיש עתידי רחוק?
מה קורה למידע שאני מקליד בצ'אט או שהמכשיר הצמוד לגוף שלי אוסף — מי רואה אותו ולכמה זמן הוא נשמר?
מה ההבדל בין חוק שמחייב חברות בינה מלאכותית לבין תקן שהן בוחרות לאמץ מרצון?
מאיפה מתחילים
- הטיה אלגוריתמית (Bias) אם תקראו רק אחדהטיה אלגוריתמית (Bias) היא כשמודל AI משקף בתשובותיו דעות קדומות שהוא "ירש" מהנתונים העצומים שעליהם אומן — בלי כוונה מצד מי שבנה אותו.
- יישור (Alignment)יישור (Alignment) הוא התחום שעוסק בלוודא שמודל AI פועל בהתאם לכוונות וערכים אנושיים, ולא רק "עונה נכון" מבחינה טכנית.
- מעקות בטיחות (Guardrails)מעקות בטיחות (Guardrails) הם כללים והגבלות שמוטמעים במודל AI כדי למנוע ממנו לספק תוכן מזיק, מסוכן או בלתי הולם.
עוד על הקטגוריה הזו
הקטגוריה מכסה מונחים מתחום בטיחות ה-AI (כמו הטיה אלגוריתמית שמשקפת הטיות קיימות בנתוני-האימון), פרטיות (מה בדיוק AI "יודע" עלינו ואיך זה נשמר), ואתיקה (מי אחראי כשמערכת AI טועה, ואילו שימושים נחשבים בעייתיים גם כשהטכנולוגיה עצמה כשירה). זו לא קטגוריה תיאורטית בלבד: רוב המונחים כאן קשורים ישירות להחלטות מעשיות שחברות, ממשלות ומשתמשים בודדים כבר צריכים לקבל היום — מהאם לסמוך על תשובה של צ'אטבוט בעניין רפואי ועד לשאלה איך לזהות תוכן מזויף. הכתיבה כאן מכוונת במיוחד להישאר מאוזנת: לא להפחיד יתר על המידה ולא להמעיט בסיכונים אמיתיים, אלא להסביר מה בדיוק הבעיה הטכנית או החברתית שכל מונח מתאר, כדי שהקורא יוכל לגבש דעה מבוססת בעצמו. חלק מהמונחים כאן — כמו רגולציית AI או שקיפות אלגוריתמית — נמצאים עדיין בשלב מוקדם יחסית של דיון ציבורי ומשפטי, ולכן חשוב לקרוא אותם כתיאור של מצב מתפתח ולא כתשובה סופית וקבועה.
מה לא נמצא כאן
כאן נמצאים הנזק האפשרי, מי נפגע ממנו והאמצעים שנועדו למנוע אותו. תקיפה טכנית שמכוונת למודל עצמו, כמו הזרקת פרומפט, מתוארת במודלים ושפה; הטכניקה שמאפשרת לזייף וידאו או קול נמצאת בתמונה, קול ווידאו, וכאן נמצא רק הנזק שהיא מאפשרת; והנוכחות הציבורית של הטכנולוגיה שייכת ל-AI בחברה.
א
ב
- בדיקות-פריצה יזומות (Red Teaming)
- בדיקת מקוריות של מדיה סינתטית (Synthetic Media Provenance)⭐ מורחב
- בטיחות בינה מלאכותית (AI Safety)⭐ מורחב
- בינה מלאכותית אחראית (Responsible AI)
- בינה מלאכותית בלוחמה (AI in Warfare)⭐ מורחב
- בינה מלאכותית ממוקדת-אדם (Human-Centered AI)⭐ מורחב
- ביקורת-הטיה מחייבת (Bias Audit)⭐ מורחב
ה
- הדיבידנד של השקרן (Liar's Dividend)
- ההצהרה על בינת-על (Statement on Superintelligence)⭐ מורחב
- הוגנות אלגוריתמית (Algorithmic Fairness)
- הונאת פישינג
- הטיה אלגוריתמית (Bias)⭐ מורחב
- הטיית אוטומציה (Automation Bias)⭐ מורחב
- הלבנת בינה מלאכותית (AI Washing)⭐ מורחב
- הניו יורק טיימס נגד OpenAI (NYT v. OpenAI)⭐ מורחב
- הסתברות לאבדון (P(doom))⭐ מורחב
- הרעלת נתונים (Data Poisoning)
- השכחת-מכונה (Machine Unlearning)⭐ מורחב
- התקפה יריבה (Adversarial Attack)
- התקפת שיוך-חברות (Membership Inference Attack)⭐ מורחב
ז
ח
ט
- טאי (Tay)⭐ מורחב
י
- יישור (Alignment)⭐ מורחב
- יישור מטעה (Deceptive Alignment)⭐ מורחב
מ
- מאטה נגד אוויאנקה (Mata v. Avianca)⭐ מורחב
- מאסק נגד אלטמן (Musk v. Altman)⭐ מורחב
- מדיניות AI בארצות הברית: פדרלי מול מדינתי⭐ מורחב
- מודרציית תוכן (Content Moderation)
- מחלוקת Anthropic והפנטגון (Anthropic–DoD Dispute)⭐ מורחב
- מכון בטיחות AI (AI Safety Institute)⭐ מורחב
- מכון עתיד החיים (Future of Life Institute)⭐ מורחב
- מסגרת בטיחות חזיתית (Frontier AI Safety Framework)⭐ מורחב
- מעקות בטיחות (Guardrails)⭐ מורחב
- מערכת זיהוי תווי פנים (Facial Recognition)
- מפרט-המודל (Model Spec)⭐ מורחב
- מקרי מוות שנקשרו לצ'אטבוטים (Deaths Linked to Chatbots)⭐ מורחב
נ
פ
- פורנוגרפיית דיפ-פייק
- פיקוח אנושי (Human Oversight)
- פיקוח בר-קנה-מידה (Scalable Oversight)⭐ מורחב
- פסגת בטיחות ה-AI (AI Safety Summit)⭐ מורחב
- פסיכוזת בינה מלאכותית (AI Psychosis)⭐ מורחב
- פרויקט מייבן (Project Maven)⭐ מורחב
- פרטיות במכשירים לבישים (Wearable Privacy)⭐ מורחב
- פרטיות דיפרנציאלית (Differential Privacy)⭐ מורחב
- פרטיות נתונים
- פריצת-תגמול (Reward Hacking)⭐ מורחב
- פרנצ'סקה רוסי (Francesca Rossi)
צ
ק
ת
אנגלית / ראשי-תיבות
- COMPASכלי הערכת-סיכון-פלילי; 137 שאלות, אין שאלה ישירה על גזע
- Gender Shadesמחקר-הטיה בזיהוי-פנים: 34.7% בנשים כהות, 0.8% בגברים בהירים
📋 קריטריונים לבחירת הערכים בקטגוריה זו
נכנס לכאן מונח שעוסק בנזק אפשרי, במי שנפגע ממנו ובדרכים למנוע אותו — הטיה, יישור, פרטיות, פיקוח אנושי, רגולציה ושימוש לרעה. הסף: בעיה או אמצעי-הגנה שיש להם שם מוכר ודיון ציבורי או מקצועי מאחוריהם, לא דעה של הכותב. תקיפה טכנית ברמת המודל עצמו, כמו הזרקת פרומפט, מובאת במודלים ושפה; הנוכחות התרבותית של AI בקולנוע, בתקשורת ובפוליטיקה שייכת ל-AI בחברה. החלוקה הזו בין המודל לחברה היא שיקול-דעת שלנו ולא גבול חד, וחלק מהמונחים כאן — במיוחד הרגולטוריים — מתארים מצב משפטי שעדיין משתנה.