מה זה זיהוי-פעילות-אנושית
זיהוי פעילות אנושית מוגדר בספרות כזיהוי הפעולות והמטרות של גורם אחד או יותר, מתוך סדרת תצפיות על פעולותיו ועל תנאי הסביבה. בפועל מדובר במשימת סיווג: נתון חלון זמן קצר של מדידות, מה האדם עשה בו.
היישום המניע המרכזי של התחום הוא בריאותי-חברתי: ניטור פעילות יומיומית של אנשים מבוגרים בבית, כחלק ממה שנקרא "סביבות-מסייעות" (Ambient Assisted Living) — לזהות נפילה, לעודד תנועה, ולהתריע כשמשהו חריג.
שתי משפחות: חיישנים מול ראייה-ממוחשבת
יש שתי משפחות גישות. האחת מבוססת חיישנים — מד-תאוצה, ג׳ירוסקופ, איכון או תגי זיהוי — ומתאימה למכשיר שנמצא על הגוף. השנייה מבוססת ראייה ממוחשבת ומנתחת וידאו או מצלמת עומק, ומתאימה למצלמה שמסתכלת על אדם מבחוץ.
שתיהן עונות על אותה שאלה, אך מתוך נתונים שונים לגמרי, ולכן גם נתקלות בקשיים שונים: הגישה מבוססת-החיישנים רגישה למיקום החיישן על הגוף, והגישה מבוססת-הראייה רגישה לתאורה, לזווית-הצילום ולחסימות.
למה בכלל צריך למידה — לא רק כלל ידני
מדוע בכלל צריך כאן למידה? מפני שמד-תאוצה מפיק שלושה זרמי מספרים ותו לא. אין בהם שום דבר שאומר ״הליכה״. אפשר לנסות לכתוב כלל ידני — למשל, שיא מחזורי בתדר מסוים — אבל הכלל יישבר על אדם שצולע, על טלפון שיושב בכיס בזווית אחרת או על מדרגות במקום מדרכה.
לכן הפתרון המקובל הוא סיווג מונחה: חותכים את הזרם לחלונות קצרים, מתייגים כל חלון בפעילות שהתרחשה בו, ומאמנים מסווג על התיוגים.
מאגר UCI HAR: הדוגמה הקנונית
הדוגמה הקנונית היא מערך הנתונים Human Activity Recognition Using Smartphones ממאגר UCI, שנתרם בשנת 2012. שלושים מתנדבים בגילי 19 עד 48 ענדו טלפון Samsung Galaxy S II על המותן, והמאגר תיעד האצה קווית בשלושה צירים ומהירות זוויתית בשלושה צירים בקצב קבוע של 50 הרץ, לשש פעילויות: הליכה, עלייה במדרגות, ירידה במדרגות, ישיבה, עמידה ושכיבה. התיוג לא נעשה אוטומטית — הניסויים צולמו בווידאו כדי לתייג את הנתונים ידנית, וזו עלות אמיתית שחוזרת בכל פרויקט בתחום.
החוקרים שיצרו את המאגר — דוידה אנגיטה, אלסנדרו גיו, לוקה אונטו, חאווייר פארה וחורחה רייס-אורטיז — פרסמו כבר ב-2012 מאמר שהציג שיטת-סיווג חסכונית-בחומרה (אריתמטיקת נקודה-קבועה, במקום נקודה-צפה) שמתאימה למכשיר עם משאבי-חישוב וסוללה מוגבלים כמו טלפון סלולרי — עוד לפני שהמאגר עצמו פורסם רשמית.
פרט אחד באותו מאגר חשוב במיוחד להבנת הקושי: החלוקה לאימון ולבחינה נעשתה לפי מתנדבים ולא לפי חלונות — 70 אחוזים מן המתנדבים לאימון ו-30 אחוזים לבחינה. הסיבה היא שכל אדם הולך אחרת. מודל שאומן וגם נבחן על אותם אנשים עלול פשוט לזכור את ההליכה שלהם, ולהיכשל מול אדם חדש. שלושת האתגרים המוכרים בתחום הם בדיוק אלה: שוֹנוּת בין משתמשים, רגישות למקום שבו החיישן מונח, ועלות התיוג.
השיטות: ממודלים הסתברותיים לרשתות עמוקות
מבחינת שיטות, התחום עבר את אותו מסלול כמו תחומים אחרים בלמידת מכונה. בעבר נעשה שימוש במודלים הסתברותיים לרצפים, כמו מודלי מרקוב חבויים ורשתות בייס דינמיות, ובמודלים מבחינים כמו שדות אקראיים מותנים ומכונות-וקטור-תומך (SVM). כיום נפוצות רשתות עמוקות — רשתות קונבולוציה ורשתות זיכרון ארוך-קצר-טווח (LSTM).
המשימה הזו היא מה שעומד מאחורי מרבית התכונות שמשתמש במכשיר לביש נתקל בהן בלי לחשוב עליהן: ספירת צעדים, זיהוי אוטומטי של אימון שהתחיל, התרעת נפילה וההבחנה בין שינה לערות.