דלג לתוכן

חומרה לבינה מלאכותית (AI Hardware)

יסודות בינה מלאכותית

הגדרה

חומרה לבינה מלאכותית היא שבבים שתוכננו או הותאמו להריץ מודלי AI מהר יותר ובפחות חשמל ממעבד רגיל — מעבדים גרפיים, שבבים ייעודיים כמו TPU, מאיצים עצביים בטלפון ועוד.

💡 דוגמה

המצלמה בטלפון מזהה פנים ומטשטשת את הרקע ברגע הצילום, גם בלי אינטרנט.

זה קורה כי בתוך הטלפון יש רכיב שנבנה במיוחד לחישובים של מודלי AI, לצד המעבד הרגיל.

למה מודל AI צריך חומרה משלו

רוב העבודה של רשת עצבית היא חישוב אחד שחוזר מיליארדי פעמים: הכפלה וחיבור של מספרים בטבלאות גדולות (מטריצות). כל פעולה כזאת פשוטה, אבל יש המון כאלה, ורובן לא תלויות זו בזו — כך שאפשר לבצע אותן במקביל. מעבד מרכזי רגיל (CPU) נבנה לעבודה אחרת: מעט משימות מסובכות, אחת אחרי השנייה. לכן, כפי שמסכמת ויקיפדיה האנגלית, "חומרת מחשב ייעודית משמשת לעתים קרובות כדי להריץ תוכניות AI מהר יותר ובפחות אנרגיה".

לפי ויקיפדיה, מאיצי AI נשענים על כמה רעיונות חוזרים: חישוב ברמת דיוק נמוכה — מספרים "קצרים" יותר, שתופסים פחות מקום וחשמל; ארכיטקטורות שבהן הנתונים זורמים בין יחידות החישוב בלי לחזור כל פעם לזיכרון; ולפעמים חישוב בתוך הזיכרון עצמו. הערך הכללי על חומרה מסביר את ההבדל הבסיסי בין CPU ל-GPU, והערך על תשתית בינה מלאכותית מתאר את מרכזי הנתונים, הרשת והחשמל. הערך הזה מתמקד במשפחות השבבים עצמן ובמה שמבדיל ביניהן.

ממכונות Lisp לכרטיסי מסך

הרעיון לבנות מחשב במיוחד עבור AI אינו חדש. בסוף שנות ה-70 ותחילת שנות ה-80 פותחו "מכונות Lisp", מחשבים שנועדו להריץ מהר יותר תוכניות AI שנכתבו בשפת התכנות Lisp.

המהפך הגדול הגיע דווקא מעולם משחקי המחשב. מעבדים גרפיים (GPU) נבנו כדי לחשב אלפי פיקסלים במקביל, ובדיוק התכונה הזאת התאימה לרשתות עצביות. הרגע הסמלי היה ב-2012: AlexNet, הרשת שניצחה בתחרות זיהוי התמונות ImageNet, אומנה על שני כרטיסי מסך של אנבידיה מדגם GTX 580, עם 3GB זיכרון כל אחד, במשך חמישה עד שישה ימים. לפי מחברי המאמר, עומק הרשת היה חיוני לביצועים, והוא התאפשר בזכות השימוש במעבדים גרפיים. ויקיפדיה מוסיפה שהקוד נכתב בפלטפורמת CUDA של אנבידיה, ושחוקרים אימנו רשתות עצביות על מעבדים גרפיים כבר מ-2006 — אבל AlexNet הפכה לסמל המעבר. לפי ויקיפדיה, נכון ל-2023 שוק החומרה ל-AI נשלט בידי המעבדים הגרפיים.

שבב שנבנה רק בשביל רשתות עצביות: TPU

השלב הבא היה שבבים שתוכננו מראשיתם לבינה מלאכותית. הדוגמה המוכרת ביותר היא ה-TPU של גוגל (Tensor Processing Unit) — שבב ייעודי מסוג ASIC, כלומר מעגל שתוכנן למשימה אחת ואי אפשר לשנות אותו אחרי הייצור. גוגל התחילה להשתמש בו בתוך החברה ב-2015, חשפה אותו בכנס Google I/O במאי 2016, ופתחה אותו ללקוחות הענן בפברואר 2018. לפי ויקיפדיה, גוגל אישרה ש-TPU שימשו גם בקרבות של AlphaGo מול אלוף הגו לי סה-דול.

המאמר הטכני שפרסמה גוגל ב-2017 על הדור הראשון מסביר את ההיגיון. השבב נועד להרצת מודלים (הסקה) ולא לאימונם, והכיל 65,536 יחידות כפל-וחיבור שעובדות במספרים של 8 סיביות בלבד. לפי המאמר, בהרצת המודלים שגוגל השתמשה בהם בפועל, הוא היה מהיר בממוצע פי 15 עד פי 30 מהמעבד הגרפי והמעבד הרגיל שהיו בני זמנו, ויעיל פי 30 עד פי 80 בכמות החישוב לכל ואט חשמל. מאז הוציאה גוגל דורות נוספים; לפי ויקיפדיה, הדור השביעי, Ironwood, הוכרז באפריל 2025, וב-22 באפריל 2026 הוכרז הדור השמיני, שכולל לראשונה שני שבבים נפרדים: TPU 8t לאימון מודלים גדולים, ו-TPU 8i להרצה מהירה, לסוכני AI ולהנמקה על הקשר ארוך.

ממרכז הנתונים לכיס: מאיצים עצביים

ויקיפדיה מבחינה בין שני עולמות של מאיצים. במרכזי הנתונים פועלים שבבים גדולים וצורכי חשמל — המעבדים הגרפיים של אנבידיה, ה-TPU של גוגל והשבבים Trainium ו-Inferentia של אמזון — שמאמנים ומריצים מודלים בקנה מידה גדול. במכשירים האישיים יושבים מאיצים עצביים (NPU) קטנים וחסכוניים, שמריצים מודלים קטנים ישירות על המכשיר.

לפי ויקיפדיה, אפל הוסיפה רכיב כזה לשבבים שלה בסביבות 2017, ואינטל ו-AMD הוסיפו אותו למעבדי המחשבים שלהן בסביבות 2022. מאיצים כאלה נמצאים גם בשבבים של קוואלקום, סמסונג, וואווי וגוגל. הם מה שמאפשר לטלפון לזהות פנים, לתמלל דיבור או לשפר תמונה בלי לשלוח את המידע לשרת — נושא שהערך על AI על-המכשיר מרחיב עליו.

ניסויים בצד: שבבים גמישים ושבבים בהשראת המוח

לצד המשפחות הגדולות יש גם כיוונים נוספים. FPGA הוא סוג של שבב ש"אפשר לתכנת אותו שוב ושוב אחרי הייצור" — מעין אמצע הדרך בין שבב כללי לשבב ייעודי. לפי ויקיפדיה, נכון ל-2018 שבבים כאלה שימשו יותר ויותר כמאיצי AI, בין השאר בפרויקט Catapult של מיקרוסופט, והם מתאימים במיוחד כשמייצרים כמויות קטנות.

כיוון ניסיוני יותר הוא מחשוב נוירומורפי — שבבים שמחקים את מבנה המוח. את היסודות הניח קארבר מיד (Carver Mead) בסוף שנות ה-80, ובין הדוגמאות הבולטות נמנים השבב TrueNorth של IBM מ-2014 והשבב Loihi של אינטל. במקום זרם רציף של מספרים, השבבים האלה עובדים ב"פולסים" שנשלחים רק כשמשהו קורה, ולכן הם עשויים לחסוך הרבה חשמל. במקביל, גל של חברות הזנק מנסה לאתגר את אנבידיה בארכיטקטורות חדשות — נושא שמפורט בערך נפרד.

צוואר הבקבוק החדש: הזיכרון

נדמה שמהירות החישוב היא העיקר, אבל קבוצת חוקרים הראתה במאמר מ-2024 בשם "AI and Memory Wall" שהבעיה זזה למקום אחר. לפי המאמר, יכולת החישוב השיאית של חומרת שרתים גדלה פי 3.0 בכל שנתיים, בזמן שרוחב הפס של הזיכרון גדל רק פי 1.6, ורוחב הפס של החיבורים בין השבבים פי 1.4 בלבד, באותו פרק זמן. המסקנה שלהם: הזיכרון, ולא החישוב, הופך לצוואר הבקבוק העיקרי של יישומי AI — במיוחד בהרצת מודלים למשתמשים.

המשמעות למי שאינו מהנדס: שבב מהיר מבזבז חלק מזמנו בהמתנה לנתונים. לכן יצרנים מצמידים לשבבים זיכרון מהיר במיוחד, ולכן כל כך הרבה מאמץ מושקע בהקטנת מודלים — מודל קטן יותר צריך להעביר פחות נתונים, ורץ מהר יותר גם על אותה חומרה.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

ארבע משפחות של חומרה ל-AI
מעבד גרפי (GPU)שבב ייעודי (ASIC)שבב מתוכנת (FPGA)מאיץ עצבי (NPU)
מה מיוחד בואלפי יחידות חישוב שעובדות במקביל; נבנה במקור לגרפיקהמתוכנן למשימה אחת; אי אפשר לשנות אחרי הייצוראפשר לתכנת מחדש אחרי הייצוררכיב קטן וחסכוני בחשמל בתוך שבב המכשיר
דוגמה מתועדתכרטיסי אנבידיה שעליהם אומנה AlexNet (2012)ה-TPU של גוגל (בשימוש מ-2015)פרויקט Catapult של מיקרוסופטהמאיצים בשבבי אפל (מסביבות 2017)
איפה פוגשים אותומרכזי נתונים ומחשבים חזקיםמרכזי נתונים, בעיקר דרך הענןמרכזי נתונים ומוצרים בכמויות קטנותטלפונים ומחשבים ניידים

שאלות נפוצות ❓

למה דווקא כרטיסי מסך מתאימים ל-AI?

כי הם נבנו לבצע אלפי חישובים פשוטים במקביל, וזה בדיוק סוג החישוב שרשת עצבית צריכה. חוקרים השתמשו בהם לרשתות עצביות כבר מ-2006, ו-AlexNet ב-2012 הפכה לסמל המעבר.

מה ההבדל בין TPU ל-GPU?

GPU הוא מעבד כללי יחסית שנולד בעולם הגרפיקה. TPU הוא שבב ייעודי של גוגל שתוכנן רק לחישובי רשתות עצביות, ולכן הוא יעיל מאוד במשימה הזאת אבל לא גמיש.

האם בטלפון שלי יש חומרה ל-AI?

בטלפונים רבים כן: מאיץ עצבי (NPU) שיושב בתוך השבב הראשי ומריץ מודלים קטנים, כמו זיהוי פנים או תמלול, בלי לשלוח מידע לשרת.

מה זה "קיר הזיכרון"?

המצב שבו השבב יכול לחשב מהר יותר ממה שהזיכרון מספיק להזין אותו בנתונים. לפי מחקר מ-2024, הזיכרון הפך לצוואר הבקבוק העיקרי בהרצת מודלים.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו