יחידת עיבוד טנזורים (TPU)
הגדרה
TPU הוא מאיץ ייעודי של גוגל לרשתות נוירונים: הדור הראשון פעל במרכזי הנתונים שלה מ-2015 להרצת מודלים, ודורות מאוחרים יותר משמשים גם לאימון. עליו רצים מודלי Gemini, ולקוחות משתמשים בו דרך הענן של גוגל כחלופה למעבדים גרפיים.
💡 דוגמה
כששולחים שאלה לשירות Gemini שפועל בענן, התשובה לא מחושבת בטלפון אלא במרכז נתונים של גוגל.
שם היא רצה, בין השאר, על שבבי TPU — שבבים שגוגל בנתה במיוחד בשביל מודלים כאלה.
שבב שגוגל בנתה לעצמה
TPU, ראשי תיבות של Tensor Processing Unit, הוא שבב שגוגל מתכננת כדי להריץ רשתות נוירונים, ובהמשך גם לאמן אותן. "טנזור" הוא שם כללי לטבלת מספרים בכמה ממדים, וזה בדיוק סוג הנתונים שרשת נוירונים מעבדת. לפי המאמר הטכני שפרסמה גוגל ב-2017, השבב פועל במרכזי הנתונים שלה מאז 2015. גוגל חשפה אותו בכנס Google I/O במאי 2016, ולפי ויקיפדיה אמרה אז שהוא פועל אצלה כבר יותר משנה; הוא שימש, בין השאר, בקרבות של AlphaGo מול אלוף הגו לי סה-דול. הערך על חומרה לבינה מלאכותית מציג את ה-TPU לצד מעבדים גרפיים, מאיצים עצביים בטלפון ומחשוב נוירומורפי. הערך הזה מתמקד ב-TPU עצמו: איך הוא בנוי, איך התפתח, ולמה גם חברות AI גדולות מחוץ לגוגל משתמשות בו.
מה יש בפנים: מערך של מכפילים
רוב העבודה של רשת נוירונים היא הכפלת מטריצות — טבלאות גדולות של מספרים. ה-TPU בנוי סביב רכיב אחד שעושה בדיוק את זה. לפי המאמר של גוגל מ-2017, הלב של הדור הראשון היה יחידה עם 65,536 יחידות כפל-וחיבור של 8 ביט, שעובדות יחד, לצד זיכרון פנימי של 28 MiB (יחידת נפח בינארית). היחידה בנויה כמערך סיסטולי (systolic array): המספרים זורמים ממכפיל למכפיל כמו גל, בלי לחזור לזיכרון אחרי כל פעולה. לפי תיעוד גוגל קלאוד, יחידת ההכפלה בשבבים שהוא מתאר היא מערך סיסטולי של 128 על 128. הכוח הזה בא עם מחיר: השבב פחות גמיש ממעבד רגיל. קוד שרץ על TPU צריך לעבור קודם דרך מהדר מיוחד בשם XLA, שמתרגם את המודל לפעולות שהשבב מבין. המאמר מ-2017 מסביר שהוויתור על מנגנונים שמעבדים רגילים ומעבדים גרפיים משתמשים בהם הוא חלק מהסיבה שהשבב קטן וחסכוני יחסית.
מהרצת מודלים גם לאימון שלהם
הדור הראשון נועד רק להסקה, כלומר להרצת מודל שכבר אומן. לפי המאמר של גוגל, בעומסי העבודה האמיתיים שנבדקו הוא היה מהיר בממוצע פי 15 עד 30 מהמעבד הגרפי של אנבידיה ומהמעבד של אינטל, בני זמנו, שנכללו במחקר — וביצועיו לכל ואט היו גבוהים פי 30 עד 80. הדור השני, שהוכרז במאי 2017, הוסיף לפי ויקיפדיה חישוב בנקודה צפה — מספרים עם שבר, לא רק מספרים שלמים — וכך התאים גם לאימון מודלים. מאז השבבים מחוברים ל"פודים": קבוצות של שבבים — מאות ועד אלפים, לפי הדור והתצורה — שמקושרים ברשת מהירה ועובדים יחד. ב-2021 סיפר מנכ"ל גוגל סונדאר פיצ'אי שפוד של הדור הרביעי מכיל 4,096 שבבים. באפריל 2025 הציגה גוגל את הדור השביעי, Ironwood, שתוכנן במיוחד להרצת מודלים: פוד שלו מגיע ל-9,216 שבבים. באפריל 2026 הכריזה על הדור השמיני, שבפעם הראשונה מתפצל לשני שבבים — TPU 8t, שמותאם בעיקר לאימון, ו-TPU 8i, שמותאם בעיקר להרצה מהירה, לסוכני AI ולמודלים שמנמקים. גוגל מציינת ששני השבבים יכולים להריץ גם עבודות אחרות, אבל ההתמחות משפרת את היעילות. גוגל כתבה שהשבבים יהיו זמינים באופן כללי בהמשך 2026.
מתי TPU ומתי מעבד גרפי
גוגל עצמה לא טוענת שה-TPU מתאים לכל דבר. בתיעוד של גוגל קלאוד מופיעה רשימה מפורשת. TPU מתאים למודלים שרובם הכפלות מטריצות, למודלים גדולים שמתאמנים במשך שבועות או חודשים, ולמערכות המלצה ודירוג עם טבלאות ענק. הוא לא מתאים לחישובים עם הרבה הסתעפויות של "אם-אז", לחישובים שדורשים אריתמטיקה בדיוק מספרי גבוה, ולמודלים עם פעולות מותאמות אישית בלב לולאת האימון — שם התיעוד ממליץ על מעבדים גרפיים או רגילים. הגישה של גוגל שונה מזו של מעבד כללי: לפי החברה, היא מתכננת את השבב יחד עם הרשת, התוכנה ואפילו המודלים שירוצו עליו, וזו לדבריה הסיבה ליעילות שלו. לקוחות חיצוניים משתמשים בו דרך הענן של גוגל. לפי ויקיפדיה, Broadcom היא שותפה בפיתוח השבבים ומתרגמת את התכנון של גוגל לשבב שאפשר לייצר.
איך פוגשים TPU בלי להיות גוגל
לפי ויקיפדיה, בפברואר 2018 פתחה גוגל את השבבים לחברות אחרות דרך שירות הענן שלה, ואפשר להשתמש בהם גם במחברות של Google Colab ושל Kaggle — כך שגם סטודנט יכול להריץ קוד על TPU. לצד השבבים הגדולים יש גם משפחה קטנה: ב-2018 הכריזה גוגל על Edge TPU, שבב זעיר להרצת מודלים במכשירים, ובהמשך שילבה גרסה שלו בטלפוני פיקסל. מחוץ לגוגל, גם לקוחות גדולים מאמצים את השבב. באוקטובר 2025 הודיעה אנת'רופיק, החברה שמפתחת את Claude, שתרחיב את השימוש שלה ב-TPU עד מיליון שבבים, בעסקה בשווי עשרות מיליארדי דולרים שצפויה להוסיף ב-2026 הרבה יותר מגיגה-ואט של כוח מחשוב. באפריל 2026 חתמה אנת'רופיק על הסכם נוסף עם גוגל ו-Broadcom, לכמה גיגה-ואט של TPU מהדור הבא שצפויים לפעול החל מ-2027. אנת'רופיק מציינת שהיא מאמנת ומריצה את Claude על שלושה סוגי שבבים: TPU של גוגל, Trainium של אמזון ומעבדים גרפיים של אנבידיה.
לאן זה הולך: עננים חדשים, ואפילו חלל
ב-2026 הוכרזו תוכניות לדרכים נוספות להגיע ל-TPU, וגם ניסויים חריגים. במאי 2026 הודיעה גוגל על מיזם משותף עם חברת ההשקעות בלקסטון להקמת ענן TPU חדש: בלקסטון מתחייבת בשלב ראשון ל-5 מיליארד דולר, והיעד הוא כ-500 מגה-ואט של כוח מחשוב שיפעל ב-2027, כשגוגל מספקת את השבבים, התוכנה והשירותים. וב-1 באוקטובר 2026 שוגר לחלל לוויין אב טיפוס של פרויקט Suncatcher של גוגל, שנבנה עם החברה Planet. לפי גוגל, במשך כמה שבועות ייאספו נתונים על האופן שבו שבבי ה-TPU עומדים בעומס הפיזי של הטיסה לחלל, בקרינה ובטמפרטורות הקיצוניות בחלל — צעד ראשון במחקר ארוך טווח שבודק אם יום אחד אפשר יהיה להפעיל תשתית AI גדולה מחוץ לכדור הארץ. נכון לאוקטובר 2026, ה-TPU הוא תשתית שפועלת מאחורי הקלעים: מי שמשתמש ב-Gemini או ב-Claude לא רואה אותו, אבל ייתכן שהתשובה שקיבל חושבה עליו.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| דור ראשון | דור שני | דור שביעי: Ironwood | דור שמיני | |
|---|---|---|---|---|
| מתי | בשימוש בגוגל מ-2015 | הוכרז במאי 2017 | הוכרז באפריל 2025 | הוכרז באפריל 2026 |
| למה נועד | רק להרצת מודלים | גם לאימון | בעיקר להרצת מודלים | שני שבבים: אחד מותאם בעיקר לאימון, השני להרצה |
| נתון בולט | 65,536 יחידות כפל-וחיבור של 8 ביט | פוד של 256 שבבים | עד 9,216 שבבים בפוד | עד 9,600 שבבים בפוד של שבב האימון |
שאלות נפוצות ❓
מה ההבדל בין TPU ל-GPU?
המעבד הגרפי (GPU) הוא שבב כללי יחסית שנולד בעולם הגרפיקה ונמכר לכל מי שרוצה. ה-TPU הוא שבב ייעודי של גוגל, שבנוי סביב יחידות להכפלת מטריצות, ומתאים במיוחד למודלים גדולים — אבל פחות גמיש, ולקוחות חיצוניים משתמשים בו דרך הענן של גוגל.
אפשר לקנות TPU ולהתקין במחשב בבית?
את השבבים הגדולים — לא; משתמשים בהם דרך הענן של גוגל, או במחברות של Colab ו-Kaggle. גוגל כן מכרה שבב קטן, Edge TPU, להרצת מודלים במכשירים, ושילבה גרסה שלו בטלפוני פיקסל.
מי משתמש ב-TPU חוץ מגוגל?
לקוחות הענן של גוגל. הבולטת שבהם היא אנת'רופיק, שהודיעה ב-2025 על שימוש בעד מיליון TPU, וב-2026 על הסכם נוסף לכמה גיגה-ואט של שבבים מהדור הבא.
מה זה "פוד"?
קבוצה של שבבי TPU שמחוברים ברשת מהירה במיוחד ועובדים יחד. מספר השבבים תלוי בדור ובתצורה: בדור השני היו בפוד 256 שבבים, ובדור השביעי הוא יכול להגיע ל-9,216.
למה ה-TPU של הדור השמיני מתפצל לשני שבבים?
לפי גוגל, אימון מודל ענק והרצה מהירה של מודלים וסוכנים דורשים דברים שונים: האימון צריך כוח חישוב גולמי, וההרצה צריכה בעיקר זיכרון מהיר. לכן TPU 8t מותאם בעיקר לאימון ו-TPU 8i בעיקר להרצה, אף ששניהם יכולים לשמש גם לעבודות אחרות.