דלג לתוכן

כוח חישוב (AI Compute)

יסודות בינה מלאכותית

הגדרה

כוח חישוב (Compute) הוא כמות פעולות החישוב שמודל AI צורך — באימון ובכל פעם שהוא עונה — ונמדד ב-FLOP; לצד נתונים ואלגוריתמים, הוא אחד משלושת המשאבים שקובעים מה מודל יכול לעשות.

💡 דוגמה

כמו קילוואט-שעה בחשבון החשמל: לא שואלים כמה גדול המזגן, אלא כמה עבודה הוא עשה בפועל.

כוח חישוב סופר כמה חישובים מודל ביצע — באימון, ובכל פעם שהוא עונה לכם.

מה סופרים כשמדברים על "כוח חישוב"

בעולם הבינה המלאכותית, המילה האנגלית Compute — בעברית "כוח חישוב" או פשוט "חישוב" — מתארת, לפי ויקיפדיה, את "כמות כוח המחשוב או משאבי המחשוב הנדרשים כדי לאמן מודלים של למידת מכונה ומודלי שפה גדולים". בהקשר של מחשוב ענן משתמשים במילה במובן רחב יותר, שכולל גם זיכרון, רשת ואחסון. אבל כשמדברים על אימון מודלים, בדרך כלל מתכוונים לדבר אחד: כמה פעולות חשבון בוצעו בפועל.

בן ביוקנן (Ben Buchanan) ממכון המחקר CSET באוניברסיטת ג'ורג'טאון תיאר ב-2020 את ה-AI כנשען על "שלישייה": נתונים, אלגוריתמים וכוח חישוב. ההבחנה חשובה, כי שלושת המשאבים מתבלבלים בקלות. מספר הפרמטרים אומר כמה גדול המודל; כמות הנתונים אומרת על כמה טקסט או תמונות הוא למד; כוח החישוב אומר כמה עבודה נדרשה כדי לאמן אותו או להריץ אותו. שני מודלים באותו גודל יכולים לצרוך כמויות חישוב שונות מאוד. הערך על קצב הגידול בכוח החישוב לאימון מפרט את המדידות העדכניות; הערך הזה מסביר את המושג עצמו.

FLOP, FLOP לשנייה ופטה-פלופ-יום

יחידת המידה הבסיסית היא FLOP — פעולה אחת על מספר עשרוני (floating point), כמו כפל או חיבור. לפי מכון המחקר Epoch AI, פעולה משולבת של כפל וחיבור נספרת לפי המוסכמה כשתי פעולות. חשוב לא לבלבל בין שני דברים שנשמעים דומה: FLOP הוא כמות — כמה עבודה נעשתה; FLOP לשנייה הוא קצב — כמה מהר חומרה מסוימת יכולה לעבוד. זה ההבדל בין קילוואט-שעה, שמופיע בחשבון החשמל, לבין קילוואט, שכתוב על המזגן.

המספרים עצומים, ולכן משתמשים גם ביחידות גדולות יותר. ויקיפדיה מתארת את "פטה-פלופ/שנייה-יום": ביצוע של 10 בחזקת 15 פעולות בכל שנייה במשך יממה שלמה, כ-10 בחזקת 20 פעולות בסך הכול — ומשווה אותה במפורש לקילוואט-שעה באנרגיה. Epoch AI מתארת שתי דרכים להעריך כמה חישוב נדרש לאימון: לספור את הפעולות לפי מבנה המודל וכמות הנתונים, או להכפיל את זמן האימון במספר המעבדים, במהירות השיא שלהם ובשיעור הניצול בפועל — כי לפי Epoch AI, שבבים כמעט אף פעם לא עובדים במהירות השיא שכתובה במפרט, ובמודלי שפה גדולים המכון ממליץ להניח ניצול של כ-30%. בספירה הראשונה מניחים שהשלב שבו המודל מתקן את עצמו צורך בערך פי שניים פעולות מהשלב שבו הוא מחשב תשובה.

אימון, הרצה ו"זמן חשיבה"

כוח חישוב נצרך בשני רגעים שונים. חישוב האימון משולם פעם אחת, כשהמודל לומד. חישוב ההרצה, או ההסקה, משולם מחדש בכל פעם שמישהו שואל את המודל שאלה — ובמודל שמשרת מיליוני משתמשים, הסכום הזה מצטבר מהר.

בספטמבר 2024 התחדד ההבדל הזה. OpenAI הציגה ב-12 בספטמבר את גרסת התצוגה של o1, מודל ש"מקדיש זמן לחשוב לפני שהוא עונה". לפי ויקיפדיה, הבדיקות של החברה הראו "מתאם בין הדיוק לבין הלוגריתם של כמות החישוב שהושקעה בחשיבה לפני התשובה". מירה מוראטי מ-OpenAI כינתה זאת "פרדיגמה חדשה ונוספת": במקום לשפר מודל רק בעזרת עוד חישוב באימון, אפשר לשפר את התשובה בעזרת עוד חישוב בזמן ההרצה. המשמעות המעשית: תשובה ש"חושבת" יותר צורכת יותר חישוב, ולכן עולה יותר. הערך על מודל-הנמקה מרחיב על הסוג הזה של מודלים.

עוד חישוב, עוד יכולת

הסיבה שכולם מדברים על כוח חישוב היא שהוא התברר כאחד המנועים החזקים של ההתקדמות. לפי ויקיפדיה, עד 2012 כמות החישוב באימון מודלים גדלה בערך בקצב של חוק מור, שמכפיל את עצמו כל שנתיים. בין 2012 ל-2018 היא גדלה פי יותר מ-300,000, והכפילה את עצמה בערך כל 3.4 חודשים.

את ההיגיון הזה ניסח ריצ'רד סאטון במאמר "הלקח המר" מ-13 במרץ 2019: לדבריו, הלקח הגדול מ-70 שנות מחקר AI הוא ש"שיטות כלליות שמנצלות חישוב הן בסופו של דבר היעילות ביותר, ובפער גדול". בינואר 2020 פרסמו ג'ארד קפלן ועמיתיו את המאמר על חוקי קנה המידה, שמצא שהשגיאה של מודלי שפה יורדת באופן צפוי, לפי חוק חזקה, ככל שמגדילים את גודל המודל, את כמות הנתונים ואת כמות החישוב באימון. הצד השני של אותה מטבע הוא המחיר: חישוב דורש שבבים, מרכזי נתונים וחשמל, ולכן הוא גם אחד הגורמים העיקריים לעלות של פיתוח מודלים.

למה מדינות ורגולטורים מתעניינים בו

קשה לפקח על אלגוריתם או על נתונים, אבל כוח חישוב הוא דבר פיזי. מאמר של קבוצת חוקרים מ-2024, "Computing Power and the Governance of Artificial Intelligence", מונה ארבע תכונות שהופכות אותו לנקודת אחיזה לרגולציה: אפשר לזהות את השימוש בו, אפשר למנוע גישה אליו, אפשר למדוד אותו, והוא מיוצר ב"שרשרת אספקה מרוכזת ביותר" של מעט חברות. אותם חוקרים גם מזהירים שגישה פשטנית לפיקוח על חישוב עלולה לפגוע בפרטיות, בכלכלה ולרכז כוח בידיים מעטות.

הדוגמה המוכרת היא חוק ה-AI של האיחוד האירופי: לפי סעיף 51, כשכמות החישוב המצטברת באימון של מודל כללי עולה על 10 בחזקת 25 פעולות, קמה חזקה שיש לו "יכולות בעלות השפעה גבוהה" — כלומר, זו נקודת מוצא שאפשר לסתור, לא הגדרה אוטומטית. הערך על סף-חישוב רגולטורי מפרט את הספים השונים ואת הביקורת עליהם.

פער החישוב בין האקדמיה לתעשייה

מאחר שחישוב יקר, הוא מתרכז אצל מי שיכול לממן אותו. מחקר שפורסם בינואר 2024, "The Compute Divide in Machine Learning", תיעד פער בין מעבדות התעשייה למעבדות האקדמיה, ומצא שהפער הזה התרחש במקביל לירידה בחלקם של צוותים אקדמיים בלבד בנושאי המחקר שדורשים הרבה חישוב, ובמיוחד במודלי בסיס. החוקרים הזהירו שהדבר פוגע ביכולת של גורמים חיצוניים לבדוק את המודלים המשפיעים ביותר, והמליצו על תשתית מחשוב לאומית לצד יוזמות של מדע פתוח.

לפי ויקיפדיה, מקבלי החלטות במדינות שונות אכן קבעו מדיניות שמטרתה להרחיב את הגישה של חוקרים מקומיים לכוח חישוב. בארצות הברית, למשל, קרן המדע הלאומית (NSF) הקימה ב-2024 את NAIRR כתוכנית ניסיונית, שמעניקה לחוקרים גישה לחישוב, לתוכנה, לנתונים ולמודלים; לתוכנית יש ערך נפרד באתר.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה ההבדל בין כוח חישוב למספר הפרמטרים?

מספר הפרמטרים מתאר כמה גדול המודל. כוח החישוב מתאר כמה עבודה נדרשה כדי לאמן אותו או להריץ אותו. מודל באותו גודל שלמד על יותר נתונים צרך יותר חישוב.

מה זה FLOP?

פעולת חשבון אחת על מספר עשרוני, כמו כפל או חיבור. סופרים כמה פעולות כאלה בוצעו כדי למדוד כמה חישוב מודל צרך.

למה מודלי הנמקה יקרים יותר להרצה?

כי הם משקיעים חישוב נוסף ב"חשיבה" לפני כל תשובה. לפי OpenAI, הדיוק של o1 עלה ככל שהושקע יותר חישוב בשלב הזה.

למה הרגולציה מתמקדת בכוח חישוב?

כי הוא דבר פיזי שאפשר למדוד ולעקוב אחריו, בניגוד לאלגוריתם. בחוק ה-AI האירופי, למשל, מודל שאומן ביותר מ-10 בחזקת 25 פעולות נחשב, כנקודת מוצא שאפשר לסתור, למודל בעל השפעה גבוהה.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו