עלות הסקה בישראל: ענן מול הרצה מקומית (Inference Cost in Israel)

נתוני AI

הגדרה

דף נתונים מתוארך על מה שעולה להריץ מודל בינה מלאכותית מישראל: מחירי טוקנים, שרתי GPU באזור הענן בתל אביב, ותעריף החשמל להרצה מקומית, נכון לספטמבר 2026.

מה הדף מודד, ואיזה סוג מספר מופיע בו

הסקה (Inference) היא הרצת מודל שכבר אומן כדי לקבל ממנו תשובה, ובה משלמים על כל שימוש. לארגון או לאדם בישראל יש שלוש דרכים עיקריות לשלם עליה: לקנות גישה למודל של ספק לפי טוקנים, לשכור שרת עם מעבד גרפי (GPU) בענן, או להריץ מודל בעל משקלים פתוחים על מחשב משלו ולשלם על החומרה ועל החשמל. הדף מרכז את הנתונים הרשמיים שאפשר לתארך לכל אחת מהדרכים, נכון לבדיקה ב-27 בספטמבר 2026. חשוב להבחין בין סוגי המספרים: מחיר מחירון שספק מפרסם הוא הצעת מחיר, לא מדידה של מה שארגון משלם בפועל אחרי הנחות והתחייבויות; תעריף חשמל שקבעה רשות החשמל הוא נתון רשמי מחייב; הספק של כרטיס גרפי הוא מפרט יצרן, לא צריכה שנמדדה בזמן עבודה; ונתונים עולמיים על אנרגיה ומים הם לרוב אומדנים. מדידה ציבורית ומתוארכת של עלות תשובה אחת או של זמן התגובה ממשתמש בישראל אל ספקי המודלים אינה בין המקורות הרשמיים שבדף, ולכן הוא אינו נוקב במספר כזה.

מסלול הממשק: מחיר לטוקן, בדולרים

ספקי המודלים הגדולים מתמחרים גישה לפי טוקנים, בדולרים, בנפרד לקלט ולפלט. בדף התמחור של Anthropic, כפי שנבדק ב-27.9.2026, Claude Haiku 4.5 מתומחר ב-1 דולר למיליון טוקני קלט וב-5 דולר למיליון טוקני פלט. לפי אותו דף, הממשק הישיר של החברה גלובלי כברירת מחדל, והאפשרות המתוארת בו לתחום את ההרצה גאוגרפית היא הרצה בארצות הברית בלבד, שמוסיפה מכפיל של 1.1 לכל מחירי הטוקנים בדגמי Claude 4.6 ואילך; בדגמים מוקדמים יותר, ובהם Haiku 4.5 שמחירו הובא כאן, האפשרות הזו אינה נתמכת. בפלטפורמות הענן Amazon Bedrock ו-Google Cloud, לדגמי Claude מדור 4.5 ואילך, נקודות קצה אזוריות נושאות תוספת של 10% על פני נקודות קצה גלובליות. מחיר הטוקן אינו תלוי במיקום המשתמש, אבל מספר הטוקנים תלוי בשפה: לפי מאמר DictaLM 2.0 מ-2024, הטוקנייזר של Mistral, שעליו נבנה המודל, פירק מילה עברית ל-5.81 טוקנים בממוצע; זו מדידה של טוקנייזר אחד, לא של הטוקנייזרים של הספקים שמחיריהם מובאים כאן. לכן אותה משימה בעברית עשויה לעלות יותר מאשר באנגלית, והדרך לדעת היא למדוד את מספר הטוקנים על טקסטים אמיתיים, כפי שמוסבר בערך הערכת מודלי שפה בעברית.

שרת GPU באזור הענן בתל אביב

אזור הענן של AWS בתל אביב, il-central-1, נפתח לציבור ב-1 באוגוסט 2023 עם שלושה אזורי זמינות. בהודעת הפתיחה כתבה AWS שהאזור מאפשר לאחסן נתונים בישראל ולשרת משתמשים סמוכים "בזמן תגובה נמוך אף יותר" — טענה של הספק, בלי מספר. בפתיחה הוצעו באזור שרתי G5, ושרתי P4de רק בתצוגה מקדימה. לפי נתוני המחירון של AWS לשרתים לפי דרישה עם Linux, שפורסמו ב-25 בספטמבר 2026, משפחות השרתים עם GPU שהופיעו באזור תל אביב היו G5 ו-P4de בלבד, בעוד שבאזור צפון וירג'יניה הופיעו משפחות רבות נוספות, ובהן P5. השרת הקטן במשפחת G5, g5.xlarge, כולל לפי AWS מעבד NVIDIA A10G אחד עם 24GB זיכרון, ומחירו לפי דרישה היה כ-1.18 דולר לשעה בתל אביב, כ-1.01 דולר בצפון וירג'יניה וכ-1.26 דולר בפרנקפורט. אלה מחירי מחירון, ולפי AWS מחיריה אינם כוללים מסים כמו מע"מ; הם גם אינם כוללים הנחות של התחייבות לטווח ארוך או שרתים עודפים במחיר מוזל, ואינם כוללים אחסון ותעבורת רשת.

הרצה מקומית: תעריף החשמל הישראלי

מי שמריץ מודל על מחשב משלו אינו משלם לפי טוקן, אלא על החומרה ועל החשמל. לפי ספר התעריפים של רשות החשמל, התעריף האחיד לצרכן ביתי מ-1 ביולי 2026 הוא 53.83 אגורות לקוט"ש ברכיב המשתנה, לעומת 54.51 אגורות בספר של ינואר 2026. הרשות מפרקת את התעריף הביתי לרכיב ייצור של 31.12 אגורות, רכיב מערכתי של 9.29 ורכיב רשת של 13.42, ומציינת שהתעריפים המחייבים הם אלה שנקבעו בהחלטותיה. לצד התעריף האחיד קיימים תעריפי תעו"ז, שבהם המחיר משתנה לפי שעה ועונה, גם לצרכנים ביתיים. בצד החומרה, לפי המפרט של NVIDIA, הכרטיס הגרפי הביתי GeForce RTX 5090 מוגדר להספק כולל של 575 וואט, ונדרש לו ספק כוח של 1,000 וואט למערכת כולה. אלה נתוני מפרט של היצרן, לא צריכה שנמדדה בזמן הרצת מודל. עלות החשמל של שעת עבודה היא ההספק בקילוואט כפול התעריף, אבל מחיר המחשב עצמו מתפזר על פני כל שנות השימוש בו, ולכן ההשוואה לענן היא שאלה של עלות בעלות כוללת. יתרון אחר אינו כספי: לפי השאלות הנפוצות של Ollama, כשמודל רץ מקומית החברה אינה רואה את הפרומפטים ואת הנתונים.

מדידות מול אומדנים בנתונים העולמיים

נתוני העלות והאנרגיה של הסקה שמצוטטים בכותרות הם ברובם עולמיים, וחלקם אומדנים. דוח מדד ה-AI של אוניברסיטת סטנפורד, מהדורת 2026, מדווח בפרק המחקר והפיתוח שקיבולת החשמל של מרכזי נתונים ל-AI עלתה ל-29.6 גיגה-וואט, בסדר גודל של מדינת ניו יורק בשיא הביקוש. באותו פרק מופיעים גם אומדנים מפורשים: פליטות האימון של Grok 4 מוצגות כהערכה, והדוח כותב שצריכת המים השנתית של הרצת GPT-4o לבדה "עשויה לעלות" על צורכי מי השתייה של 1.2 מיליון בני אדם. ניסוח כזה מסמן אומדן ולא מדידה. הירידה במחיר ההסקה לרמת ביצועים קבועה, שנמדדה בדוחות קודמים, מתוארת בערך מגמת עלות ההרצה, והערכות האנרגיה לשאילתה בודדת מתוארות בערך צריכת האנרגיה של שאילתה בודדת. אף אחד מהמספרים האלה אינו מתרגם ישירות לחשבון של משתמש בישראל, שמשלם בדולרים לספק זר או באגורות לחברת החשמל.

איך להשתמש בנתונים האלה

שלושת המסלולים נמדדים ביחידות שונות — דולר למיליון טוקנים, דולר לשעת שרת ואגורות לקוט"ש — ולכן אי אפשר להשוות ביניהם בלי הנחות על המשימה: כמה טוקנים היא צורכת, כמה בקשות רצות בשעה, וכמה שעות השרת או המחשב פועל. גם שער החליפין בין דולר לשקל משתנה, וההשוואה נכונה רק לתאריך מסוים. הנתונים בדף הזה משתנים: מחירי הספקים מתעדכנים ללא הודעה מוקדמת, ספר התעריפים של רשות החשמל מינואר 2026 החליף ספר מיולי 2025, והוחלף בעצמו בספר של יולי 2026, ורשימת השרתים הזמינים באזור תל אביב עשויה להתרחב. מי שמחליט בין ענן להרצה מקומית נדרש גם לשיקולים שאינם במחיר — איפה הנתונים נשמרים, מה זמן התגובה בפועל, ומה איכות המודל בעברית — שנדונים בערך בחירת מודל למשימה.

מחיר לפי דרישה לשעת שרת GPU ב-AWS, לפי אזור (Linux, דולר, נתוני מחירון מ-25.9.2026)
תל אביבצפון וירג'יניהפרנקפורט
g5.xlarge (מעבד A10G אחד)1.1791.0061.258
p4de.24xlarge35.57327.44734.291
משפחות G6 ו-G6eלא הופיעוהופיעוהופיעו
משפחות P5 ו-P6לא הופיעוהופיעולא הופיעו

שאלות נפוצות ❓

כמה עולה שעת שרת GPU בענן בתל אביב?

לפי נתוני המחירון של AWS מ-25.9.2026, השרת g5.xlarge, עם מעבד NVIDIA A10G אחד, עלה לפי דרישה כ-1.18 דולר לשעה באזור תל אביב. זה מחיר מחירון לפני מס, בלי הנחות, אחסון ותעבורה.

כמה עולה קוט"ש חשמל בבית בישראל?

לפי ספר התעריפים של רשות החשמל, התעריף האחיד לצרכן ביתי מ-1 ביולי 2026 הוא 53.83 אגורות לקוט"ש ברכיב המשתנה. בינואר 2026 הוא עמד על 54.51 אגורות.

האם אפשר לבחור שהמודל ירוץ בישראל?

בדף התמחור של Anthropic, כפי שנבדק ב-27.9.2026, האפשרות המתוארת לתחום את ההרצה גאוגרפית בממשק הישיר היא ארצות הברית בלבד, בתוספת מכפיל של 1.1. מודל בעל משקלים פתוחים אפשר להריץ על שרת באזור תל אביב של ספק ענן או על מחשב מקומי.

למה עברית עלולה לעלות יותר בממשק לפי טוקנים?

כי המחיר הוא לטוקן, וטקסט עברי מתפרק לעיתים קרובות ליותר טוקנים. לפי מאמר DictaLM 2.0, למשל, הטוקנייזר של Mistral פירק מילה עברית ל-5.81 טוקנים בממוצע; אצל ספקים אחרים היחס שונה, וכדאי למדוד אותו.

יש מדידה של זמן התגובה ממשתמש בישראל למודלים בענן?

הדף אינו מביא מספר כזה, כי מדידה ציבורית ומתוארכת כזו אינה בין המקורות הרשמיים שבו. AWS טוענת שהאזור בתל אביב מאפשר זמן תגובה נמוך יותר למשתמשים סמוכים, אבל אינה נוקבת במספר.