Ollama — תוכנה בקוד פתוח להרצת מודלי-שפה על המחשב שלכם
הגדרה
Ollama היא תוכנה בקוד פתוח (רישיון MIT) להורדה ולהרצה של מודלי-שפה פתוחים ישירות על המחשב האישי, עם חלון צ'אט, שורת-פקודה וממשק תכנות — ומאז 2025 גם עם אפשרות להריץ מודלים גדולים בענן.
💡 דוגמה
במקום לשלוח שאלה לשרת של חברה בחו"ל, מתקינים תוכנה אחת, כותבים פקודה קצרה, ומודל-שפה עונה לכם ישירות מהמחשב בבית.
השאלות שלכם לא יוצאות מהמחשב, כל עוד בוחרים מודל מקומי ולא מודל ענן.
מה זה Ollama: מודל-שפה שרץ אצלכם
Ollama היא תוכנה בקוד פתוח להרצת מודלי-שפה גדולים ישירות על המחשב של המשתמש, במקום לשלוח כל שאלה לשרת של חברה אחרת. ויקיפדיה מתארת אותה כ"פלטפורמת תוכנה בקוד פתוח להרצה ולניהול של מודלי-שפה גדולים על תשתית GPU מקומית ובאמצעות מודלים מתארחים בענן". היא פועלת על macOS, לינוקס ו-Windows, מופצת ברישיון MIT, וכוללת ממשק שורת-פקודה, אפליקציה גרפית, ממשק תכנות (REST API) וכלים לניהול מודלים. לפי TechCrunch, הרעיון המרכזי הוא לאפשר למפתחים להריץ מודלים בעלי משקלים פתוחים על המחשב האישי ו"להעלות אותם לאוויר בתוך דקות". בפועל, Ollama ממלאת שני תפקידים יחד: היא גם מעין חנות שממנה מורידים מודלים, וגם המנוע שטוען אותם לזיכרון ומאפשר לשוחח איתם. בין המודלים שאפשר להריץ בה מקומית ויקיפדיה מונה את Llama, Gemma, Mistral, Qwen, gpt-oss, GLM ו-DeepSeek. כל אלה מודלים שהיוצרים שלהם פרסמו את המשקלים לציבור, ולכן אפשר להוריד אותם ולהריץ אותם בבית.
מי עומד מאחוריה, וכמה כסף גויס
את Ollama פיתחו ג'פרי מורגן ומייקל צ'יאנג, והגרסה הראשונה שלה פורסמה ב-8 ביולי 2023. לפי TechCrunch, לפני כן השניים עבדו ב-Docker ועזרו לבנות את Docker Desktop, אחרי ש-Docker רכשה את הסטארט-אפ הקודם שלהם, Kitematic. מורגן, מנכ"ל החברה, הסביר את נקודת המוצא: "מודלים פתוחים התחילו לצאת ב-2023, אבל היה ממש קשה להשתמש בהם". ב-9 ביולי 2026 הודיעה Ollama על גיוס של 65 מיליון דולר בסבב B בהובלת קרן Theory Ventures, בהשתתפות Benchmark, 8VC, Y Combinator ומשקיעים נוספים. לפי TechCrunch, סבב A הקודם, של 15 מיליון דולר, הובל בידי Benchmark, וסך הגיוסים של החברה הגיע ל-88 מיליון דולר. באותה כתבה צוין שבחברה עובדים 14 אנשים בלבד — מספר קטן מאוד לכלי בהיקף שימוש כזה. פיטר פנטון מ-Benchmark הדגיש שבמוצר הבסיסי, "שחינמי על המחשב השולחני", לא השתנה דבר. באותה כתבה הזכירה TechCrunch חברות נוספות שקמו סביב כלי קוד פתוח להרצת מודלים, כמו Inferact, שעומדת מאחורי vLLM, ו-RadixArk, שעומדת מאחורי SGLang — סימן לכך שהמשקיעים רואים בתחום הזה שוק בפני עצמו.
כמה משתמשים, ומה המספרים אומרים
Ollama הפכה לאחד הכלים הנפוצים ביותר להרצת מודלים מקומית. לפי TechCrunch, ביולי 2026 השתמשו בה יותר מ-8.9 מיליון מפתחים בחודש, וצוותים ב-85% מחברות Fortune 500 עושים בה שימוש. למאגר הקוד שלה ב-GitHub היו באותו זמן 176,000 כוכבים וכמעט 17,000 פיצולים, ובתחילת אוקטובר 2026 הציג המאגר כ-182 אלף כוכבים. כדאי לקרוא את המספרים האלה בזהירות: נתוני המשתמשים מגיעים מהחברה עצמה, בהקשר של הודעה על גיוס כסף, ולא ממדידה עצמאית. כוכב ב-GitHub מעיד על עניין של מפתחים, ולא בהכרח על שימוש קבוע. ובכל זאת, התמונה הכללית עקבית: כלי שפיתחו שני מפתחים ב-2023 הפך לנקודת כניסה מרכזית לעולם המודלים הפתוחים, ולמשהו שכלים אחרים מתחברים אליו.
איך משתמשים בה: פקודה אחת או חלון צ'אט
השימוש הבסיסי פשוט במיוחד. אחרי ההתקנה כותבים בחלון הפקודות פקודה כמו ollama run gemma4, ו-Ollama מורידה את המודל, אם הוא עוד לא נמצא במחשב, ופותחת שיחה איתו. המודלים נשמרים בתיקייה מקומית — ב-macOS, למשל, בתיקייה ~/.ollama/models, וב-Windows בתיקייה .ollama\models שבתיקיית המשתמש. מי שרוצה לשמור אותם בכונן אחר, למשל בגלל שהמודלים תופסים הרבה מקום, יכול לשנות את המיקום בהגדרה OLLAMA_MODELS. מי שלא רוצה לעבוד מול חלון פקודות יכול להשתמש באפליקציה הגרפית: ב-30 ביולי 2025 השיקה Ollama אפליקציה חדשה ל-macOS ול-Windows, עם חלון צ'אט, אפשרות לגרור לתוכה קבצי טקסט ו-PDF, תמיכה בתמונות במודלים שיודעים לקרוא אותן, והגדרה של אורך ההקשר — כמה טקסט המודל מחזיק בזיכרון בבת אחת. החברה מזהירה שהגדלת אורך ההקשר דורשת יותר זיכרון. לפי מסמך השאלות הנפוצות הרשמי, מודל שנטען נשאר בזיכרון חמש דקות כברירת מחדל ואז משתחרר, כדי לפנות את משאבי המחשב לתוכנות אחרות. את משך הזמן הזה אפשר לשנות בהגדרות.
ממשק למתכנתים: מנוע שכלים אחרים נשענים עליו
מה שהפך את Ollama לפופולרית במיוחד בקרב מפתחים הוא ממשק התכנות שלה. Ollama רצה ברקע כשרת מקומי, שמאזין כברירת מחדל בכתובת 127.0.0.1 ובפורט 11434, ותוכנות אחרות באותו מחשב יכולות לשלוח אליו שאלות ולקבל תשובות. כבר בהשקת הגרסה ל-Windows, בפברואר 2024, הדגישה החברה תאימות לממשק של OpenAI. המשמעות: תוכנה שנכתבה עבור שירות ענן יכולה לעבור למודל מקומי בשינוי קטן של כתובת. ב-16 בינואר 2026 נוספה תאימות לממשק של Anthropic, וב-23 בינואר 2026 נוספה פקודה שמחברת את Ollama לכלי תכנות כמו Claude Code, OpenCode ו-Codex. ב-16 בפברואר 2026 הורחב החיבור ל-Claude Code עם תמיכה בסוכני-משנה ובחיפוש ברשת. גם יצרניות המודלים עצמן רואות ב-Ollama ערוץ הפצה: ב-5 באוגוסט 2025 הודיעה Ollama על שיתוף פעולה עם OpenAI, שבמסגרתו הגיעו אליה מודלי gpt-oss, המודלים הפתוחים של OpenAI. בזכות זה Ollama משמשת לא רק לשיחה, אלא גם כמנוע שעליו נשענים סוכני-AI, עורכי קוד ותוספים, שרוצים מודל שרץ על המחשב של המשתמש במקום מודל בתשלום בענן.
מתחת למכסה המנוע: llama.cpp, מנוע חדש ו-MLX
לפי ויקיפדיה, Ollama נשענת על llama.cpp, ספריית קוד פתוח להרצת מודלים, כמנוע ההרצה המקומי. ב-15 במאי 2025 הציגה החברה מנוע חדש משלה, שנועד בעיקר לתמוך טוב יותר במודלים רב-מודליים — כאלה שמבינים גם תמונות. לדבריה, המנוע החדש ממשיך להשתמש בספריית GGML, ספריית החישוב שעליה בנוי גם llama.cpp, ומשפר את האמינות, את הדיוק ואת ניהול הזיכרון. בין המודלים שנתמכו בהשקתו: Llama 4 של Meta, Gemma 3 של Google, Qwen 2.5 VL ו-Mistral Small 3.1. במחשבי מק עם שבבי Apple השיקה Ollama ב-30 במרץ 2026 גרסת תצוגה שמבוססת על MLX, ספריית למידת המכונה של Apple, וב-11 ביוני 2026 עדכנה את המנוע הזה — לדבריה, כדי לתת תשובות איכותיות ומהירות יותר ולצרוך פחות זיכרון. ב-20 בינואר 2026 נוספה גם יצירת תמונות מקומית, בשלב ניסיוני וב-macOS בלבד.
מודלי ענן: כשהמחשב הביתי לא מספיק
מודלים גדולים במיוחד דורשים יותר זיכרון ממה שיש ברוב המחשבים הביתיים. לכן, ב-19 בספטמבר 2025 השיקה Ollama, בתצוגה מקדימה, "מודלי ענן": מודלים גדולים שרצים על חומרה של מרכזי נתונים, אבל נקראים מאותם כלים מקומיים. מזהים אותם לפי הסיומת cloud בשם המודל, ובהשקה הוצעו בין השאר qwen3-coder בגודל 480 מיליארד פרמטרים ו-deepseek-v3.1 בגודל 671 מיליארד. השימוש בהם מחייב התחברות לחשבון. Ollama מצהירה ש"הענן של Ollama לא שומר את הנתונים שלכם", ובשאלות הנפוצות היא מבחינה בין שני המצבים: כשמריצים מקומית, "אנחנו לא רואים את הפרומפטים או את הנתונים שלכם"; במודלי ענן הבקשות מעובדות בשרתים שלה, אבל לא נשמרות ולא משמשות לאימון. לפי TechCrunch, המנויים נעים בין חינם ל-100 דולר בחודש, והחיוב נמדד לפי זמן שימוש במעבדים גרפיים ולא לפי מספר טוקנים. ב-24 בספטמבר 2025 נוסף גם ממשק לחיפוש ברשת. חשוב להבין את ההבדל: ברגע שבוחרים מודל ענן, השאלות כבר יוצאות מהמחשב, וההגנה עליהן תלויה בהתחייבות של החברה.
אבטחה: כשהשרת הביתי פתוח לכל העולם
ברירת המחדל של Ollama שמרנית: לפי התיעוד, השרת מאזין רק למחשב המקומי, בכתובת 127.0.0.1:11434. אבל מספיק לשנות הגדרה אחת, OLLAMA_HOST, לכתובת 0.0.0.0 כדי שהשרת יהיה נגיש מכל הרשת — ואם המחשב חשוף לאינטרנט, מכל העולם. ב-30 בינואר 2026 דיווח SecurityWeek על מחקר של חברות האבטחה SentinelOne ו-Censys, שבמשך 293 ימים איתר 175,000 שרתי Ollama חשופים ב-130 מדינות. כ-30% מהם היו בסין ומעט יותר מ-20% בארצות הברית, ו-56% ישבו ברשתות של ספקי תקשורת, כולל ספקי אינטרנט ביתיים. לפי המחקר, כמחצית מהם יכלו להריץ קוד, לגשת לממשקים ולפעול מול מערכות חיצוניות, והם היו נגישים "בלי הרשאה, ניטור או בקרת חיוב". החוקרים כתבו ש"הקורבן משלם את חשבון החשמל ואת עלויות התשתית, בזמן שהתוקף מקבל את הפלט", ושלפחות 201 שרתים הריצו תבניות שמסירות במפורש את מנגנוני הבטיחות של המודל. המסקנה המעשית למשתמש ביתי: כפי שהמחקר הראה, שרת Ollama שנפתח לרשת נגיש בלי הרשאה, ולכן לא כדאי לשנות את ברירת המחדל בלי הגנה מתאימה, כמו חומת אש או גישה מאובטחת.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
מה זה Ollama?
תוכנה בקוד פתוח (רישיון MIT) להורדה ולהרצה של מודלי-שפה פתוחים, כמו Llama, Gemma, Qwen ו-gpt-oss, ישירות על המחשב — דרך חלון צ'אט, שורת-פקודה או ממשק תכנות.
האם Ollama עולה כסף?
התוכנה והשימוש המקומי חינמיים. על מודלי הענן, לפי TechCrunch, יש מנויים שנעים בין חינם ל-100 דולר בחודש, והחיוב נמדד לפי זמן שימוש במעבדים גרפיים.
האם השאלות שלי נשארות במחשב?
כשמריצים מודל מקומי — כן. לפי Ollama, "אנחנו לא רואים את הפרומפטים או את הנתונים שלכם". מודלי ענן (עם הסיומת cloud) רצים בשרתים של החברה, שמצהירה שאינה שומרת את הבקשות ואינה משתמשת בהן לאימון.
איזה מחשב צריך כדי להריץ מודל?
זה תלוי בגודל המודל: מודל גדול יותר, וגם אורך הקשר גדול יותר, דורשים יותר זיכרון. בדיוק בגלל זה Ollama מציעה את המודלים הגדולים ביותר כמודלי ענן.
האם מסוכן להפעיל את Ollama?
ההגדרה הרגילה מאזינה רק למחשב המקומי. הסיכון מתחיל כשפותחים אותה לרשת: ב-2026 נמצאו 175,000 שרתי Ollama חשופים לאינטרנט, שאפשר היה להשתמש בהם בלי הרשאה.