דלג לתוכן

llama.cpp — מנוע קוד פתוח שמריץ מודלי שפה על מחשב רגיל

כלים וסוכנים

הגדרה

llama.cpp היא ספריית קוד פתוח בשפת C/C++‎ להרצת מודלי שפה על מחשב רגיל, גם בלי כרטיס מסך חזק — המנוע שעליו נבנו כלים כמו LM Studio, ובמקור גם Ollama.

💡 דוגמה

רואה חשבון רוצה שמודל יסכם לו מסמכים של לקוחות, בלי לשלוח אותם לשרת בחו"ל.

הוא מוריד קובץ מודל אחד, ו-llama.cpp מריץ אותו על הלפטופ שלו — גם בלי חיבור לאינטרנט.

מה זה llama.cpp: המנוע שמתחת למכסה

llama.cpp היא ספריית קוד פתוח שמריצה מודלי שפה גדולים — כלומר מבצעת את שלב ההסקה, שבו מודל שכבר אומן מקבל שאלה ומחזיר תשובה. היא נכתבה בשפות C ו-C++‎, ולפי ויקיפדיה מפותחת יחד עם GGML, ספריית חישוב כללית שגרגנוב התחיל לבנות לפניה. לצד הספרייה מגיעים כלי שורת-פקודה ושרת עם ממשק אינטרנט פשוט. לפי דף הפרויקט, המטרה המרכזית היא לאפשר הרצה של מודלי שפה ומודלים שמבינים גם תמונות "עם התקנה מינימלית וביצועים ברמה הגבוהה ביותר, על מגוון רחב של חומרה — מקומית ובענן". הדרך הנוחה להבין את מקומה היא להשוות למכונית: llama.cpp היא המנוע, ותוכנות כמו LM Studio הן המכונית שהמשתמש רואה ונוהג בה. לפי ויקיפדיה, llama.cpp נחשבת לתקן בפועל בתחום ההרצה המקומית. LM Studio משתמשת בה כמנוע, ו-Ollama נשענה עליה במקור — אם כי מאז 2025 היא מפעילה גם מנוע משלה, וכלים אחרים משתמשים גם במנועים אחרים. המשמעות לקורא: כלים מוכרים להרצה מקומית של מודלי שפה נשענים על הקוד הזה, גם כשהשם llama.cpp לא מופיע על המסך.

מרץ 2023: מודל שפה על מקבוק

את llama.cpp כתב ג'ורג'י גרגנוב, מפתח קוד פתוח מסופיה שבבולגריה. לפי ויקיפדיה, בסוף ספטמבר 2022 הוא התחיל לבנות את GGML, ולפני llama.cpp פיתח את whisper.cpp — גרסה שמריצה את Whisper, מודל זיהוי הדיבור של OpenAI. ב-10 במרץ 2023 פרסם גרגנוב ב-GitHub את הגרסה הראשונה של llama.cpp. הרקע: באותה תקופה פרסמה פייסבוק את LLaMA, מודל שפה שהוצע לחוקרים בלבד, בתנאי שימוש מחמירים ולא לשימוש מסחרי. לפי המפתח והבלוגר סיימון וויליסון, בתוך ימים ספורים הופיע ברשת קישור לא רשמי להורדת קבצי המודל. לפי וויליסון, המטרה שהופיעה אז בדף הפרויקט הייתה "להריץ את המודל בכימות של 4 ביט על מקבוק". כימות כזה הקטין את המודל הקטן ביותר, בגודל 7 מיליארד פרמטרים, ל-4 ג'יגה-בייט, ואת המודל בגודל 13 מיליארד לקצת פחות מ-8 ג'יגה-בייט. וויליסון הריץ אותו על הלפטופ שלו, וכתב שמודלי השפה עוברים "את רגע ה-Stable Diffusion שלהם" — בדומה לשחרור Stable Diffusion באוגוסט 2022, שלדבריו הצית את גל העניין בבינה מלאכותית יוצרת. לפי ויקיפדיה, הפרויקט צבר תאוצה בקרב משתמשים בלי חומרה ייעודית, משום שהוא רץ גם על מעבד רגיל בלבד; תמיכה במעבדים גרפיים ובשבבי AI נוספה בהמשך.

הטריק המרכזי: כימות, או איך מכווצים מודל

מודל שפה הוא בעיקר רשימה ענקית של מספרים, ה"משקלים". בדרך כלל כל משקל נשמר בדיוק גבוה, וזה דורש הרבה זיכרון. llama.cpp נשענת על כימות: שמירת כל משקל בפחות ביטים. לפי ויקיפדיה, כימות מקטין את צריכת הזיכרון ויכול להאיץ את ההרצה, אבל עלול לפגוע בדיוק המודל. לפי דף הפרויקט, llama.cpp תומכת בכימות של 1.5, 2, 3, 4, 5, 6 ו-8 ביט. בתיעוד של Hugging Face מתוארות השיטות השונות; למשל, השיטה שנקראת Q4_K שומרת את המשקלים ב-4.5 ביט למשקל בממוצע. מי שמוריד מודל ורואה בשם הקובץ קיצור כמו Q4_K_M או Q8_0, רואה בעצם את שיטת הכיווץ שבה הוא נוצר. יכולת חשובה נוספת היא הרצה משולבת: לפי דף הפרויקט, llama.cpp יודעת לחלק מודל בין המעבד הרגיל לבין המעבד הגרפי, וכך להאיץ חלקית גם מודלים שגדולים מהזיכרון של כרטיס המסך. הפרויקט מגדיר את שבבי Apple כ"אזרח סוג א'", כלומר יעד שהקוד ממוטב עבורו במיוחד. לפי ויקיפדיה, הוא תומך גם בפענוח ספקולטיבי, שיטה להאצת ייצור הטקסט, ובממשקים שתואמים לממשק התכנות של OpenAI.

GGUF: הקובץ שמסתובב ברשת

כדי שמודל ירוץ ב-llama.cpp, הוא צריך להיות בפורמט שהיא מבינה. לפי ויקיפדיה, באוגוסט 2023 הציג הפרויקט את GGUF, פורמט קובץ בינארי שמחזיק בקובץ יחיד גם את המשקלים וגם את כל המידע שנדרש כדי להריץ את המודל, כמו אוצר המילים שלו ואורך ההקשר שהוא תומך בו. GGUF החליף פורמטים קודמים, והוא נוצר בדרך כלל מהמרה של מודל שפותח בספרייה אחרת, כמו PyTorch. לפי התיעוד של Hugging Face, את הפורמט פיתח גרגנוב, והוא "מותאם לטעינה ושמירה מהירות של מודלים". באתר Hugging Face, פלטפורמת המודלים הפתוחים, יש סינון ייעודי לקבצי GGUF וכלי שממיר ומכווץ מודלים לפורמט הזה. המשתמש צריך לבחור את רמת הכימות שמתאימה לזיכרון של המחשב; אפליקציית Llama של הצוות, למשל, בוחרת לבד את "הדיוק הגבוה ביותר שנכנס בזיכרון". לפי ויקיפדיה, llama.cpp תומכת במשפחות מודלים רבות, ובהן Llama, ‏Mistral, ‏Gemma, ‏DeepSeek, ‏gpt-oss, ‏Phi ו-Qwen.

מפרויקט של מפתח אחד לתשתית: ggml.ai ו-Hugging Face

לפי אתר החברה, ב-2023 ייסד גרגנוב את ggml.ai, חברה שנועדה לתמוך בפיתוח של GGML; את מימון הסיד המוקדם נתנו נאט פרידמן ודניאל גרוס. ב-20 בפברואר 2026 הודיעה Hugging Face שצוות GGML ו-llama.cpp מצטרף אליה. בהודעה הצהירו הצוות ו-Hugging Face שגרגנוב והצוות "ממשיכים להקדיש 100% מזמנם לתחזוקת llama.cpp" ושומרים על עצמאות מלאה בהחלטות הטכניות, ושהפרויקט יישאר "קוד פתוח ב-100% ומונע-קהילה". מאגר הקוד, שמופץ ברישיון MIT, נמצא היום תחת הארגון ggml-org ב-GitHub. ב-3 בספטמבר 2026 נוסף פרק: NVIDIA הודיעה על הסכם לרכישת Hugging Face, שנחתם יום קודם. בבלוג של NVIDIA נמסר סכום של 12,930,300,000 דולר, ובדיווח לרשות ניירות הערך האמריקאית נכתב שההשלמה צפויה במחצית הראשונה של 2027, בכפוף לתנאי סגירה ולאישורים רגולטוריים. NVIDIA התחייבה ש-Hugging Face תישאר פלטפורמה פתוחה, וש"לא יידרש מחשוב של NVIDIA" כדי לבנות או לפרוס דרכה. נכון ל-4 באוקטובר 2026, העסקה עדיין לא הושלמה. הפופולריות של הפרויקט ניכרת גם במספרים: לפי ויקיפדיה, במאי 2026 היו למאגר יותר מ-109 אלף כוכבים ב-GitHub, ובתחילת אוקטובר 2026 הציג המאגר כ-130 אלף. כוכב מעיד על עניין של מפתחים, ולא בהכרח על שימוש קבוע.

איך משתמשים בזה בפועל

נכון לאוקטובר 2026, דף הפרויקט מציע כמה דרכי התקנה: סקריפט התקנה, Docker, קבצים מוכנים להורדה, או בנייה מהקוד. אחרי ההתקנה, פקודה אחת מורידה מודל מ-Hugging Face ופותחת איתו שיחה בחלון הפקודות, ופקודה אחרת מפעילה שרת שתואם לממשק של OpenAI, עם ממשק אינטרנט מובנה לשיחה. המשמעות: תוכנה שמשתמשת בממשקים הנתמכים יכולה להתחבר לשרת המקומי, לרוב בשינוי כתובת השרת ושם המודל — אם כי לא כל תכונה של שירות ענן נתמכת. למי שלא רוצה לעבוד מול חלון פקודות, צוות llama.cpp ו-Hugging Face מציעים אפליקציה בשם Llama למק ול-Windows. לפי האתר שלה, ההורדה למק שוקלת מגה-בייט אחד (המודלים עצמם מורדים בנפרד), והאפליקציה חינמית, בקוד פתוח, ש"עובדת גם בלי חיבור לאינטרנט". האפליקציה בודקת את המחשב ובוחרת לבד את רמת הכימות ואת אורך ההקשר שמתאימים לזיכרון, ומשחררת מודל מהזיכרון אחרי חמש דקות בלי שימוש. האתר גם ממליץ על נקודת פתיחה לפי כמות הזיכרון: Gemma 4 למק עם 16 ג'יגה-בייט ומעלה, GPT-OSS ל-24 ג'יגה-בייט ומעלה, ו-Qwen 3.8 ל-32 ג'יגה-בייט ומעלה. יתרון מרכזי הוא פרטיות: מודל שרץ על המחשב עצמו לא צריך שרת חיצוני כדי לענות, ולכן האפליקציה יכולה לעבוד גם בלי אינטרנט.

ממודל שמשוחח לסוכן שפועל

llama.cpp לא נשארה כלי לשיחה בלבד. כדי שמודל יוכל לבקש הפעלה של כלי — קריאה לפונקציה או העברת נתונים לתוכנה אחרת — הוא צריך להחזיר תשובה במבנה קבוע ולא טקסט חופשי; את הפעולה עצמה מבצעת התוכנה שמחוברת אליו. לפי ויקיפדיה, llama.cpp תומכת בעיצוב פלט מבוסס-דקדוק בפורמט JSON: אפשר להגדיר מראש את המבנה, והמודל מוגבל לייצר רק פלט שעומד בו. הדקדוק קובע את צורת התשובה, לא את נכונותה. לפי אתר אפליקציית Llama, השרת המקומי תומך גם בקריאה לכלים, בפלט מובנה ובתמונות, ומציע ממשקים שתואמים גם ל-OpenAI וגם ל-Anthropic — כך שסוכני תכנות, עורכי קוד ותוכנות שנבנו לעבוד מול שירות ענן יכולים לעבוד מול מודל שרץ על המחשב. הפרויקט ממשיך להתרחב גם לסוגי מכשירים ולסוגי מודלים: לפי ויקיפדיה, ב-10 באפריל 2025 נוספה ספרייה שהחיתה את התמיכה במודלים שמבינים גם תמונות, וב-17 בדצמבר 2025 נוספה תמיכה בהרצה מואצת ובשילוב באפליקציות במכשירי Android ו-ChromeOS. בגרסה 0.5.0, שיצאה ב-23 בספטמבר 2026, נוספה בין השאר אפשרות שפונקציה שהמודל מפעיל תחזיר לו גם תמונה.

אבטחה: גם קובץ מודל יכול להיות מלכודת

הרצה מקומית לא פוטרת מזהירות. ב-2024 פרסמה חברת Databricks מחקר שמצא בקוד שקורא קבצי GGUF כמה פרצות זיכרון. לפי Databricks, הספרייה לא בדקה כראוי את הקובץ שהיא טוענת, ולכן "תוקף יכול לנצל את הפרצות כדי להריץ קוד על המחשב של הקורבן באמצעות קובץ gguf שנבנה במיוחד". החברה עבדה עם צוות ggml.ai, והתיקונים נכנסו לקוד ב-29 בינואר 2024. המקרה ממחיש עיקרון כללי: קובץ מודל הוא קובץ שמגיע מהאינטרנט, בדיוק כמו תוכנה. ההמלצות המעשיות פשוטות — להוריד מודלים ממקורות מוכרים, ולעדכן את llama.cpp ואת הכלים שבנויים עליה, כדי לקבל תיקוני אבטחה כאלה.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

המנוע מול שתי אפליקציות שנשענות עליו (נכון לאוקטובר 2026)
llama.cppOllamaLM Studio
מה זהספריית הרצה, עם כלי שורת-פקודה ושרת מקומיתוכנה להורדה ולהרצה של מודלים, עם שורת-פקודה, אפליקציה וממשק תכנותאפליקציה גרפית להרצת מודלים, לצד כלי שורת-פקודה
הקשר ל-llama.cppזה המנוע עצמונשענה עליו; מאז מאי 2025 גם מנוע נוסף משלה, שבנוי על GGMLמשתמשת בו כמנוע, ובמחשבי מק גם ב-MLX של Apple
רישיוןקוד פתוח, רישיון MITקוד פתוח, רישיון MITקניינית (קוד סגור)
ממשק לתוכנות אחרותשרת מקומי עם ממשק תואם ל-OpenAIשרת מקומי עם ממשקים תואמים ל-OpenAI ול-Anthropicשרת מקומי עם ממשקים תואמים ל-OpenAI ול-Anthropic

שאלות נפוצות ❓

מה זה llama.cpp?

ספריית קוד פתוח בשפת C/C++‎ שמריצה מודלי שפה על מחשב רגיל, כולל על מעבד בלבד, בלי צורך בכרטיס מסך חזק. גרגנוב פרסם את הגרסה הראשונה שלה במרץ 2023.

מה ההבדל בין llama.cpp ל-Ollama או ל-LM Studio?

llama.cpp היא המנוע; Ollama ו-LM Studio הן תוכנות נוחות יותר למשתמש. LM Studio משתמשת ב-llama.cpp כמנוע, ו-Ollama נשענה עליה במקור, ומאז 2025 מפעילה גם מנוע משלה על בסיס GGML.

מה זה קובץ GGUF?

פורמט הקבצים של llama.cpp, שהוצג באוגוסט 2023. קובץ אחד מחזיק את משקלי המודל ואת המידע שנדרש להרצה. הקיצורים בשם, כמו Q4_K_M, מציינים כמה המודל כווץ.

האם השאלות שלי נשארות במחשב?

כשהמודל רץ ב-llama.cpp על המחשב שלכם, הוא לא צריך שרת חיצוני, ואפליקציית Llama של הצוות מוצגת כעובדת גם בלי אינטרנט. כדאי רק להוריד מודלים ממקורות מוכרים ולעדכן את התוכנה.

מי עומד מאחורי llama.cpp היום?

המפתח ג'ורג'י גרגנוב והצוות שלו, שהצטרפו ל-Hugging Face בפברואר 2026. בספטמבר 2026 הודיעה NVIDIA על הסכם לרכישת Hugging Face, שהשלמתו צפויה במחצית הראשונה של 2027, בכפוף לאישורים. הפרויקט עצמו נשאר קוד פתוח ברישיון MIT.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו