MODELNEW

איך להריץ מודל AI מקומית

מדריך התחלה להרצת מודל שפה על המחשב שלכם בלי אינטרנט - מה החומרה שצריך, ובחירה בין Ollama, LM Studio ו-llama.cpp.

מערכת בינה AI טופמודלים8 בספטמבר 20263 min1 sources
מחשב נייח כהה עם מודל שפה זוהר רץ מקומית, בלי חיבור רשת גלוי
מחשב נייח כהה עם מודל שפה זוהר רץ מקומית, בלי חיבור רשת גלוי

הסיבה הנפוצה ביותר להריץ מודל AI מקומית היא לא ביצועים - זו פרטיות ועלות קבועה. שום קלט לא יוצא מהמחשב, ואין חיוב לפי טוקן. המחיר: מודל מקומי כמעט תמיד חלש יותר ממודל ענן מוביל באותו נפח, וההגדרה הראשונית דורשת קצת יותר סבלנות מפתיחת דפדפן.

מה צריך מבחינת חומרה

כלל אצבע: מודל של עד 3B פרמטרים (למשל Llama 3.2 3B) רץ בנוחות אפילו על 8GB זיכרון מערכת. למודל אמיתי בשימוש יומיומי (7B-8B פרמטרים) צריך בערך 16GB RAM ורצוי 6GB+ VRAM בכרטיס מסך נפרד - זה מספיק למודל בכימות Q4, פורמט שמכווץ את גודל המודל בלי לפגוע דרמטית באיכות. מודלים גדולים יותר (13B ומעלה) דורשים 32GB RAM ומעלה, ו-70B כבר נכנס לטריטוריה של תחנת עבודה ייעודית.

שלושה כלים להרצה, ולמי כל אחד מתאים

כליממשקמתאים ל
Ollamaשורת פקודה, API מקומימפתחים שרוצים לשלב מודל מקומי בקוד
LM Studioאפליקציית דסקטופ גרפיתמי שרוצה חוויה כמו ChatGPT בלי טרמינל
llama.cppספריית C/C++ ברמה נמוכהמי שבונה כלי משלו או צריך שליטה מקסימלית בביצועים

בפועל Ollama ו-LM Studio שניהם בנויים מעל llama.cpp - הוא המנוע שמריץ בפועל את המודל על החומרה, והם עוטפים אותו בממשק נוח יותר. מי שלא בטוח - Ollama הוא נקודת ההתחלה הכי פשוטה למי שכבר נוח עם שורת פקודה, ו-LM Studio למי שמעדיף לא לגעת בטרמינל בכלל.

מחשב נייח כהה עם מודל שפה זוהר רץ מקומית, בלי חיבור רשת גלוי

מה זה כימות, ולמה זה משנה

מודל AI שמור כטבלת ענקית של מספרים - משקלים. כימות (quantization) הוא תהליך שמקטין את הדיוק של המספרים האלה (למשל מ-16 סיביות ל-4 סיביות לכל משקל), וכך מקטין דרמטית את גודל הקובץ ואת כמות הזיכרון הדרושה להרצה - במחיר קטן של ירידה באיכות הפלט. Q4 הוא נקודת האיזון הנפוצה ביותר: הפחתה משמעותית בגודל, בלי ירידה שרוב המשתמשים מרגישים בשיחה רגילה. Q8 קרוב יותר למקור המלא ודורש יותר זיכרון; Q2 קטן מאוד אבל הפגיעה באיכות כבר מורגשת.

כמה RAM לפי גודל מודל (כימות Q4) 3B 8GB RAM 7-8B 16GB RAM 13B 32GB RAM 70B תחנת עבודה
ככל שהמודל גדול יותר, קפיצת הדרישה בזיכרון לא ליניארית

איך יודעים שהמודל מתאים למכונה שלכם

  • המודל נטען בלי שגיאת "out of memory" - אם זה קורה, יורדים לגודל כימות נמוך יותר (Q4 במקום Q8) או למודל עם פחות פרמטרים.
  • קצב היצירה סביר לשימוש בפועל - מתחת ל-5 טוקנים לשנייה מרגיש איטי מדי לשיחה אינטראקטיבית.
  • המחשב לא נחסם לגמרי בזמן ריצה - אם כל שאר האפליקציות קופאות, המודל גדול מדי לחומרה.

איפה זה נשבר

מודל מקומי בעברית בדרך כלל חלש יותר מאשר באנגלית - רוב המודלים הפתוחים אומנו בעיקר על טקסט אנגלי, ואיכות הניסוח בעברית משתנה משמעותית בין משפחות מודלים. גם עדכון מודל מקומי הוא ידני לגמרי - בניגוד ל-API ענן שמתעדכן אוטומטית לגרסה החדשה, כאן צריך להוריד בעצמכם גרסה חדשה כשהיא יוצאת ולבדוק שהיא אכן טובה יותר למשימה שלכם, לא רק "חדשה יותר".

ויש גם מגבלה שלרוב לא חושבים עליה מראש: מודל מקומי תופס מקום קבוע בדיסק - מודל בגודל 7B בכימות Q4 יכול לתפוס כמה ג'יגה-בייט, ומי שמנסה כמה מודלים שונים כדי להשוות ביניהם מוצא את עצמו עם עשרות ג'יגה-בייט תפוסים על קבצי מודלים ששוכבים בלי שימוש - שווה למחוק מודלים שלא בשימוש פעיל, לא רק להוסיף חדשים.

מה לנסות עכשיו

מתקינים Ollama, מורידים מודל קטן כמו Llama 3.2 3B או Gemma, ובודקים כמה זמן לוקח לקבל תשובה לשאלה פשוטה. אם התגובה סבירה והמחשב לא נחנק - אפשר לעלות בהדרגה לגודל מודל שמאזן בין איכות למהירות שעדיין נוחה לעבודה יומיומית.

כדאי גם להריץ באותו זמן משימה שגרתית אחת שאתם עושים לעיתים קרובות בענן - סיכום, תרגום, כתיבת קוד קצר - ולהשוות ישירות בין התוצאה המקומית לתוצאה מהמודל הענן שכבר מכירים. ההשוואה הישירה הזו, לא בדיקה תיאורטית, היא שתגיד לכם אם המודל המקומי מספיק טוב למשימות שבאמת חשובות לכם, או שהוא מתאים רק לניסויים.

שאלות נפוצות

צריך כרטיס מסך כדי להריץ מודל מקומי?

לא בהכרח. מודלים קטנים (עד 7B פרמטרים בכימות Q4) רצים סביר על מעבד ו-16GB זיכרון מערכת, אבל כרטיס מסך עם VRAM מספיק מאיץ את המהירות משמעותית.

האם מודל מקומי באמת לא שולח כלום לאינטרנט?

אם הוא רץ דרך Ollama, LM Studio או llama.cpp במצב סטנדרטי - כן, כל העיבוד קורה על המכונה עצמה. שווה לוודא זאת בבדיקת תעבורת רשת אם הפרטיות קריטית.

SOURCES

  1. overchat.ai - Local LLM Hardware Requirements 2026 · נבדק 8 בספטמבר 2026

קשור לזה